Multi-Task Reinforcement Learning for Enhanced Multimodal LLM-as-a-Judge.
Junjie Wu, Xuan Kan, Zihao He, Shunwen Tan, Bo Pan, Kaitai Zhang
Browse the full ACL paper archive.
Junjie Wu, Xuan Kan, Zihao He, Shunwen Tan, Bo Pan, Kaitai Zhang
Browse the full ACL paper archive.