GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning.
Yi Chen, Yuying Ge, Rui Wang, Yixiao Ge, Junhao Cheng, Ying Shan, Xihui Liu
Browse the full ACL paper archive.
Yi Chen, Yuying Ge, Rui Wang, Yixiao Ge, Junhao Cheng, Ying Shan, Xihui Liu
Browse the full ACL paper archive.