MGPO: Thinking with Images via Multi-Turn Grounding-Based Reinforcement Learning.
Xinyu Huang, Yuhao Dong, Weiwei Tian, Bo Li, Rui Feng, Ziwei Liu
Browse the full ACL paper archive.
Xinyu Huang, Yuhao Dong, Weiwei Tian, Bo Li, Rui Feng, Ziwei Liu
Browse the full ACL paper archive.