Skip to content

VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training.

Dingwei Zhu, Shihan Dou, Zhiheng Xi, Senjie Jin, Guoqiang Zhang, Jiazheng Zhang, Junjie Ye, Mingxu Chai, Enyu Zhou, Ming Zhang, Yuhui Wang, Caishuang Huang, Chenhao Huang, Yunke Zhang, Yuran Wang, Tao Gui, Qi Zhang, Xipeng Qiu, Xuanjing Huang

VenueA*ACL
Year2026
ProceedingsACL (1)

Browse the full ACL paper archive.