Skip to content

Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models.

Binghai Wang, Yantao Liu, Yuxuan Liu, Tianyi Tang, Shenzhi Wang, Chang Gao, Chujie Zheng, Yichang Zhang, Le Yu, Shixuan Liu, Tao Gui, Qi Zhang, Xuanjing Huang, Bowen Yu, Fei Huang, Junyang Lin

VenueA*ACL
Year2026
ProceedingsACL (1)

Browse the full ACL paper archive.