Skip to content

DUAL RM: Beyond Rule-based Preference Reward Modeling via Meta-Reward.

Xiaobo Liang, Wanfu Wang, Qipeng Huang, Yuyang Ding, Zecheng Tang, Yixin Ji, Qianben Chen, Zhe Zhao, Kehai Chen, Juntao Li, Min Zhang

VenueA*ACL
Year2026
ProceedingsACL (1)

Browse the full ACL paper archive.