Skip to content

Self-Generated Critiques Boost Reward Modeling for Language Models.

Yue Yu, Zhengxing Chen, Aston Zhang, Liang Tan, Chenguang Zhu, Richard Yuanzhe Pang, Yundi Qian, Xuewei Wang, Suchin Gururangan, Chao Zhang, Melanie Kambadur, Dhruv Mahajan, Rui Hou

VenueANAACL
Year2025
ProceedingsNAACL (Long Papers)

Browse the full NAACL paper archive.