Skip to content

The Accuracy Paradox in RLHF: When Better Reward Models Don't Yield Better Language Models.

Yanjun Chen, Dawei Zhu, Yirong Sun, Xinghao Chen, Wei Zhang, Xiaoyu Shen

VenueA*EMNLP
Year2024
ProceedingsEMNLP

Browse the full EMNLP paper archive.