The Accuracy Paradox in RLHF: When Better Reward Models Don't Yield Better Language Models.
Yanjun Chen, Dawei Zhu, Yirong Sun, Xinghao Chen, Wei Zhang, Xiaoyu Shen
Browse the full EMNLP paper archive.
Yanjun Chen, Dawei Zhu, Yirong Sun, Xinghao Chen, Wei Zhang, Xiaoyu Shen
Browse the full EMNLP paper archive.