Skip to content

Improving Discriminative Capability of Reward Models in RLHF Using Contrastive Learning.

Lu Chen, Rui Zheng, Binghai Wang, Senjie Jin, Caishuang Huang, Junjie Ye, Zhihao Zhang, Yuhao Zhou, Zhiheng Xi, Tao Gui, Qi Zhang, Xuanjing Huang

VenueA*EMNLP
Year2024
ProceedingsEMNLP

Browse the full EMNLP paper archive.