Skip to content

Reward Modeling Requires Automatic Adjustment Based on Data Quality.

Binghai Wang, Rui Zheng, Lu Chen, Zhiheng Xi, Wei Shen, Yuhao Zhou, Dong Yan, Tao Gui, Qi Zhang, Xuanjing Huang

VenueA*EMNLP
Year2024
ProceedingsEMNLP (Findings)

Browse the full EMNLP paper archive.