Skip to content

Reinforcement Learning for Large Language Models via Group Preference Reward Shaping.

Huaisheng Zhu, Siyuan Xu, Hangfan Zhang, Teng Xiao, Zhimeng Guo, Shijie Zhou, Shuyue Hu, Vasant G. Honavar

VenueA*EMNLP
Year2025
ProceedingsEMNLP

Browse the full EMNLP paper archive.