Skip to content

Optimizing Language Models with Fair and Stable Reward Composition in Reinforcement Learning.

Jiahui Li, Hanlin Zhang, Fengda Zhang, Tai-Wei Chang, Kun Kuang, Long Chen, Jun Zhou

VenueA*EMNLP
Year2024
ProceedingsEMNLP

Browse the full EMNLP paper archive.