Skip to content

Loose lips sink ships: Mitigating Length Bias in Reinforcement Learning from Human Feedback.

Wei Shen, Rui Zheng, WenYu Zhan, Jun Zhao, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang

VenueA*EMNLP
Year2023
ProceedingsEMNLP (Findings)

Browse the full EMNLP paper archive.