Loose lips sink ships: Mitigating Length Bias in Reinforcement Learning from Human Feedback.
Wei Shen, Rui Zheng, WenYu Zhan, Jun Zhao, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang
Browse the full EMNLP paper archive.
Wei Shen, Rui Zheng, WenYu Zhan, Jun Zhao, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang
Browse the full EMNLP paper archive.