Back to Basics: Revisiting REINFORCE-Style Optimization for Learning from Human Feedback in LLMs.
Arash Ahmadian, Chris Cremer, Matthias Gall, Marzieh Fadaee, Julia Kreutzer, Olivier Pietquin, Ahmet stn, Sara Hooker
Browse the full ACL paper archive.