Skip to content

Back to Basics: Revisiting REINFORCE-Style Optimization for Learning from Human Feedback in LLMs.

Arash Ahmadian, Chris Cremer, Matthias Gall, Marzieh Fadaee, Julia Kreutzer, Olivier Pietquin, Ahmet stn, Sara Hooker

VenueA*ACL
Year2024
ProceedingsACL (1)

Browse the full ACL paper archive.