Skip to content

Reward Model Learning vs. Direct Policy Optimization: A Comparative Analysis of Learning from Human Preferences.

Andi Nika, Debmalya Mandal, Parameswaran Kamalaruban, Georgios Tzannetos, Goran Radanovic, Adish Singla

VenueA*ICML
Year2024
ProceedingsICML

Browse the full ICML paper archive.