Reward Model Learning vs. Direct Policy Optimization: A Comparative Analysis of Learning from Human Preferences.
Andi Nika, Debmalya Mandal, Parameswaran Kamalaruban, Georgios Tzannetos, Goran Radanovic, Adish Singla
Browse the full ICML paper archive.