Skip to content

Reward Model Ensembles Help Mitigate Overoptimization.

Thomas Coste, Usman Anwar, Robert Kirk, David Krueger

VenueA*ICLR
Year2024
ProceedingsICLR

Browse the full ICLR paper archive.