Skip to content

Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF.

Banghua Zhu, Michael I. Jordan, Jiantao Jiao

VenueA*ICML
Year2024
ProceedingsICML

Browse the full ICML paper archive.