Skip to content

Towards Pareto-Efficient RLHF: Paying Attention to a Few High-Reward Samples with Reward Dropout.

Changhun Lee, Chiehyeon Lim

VenueA*EMNLP
Year2024
ProceedingsEMNLP (Findings)

Browse the full EMNLP paper archive.