Skip to content

Vanishing Gradients in Reinforcement Finetuning of Language Models.

Noam Razin, Hattie Zhou, Omid Saremi, Vimal Thilak, Arwen Bradley, Preetum Nakkiran, Joshua M. Susskind, Etai Littwin

VenueA*ICLR
Year2024
ProceedingsICLR

Browse the full ICLR paper archive.