Skip to content

Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning.

Joey Hong, Anca D. Dragan, Sergey Levine

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.