Skip to content

Fine-Tuning Language Models with Reward Learning on Policy.

Hao Lang, Fei Huang, Yongbin Li

VenueANAACL
Year2024
ProceedingsNAACL-HLT

Browse the full NAACL paper archive.