Skip to content

Leftover Lunch: Advantage-based Offline Reinforcement Learning for Language Models.

Ashutosh Baheti, Ximing Lu, Faeze Brahman, Ronan Le Bras, Maarten Sap, Mark O. Riedl

VenueA*ICLR
Year2024
ProceedingsICLR

Browse the full ICLR paper archive.