Leftover Lunch: Advantage-based Offline Reinforcement Learning for Language Models.
Ashutosh Baheti, Ximing Lu, Faeze Brahman, Ronan Le Bras, Maarten Sap, Mark O. Riedl
Browse the full ICLR paper archive.
Ashutosh Baheti, Ximing Lu, Faeze Brahman, Ronan Le Bras, Maarten Sap, Mark O. Riedl
Browse the full ICLR paper archive.