Skip to content

Language Model Self-improvement by Reinforcement Learning Contemplation.

Jing-Cheng Pang, Pengyuan Wang, Kaiyuan Li, Xiong-Hui Chen, Jiacheng Xu, Zongzhang Zhang, Yang Yu

VenueA*ICLR
Year2024
ProceedingsICLR

Browse the full ICLR paper archive.