Towards A Better Initial Policy Model For Scalable Long-CoT Reinforcement Learning.
Bofei Gao, Yejie Wang, Yibo Miao, Ruoyu Wu, Feifan Song, Longhui Yu, Tianyu Liu, Baobao Chang
Browse the full ACL paper archive.
Bofei Gao, Yejie Wang, Yibo Miao, Ruoyu Wu, Feifan Song, Longhui Yu, Tianyu Liu, Baobao Chang
Browse the full ACL paper archive.