Skip to content

Towards A Better Initial Policy Model For Scalable Long-CoT Reinforcement Learning.

Bofei Gao, Yejie Wang, Yibo Miao, Ruoyu Wu, Feifan Song, Longhui Yu, Tianyu Liu, Baobao Chang

VenueA*ACL
Year2025
ProceedingsACL (Findings)

Browse the full ACL paper archive.