Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data.
Zhenwen Liang, Yujun Zhou, Sidi Lu, Xiangliang Zhang, Haitao Mi, Dong Yu
Browse the full ACL paper archive.
Zhenwen Liang, Yujun Zhou, Sidi Lu, Xiangliang Zhang, Haitao Mi, Dong Yu
Browse the full ACL paper archive.