Skip to content

Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data.

Zhenwen Liang, Yujun Zhou, Sidi Lu, Xiangliang Zhang, Haitao Mi, Dong Yu

VenueA*ACL
Year2026
ProceedingsACL (2)

Browse the full ACL paper archive.