Your Reasoning Model is Secretly a Reward Model - Optimization-Free Verification from Experience.
Zhenwen Liang, Ruosen Li, Yujun Zhou, Linfeng Song, Dian Yu, Xinya Du, Haitao Mi, Dong Yu
Browse the full ACL paper archive.
Zhenwen Liang, Ruosen Li, Yujun Zhou, Linfeng Song, Dian Yu, Xinya Du, Haitao Mi, Dong Yu
Browse the full ACL paper archive.