Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning.
Taojie Zhu, Dongyang Xu, Ding Zou, Sen Zhao, Qiaobo Hao, Zhiguo Yang, Yonghong He
Browse the full ACL paper archive.
Taojie Zhu, Dongyang Xu, Ding Zou, Sen Zhao, Qiaobo Hao, Zhiguo Yang, Yonghong He
Browse the full ACL paper archive.