Skip to content

Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning.

Taojie Zhu, Dongyang Xu, Ding Zou, Sen Zhao, Qiaobo Hao, Zhiguo Yang, Yonghong He

VenueA*ACL
Year2026
ProceedingsACL (Findings)

Browse the full ACL paper archive.