Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning.
Xin Guan, Zijian Li, Shen Huang, Pengjun Xie, Jingren Zhou, Jiuxin Cao
Browse the full ACL paper archive.
Xin Guan, Zijian Li, Shen Huang, Pengjun Xie, Jingren Zhou, Jiuxin Cao
Browse the full ACL paper archive.