Skip to content

Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning.

Xin Guan, Zijian Li, Shen Huang, Pengjun Xie, Jingren Zhou, Jiuxin Cao

VenueA*ACL
Year2026
ProceedingsACL (1)

Browse the full ACL paper archive.