PGPO: Enhancing Agent Reasoning via Pseudocode-style Planning Guided Preference Optimization.
Zouying Cao, Runze Wang, Yifei Yang, Xinbei Ma, Xiaoyong Zhu, Bo Zheng, Hai Zhao
Browse the full ACL paper archive.
Zouying Cao, Runze Wang, Yifei Yang, Xinbei Ma, Xiaoyong Zhu, Bo Zheng, Hai Zhao
Browse the full ACL paper archive.