Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling.
Jiaxuan Wang, Yulan Hu, Wenjin Yang, Zheng Pan, Xin Li, Lan-Zhe Guo
Browse the full ACL paper archive.
Jiaxuan Wang, Yulan Hu, Wenjin Yang, Zheng Pan, Xin Li, Lan-Zhe Guo
Browse the full ACL paper archive.