Towards Hierarchical Multi-Step Reward Models for Enhanced Reasoning in Large Language Models.
Teng Wang, Zhangyi Jiang, Zhenqi He, Hailei Gong, Shenyang Tong, Wenhan Yang, Zeyu Li, Yanan Zheng, Zifan He, Zewen Ye, Shengjie Ma, Jianping Zhang
Browse the full ACL paper archive.