AIPO: Adaptive Information Guided Token-Level Reinforcement Learning for Large Language Model Reasoning.
Bin Chen, Hongfei Ye, Huiyang Wang, Wenxi Liu, Yu Zhang, Furui Liu
Browse the full ACL paper archive.
Bin Chen, Hongfei Ye, Huiyang Wang, Wenxi Liu, Yu Zhang, Furui Liu
Browse the full ACL paper archive.