MetaAct-RL: Training Language Models for Reasoning Through Meta-Action-Based Reinforcement Learning.
Zhiheng Xi, Yuhui Wang, Yiwen Ding, Guanyu Li, Senjie Jin, Shichun Liu, Jixuan Huang, Dingwen Yang, Jiafu Tang, Boyang Hong, Junjie Ye, Shihan Dou, Ming Zhang, Jian Guan, Wei Wu, Rui Zheng, Tao Gui, Qi Zhang, Xuanjing Huang
Browse the full AAAI paper archive.