TAPO: Dynamic Teacher and Perturbed Answer Injection for Policy Optimization.
Maowei Jiang, Zihang Wang, Qi Wang, Peter Bs, Moquan Chen, Yifan Wang, Quangao Liu, Ruiqi Li, Pengyu Zeng, Ruikai Liu, Alan Liang, Yansong Xu, Yusong Hu, Chaoran Zhang, Zhiyong Dong
Browse the full AAAI paper archive.