SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language Models.
Jiale Cheng, Xiao Liu, Cunxiang Wang, Xiaotao Gu, Yida Lu, Dan Zhang, Yuxiao Dong, Jie Tang, Hongning Wang, Minlie Huang
Browse the full ICLR paper archive.