Can Prompt Difficulty be Online Predicted for Accelerating RL Finetuning of Reasoning Models?
Yun Qu, Qi Wang, Yixiu Mao, Vincent Tao Hu, Bjrn Ommer, Xiangyang Ji
Browse the full KDD paper archive.
Yun Qu, Qi Wang, Yixiu Mao, Vincent Tao Hu, Bjrn Ommer, Xiangyang Ji
Browse the full KDD paper archive.