SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models.
Yifu Huo, Chenglong Wang, Ziming Zhu, Shunjie Xing, Peinan Feng, Tongran Liu, Qiaozhi He, Tianhua Zhou, Changxiaojia, JingBo Zhu, Zhengtao Yu, Tong Xiao
Browse the full ACL paper archive.