Skip to content

SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models.

Yifu Huo, Chenglong Wang, Ziming Zhu, Shunjie Xing, Peinan Feng, Tongran Liu, Qiaozhi He, Tianhua Zhou, Changxiaojia, JingBo Zhu, Zhengtao Yu, Tong Xiao

VenueA*ACL
Year2026
ProceedingsACL (Findings)

Browse the full ACL paper archive.