Skip to content

S²R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning.

Ruotian Ma, Peisong Wang, Cheng Liu, Xingyan Liu, Jiaqi Chen, Bang Zhang, Xin Zhou, Nan Du, Jia Li

VenueA*ACL
Year2025
ProceedingsACL (1)

Browse the full ACL paper archive.