Skip to content

When Models Outthink Their Safety: Unveiling and Mitigating Self-Jailbreak in Large Reasoning Models.

Yingzhi Mao, Chunkang Zhang, Junxiang Wang, Xinyan Guan, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

VenueA*ACL
Year2026
ProceedingsACL (Findings)

Browse the full ACL paper archive.