AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models.
Jiacheng Liang, Tanqiu Jiang, Yuhui Wang, Rongyi Zhu, Fenglong Ma, Ting Wang
Browse the full ACL paper archive.
Jiacheng Liang, Tanqiu Jiang, Yuhui Wang, Rongyi Zhu, Fenglong Ma, Ting Wang
Browse the full ACL paper archive.