Reasoning-to-Defend: Safety-Aware Reasoning Can Defend Large Language Models from Jailbreaking.
Junda Zhu, Lingyong Yan, Shuaiqiang Wang, Dawei Yin, Lei Sha
Browse the full EMNLP paper archive.
Junda Zhu, Lingyong Yan, Shuaiqiang Wang, Dawei Yin, Lei Sha
Browse the full EMNLP paper archive.