Stealthy Jailbreak Attacks on Large Language Models via Benign Data Mirroring.
Honglin Mu, Han He, Yuxin Zhou, Yunlong Feng, Yang Xu, Libo Qin, Xiaoming Shi, Zeming Liu, Xudong Han, Qi Shi, Qingfu Zhu, Wanxiang Che
Browse the full NAACL paper archive.