Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation.
Jun Zhuang, Hai Jin, Ye Zhang, Zhengjian Kang, Wenbin Zhang, Gaby G. Dagher, Haohan Wang
Browse the full EMNLP paper archive.
Jun Zhuang, Hai Jin, Ye Zhang, Zhengjian Kang, Wenbin Zhang, Gaby G. Dagher, Haohan Wang
Browse the full EMNLP paper archive.