Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing.
Jiabao Ji, Bairu Hou, Alexander Robey, George J. Pappas, Hamed Hassani, Yang Zhang, Eric Wong, Shiyu Chang
Browse the full IJCNLP paper archive.
Jiabao Ji, Bairu Hou, Alexander Robey, George J. Pappas, Hamed Hassani, Yang Zhang, Eric Wong, Shiyu Chang
Browse the full IJCNLP paper archive.