Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization.
Zhexin Zhang, Junxiao Yang, Pei Ke, Fei Mi, Hongning Wang, Minlie Huang
Browse the full ACL paper archive.
Zhexin Zhang, Junxiao Yang, Pei Ke, Fei Mi, Hongning Wang, Minlie Huang
Browse the full ACL paper archive.