Making Harmful Behaviors Unlearnable for Large Language Models.
Xin Zhou, Yi Lu, Ruotian Ma, Yujian Wei, Tao Gui, Qi Zhang, Xuanjing Huang
Browse the full ACL paper archive.
Xin Zhou, Yi Lu, Ruotian Ma, Yujian Wei, Tao Gui, Qi Zhang, Xuanjing Huang
Browse the full ACL paper archive.