Unlearning Backdoor Attacks for LLMs with Weak-to-Strong Knowledge Distillation.
Shuai Zhao, Xiaobao Wu, Cong-Duy T. Nguyen, Yanhao Jia, Meihuizi Jia, Yichao Feng, Anh Tuan Luu
Browse the full ACL paper archive.
Shuai Zhao, Xiaobao Wu, Cong-Duy T. Nguyen, Yanhao Jia, Meihuizi Jia, Yichao Feng, Anh Tuan Luu
Browse the full ACL paper archive.