Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models.
Biao Yi, Tiansheng Huang, Sishuo Chen, Tong Li, Zheli Liu, Zhixuan Chu, Yiming Li
Browse the full ICLR paper archive.
Biao Yi, Tiansheng Huang, Sishuo Chen, Tong Li, Zheli Liu, Zhixuan Chu, Yiming Li
Browse the full ICLR paper archive.