Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning Attack.
Tiansheng Huang, Gautam Bhattacharya, Pratik Joshi, Joshua Kimball, Ling Liu
Browse the full ICML paper archive.
Tiansheng Huang, Gautam Bhattacharya, Pratik Joshi, Joshua Kimball, Ling Liu
Browse the full ICML paper archive.