Skip to content

Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!

Xiangyu Qi, Yi Zeng, Tinghao Xie, Pin-Yu Chen, Ruoxi Jia, Prateek Mittal, Peter Henderson

VenueA*ICLR
Year2024
ProceedingsICLR

Browse the full ICLR paper archive.