NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning.
Xin Yi, Shunfan Zheng, Linlin Wang, Gerard de Melo, Xiaoling Wang, Liang He
Browse the full AAAI paper archive.
Xin Yi, Shunfan Zheng, Linlin Wang, Gerard de Melo, Xiaoling Wang, Liang He
Browse the full AAAI paper archive.