Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy.
Eric Hanchen Jiang, Weixuan Ou, Run Liu, Shengyuan Pang, Guancheng Wan, Ranjie Duan, Wei Dong, Kai-Wei Chang, Xiaofeng Wang, Ying Nian Wu, Xinfeng Li
Browse the full ACL paper archive.