Skip to content

On the Role of Attention Heads in Large Language Model Safety.

Zhenhong Zhou, Haiyang Yu, Xinghua Zhang, Rongwu Xu, Fei Huang, Kun Wang, Yang Liu, Junfeng Fang, Yongbin Li

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.