Preference Heads in Large Language Models: A Mechanistic Framework for Interpretable Personalization.
Weixu Zhang, Ye Yuan, Changjiang Han, Yuxing Tian, Zipeng Sun, Linfeng Du, Jikun Kang, Hong Kang, Xue Liu, Haolun Wu
Browse the full ACL paper archive.