Correcting Negative Bias in Large Language Models through Negative Attention Score Alignment.
Sangwon Yu, Jongyoon Song, Bongkyu Hwang, Hoyoung Kang, Sooah Cho, Junhwa Choi, Seongho Joe, Taehee Lee, Youngjune Gwon, Sungroh Yoon
Browse the full NAACL paper archive.