Skip to content

Safety Alignment of Large Language Models via Contrasting Safe and Harmful Distributions.

Xiaoyun Zhang, Zhengyue Zhao, Wenxuan Shi, Kaidi Xu, Di Huang, Xing Hu

VenueA*AAAI
Year2026
ProceedingsAAAI

Browse the full AAAI paper archive.