Skip to content

When Safety Alignment Fails to Generalize: Probing with Language Game Jailbreaks.

Zewen Long, Yu Peng, Fangming Dong, Congyi Li, Xingmao Guan, Shu Wu, Kai Chen

VenueA*ACL
Year2026
ProceedingsACL (Findings)

Browse the full ACL paper archive.