Skip to content

SafeInt: Shielding Large Language Models from Jailbreak Attacks via Safety-Aware Representation Intervention.

Jiaqi Wu, Chen Chen, Chunyan Hou, Xiaojie Yuan

VenueA*EMNLP
Year2025
ProceedingsEMNLP (Findings)

Browse the full EMNLP paper archive.