Skip to content

Safe-Unsafe Concept Separation Emerges from a Single Direction in Language Models Activation Space.

Andrea Ermellino, Lorenzo Malandri, Fabio Mercorio, Antonio Serino

VenueAEACL
Year2026
ProceedingsEACL (Volume 1: Long Papers)

Browse the full EACL paper archive.