Safe-Unsafe Concept Separation Emerges from a Single Direction in Language Models Activation Space.
Andrea Ermellino, Lorenzo Malandri, Fabio Mercorio, Antonio Serino
Browse the full EACL paper archive.
Andrea Ermellino, Lorenzo Malandri, Fabio Mercorio, Antonio Serino
Browse the full EACL paper archive.