Skip to content

Trojan Activation Attack: Red-Teaming Large Language Models using Steering Vectors for Safety-Alignment.

Haoran Wang, Kai Shu

VenueACIKM
Year2024
ProceedingsCIKM

Browse the full CIKM paper archive.