Skip to content

Robust LLM safeguarding via refusal feature adversarial training.

Lei Yu, Virginie Do, Karen Hambardzumyan, Nicola Cancedda

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.