Robust LLM safeguarding via refusal feature adversarial training.
Lei Yu, Virginie Do, Karen Hambardzumyan, Nicola Cancedda
Browse the full ICLR paper archive.
Lei Yu, Virginie Do, Karen Hambardzumyan, Nicola Cancedda
Browse the full ICLR paper archive.