Skip to content

GradSafe: Detecting Jailbreak Prompts for LLMs via Safety-Critical Gradient Analysis.

Yueqi Xie, Minghong Fang, Renjie Pi, Neil Gong

VenueA*ACL
Year2024
ProceedingsACL (1)

Browse the full ACL paper archive.