Skip to content

An Interpretable N-gram Perplexity Threat Model for Large Language Model Jailbreaks.

Valentyn Boreiko, Alexander Panfilov, Vclav Vorcek, Matthias Hein, Jonas Geiping

VenueA*ICML
Year2025
ProceedingsICML

Browse the full ICML paper archive.