An Interpretable N-gram Perplexity Threat Model for Large Language Model Jailbreaks.
Valentyn Boreiko, Alexander Panfilov, Vclav Vorcek, Matthias Hein, Jonas Geiping
Browse the full ICML paper archive.
Valentyn Boreiko, Alexander Panfilov, Vclav Vorcek, Matthias Hein, Jonas Geiping
Browse the full ICML paper archive.