Skip to content

Detecting Multi-Turn Jailbreak Attacks in Large Language Models via Linear Probes.

Jorge Marina-Metola, Jos Mara de Fuentes, Lorena Gonzlez-Manzano, Luis Ibaez-Lissen

Year2025
ProceedingsTrustCom

Browse the full TrustCom paper archive.