Detecting Multi-Turn Jailbreak Attacks in Large Language Models via Linear Probes.
Jorge Marina-Metola, Jos Mara de Fuentes, Lorena Gonzlez-Manzano, Luis Ibaez-Lissen
Browse the full TrustCom paper archive.
Jorge Marina-Metola, Jos Mara de Fuentes, Lorena Gonzlez-Manzano, Luis Ibaez-Lissen
Browse the full TrustCom paper archive.