Skip to content

Learning Diverse Attacks on Large Language Models for Robust Red-Teaming and Safety Tuning.

Seanie Lee, Minsu Kim, Lynn Cherif, David Dobre, Juho Lee, Sung Ju Hwang, Kenji Kawaguchi, Gauthier Gidel, Yoshua Bengio, Nikolay Malkin, Moksh Jain

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.