Skip to content

SafetyAnalyst: Interpretable, Transparent, and Steerable Safety Moderation for AI Behavior.

Jing-Jing Li, Valentina Pyatkin, Max Kleiman-Weiner, Liwei Jiang, Nouha Dziri, Anne Collins, Jana Schaich Borg, Maarten Sap, Yejin Choi, Sydney Levine

VenueA*ICML
Year2025
ProceedingsICML

Browse the full ICML paper archive.