Skip to content

"Do Your Guardrails Even Guard?" Method for Evaluating Effectiveness of Moderation Guardrails in Aligning LLM Outputs with Expert User Expectations.

Anindya Das Antar, Xun Huan, Nikola Banovic

VenueCAIES
Year2025
ProceedingsAIES (Main Track I)

Browse the full AIES paper archive.