Skip to content

SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal.

Tinghao Xie, Xiangyu Qi, Yi Zeng, Yangsibo Huang, Udari Madhushani Sehwag, Kaixuan Huang, Luxi He, Boyi Wei, Dacheng Li, Ying Sheng, Ruoxi Jia, Bo Li, Kai Li, Danqi Chen, Peter Henderson, Prateek Mittal

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.