How Reliable are Confidence Estimators for Large Reasoning Models? A Systematic Benchmark on High-Stakes Domains.
Reza Khanmohammadi, Erfan Miahi, Simerjot Kaur, Charese Smiley, Ivan Brugere, Kundan Thind, Mohammad M. Ghassemi
VenueAEACL
Year2026
ProceedingsEACL (Volume 1: Long Papers)
DBLP recordconf/eacl/KhanmohammadiMKSBTG26 ↗
Browse the full EACL paper archive.