Skip to content

Lost in Benchmarks? Rethinking Large Language Model Benchmarking with Item Response Theory.

Hongli Zhou, Hui Huang, Ziqing Zhao, Lvyuan Han, Huicheng Wang, Kehai Chen, Muyun Yang, Wei Bao, Jian Dong, Bing Xu, Conghui Zhu, Hailong Cao, Tiejun Zhao

VenueA*AAAI
Year2026
ProceedingsAAAI

Browse the full AAAI paper archive.