Skip to content

MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation.

Zhongshen Zeng, Pengguang Chen, Shu Liu, Haiyun Jiang, Jiaya Jia

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.