MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation.
Zhongshen Zeng, Pengguang Chen, Shu Liu, Haiyun Jiang, Jiaya Jia
Browse the full ICLR paper archive.
Zhongshen Zeng, Pengguang Chen, Shu Liu, Haiyun Jiang, Jiaya Jia
Browse the full ICLR paper archive.