EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking.
Anjiang Wei, Jiannan Cao, Ran Li, Hongyu Chen, Yuhui Zhang, Ziheng Wang, Yuan Liu, Thiago S. F. X. Teixeira, Diyi Yang, Ke Wang, Alex Aiken
Browse the full EMNLP paper archive.