NPHardEval: Dynamic Benchmark on Reasoning Ability of Large Language Models via Complexity Classes.
Lizhou Fan, Wenyue Hua, Lingyao Li, Haoyang Ling, Yongfeng Zhang
Browse the full ACL paper archive.
Lizhou Fan, Wenyue Hua, Lingyao Li, Haoyang Ling, Yongfeng Zhang
Browse the full ACL paper archive.