Sample-Efficient Human Evaluation of Large Language Models via Maximum Discrepancy Competition.
Kehua Feng, Keyan Ding, Hongzhi Tan, Kede Ma, Zhihua Wang, Shuangquan Guo, Yuzhou Cheng, Ge Sun, Guozhou Zheng, Qiang Zhang, Huajun Chen
Browse the full ACL paper archive.