Inference-Time Decontamination: Reusing Leaked Benchmarks for Large Language Model Evaluation.
Qin Zhu, Qinyuan Cheng, Runyu Peng, Xiaonan Li, Ru Peng, Tengxiao Liu, Xipeng Qiu, Xuanjing Huang
Browse the full EMNLP paper archive.
Qin Zhu, Qinyuan Cheng, Runyu Peng, Xiaonan Li, Ru Peng, Tengxiao Liu, Xipeng Qiu, Xuanjing Huang
Browse the full EMNLP paper archive.