Benchmarking Large Language Models Under Data Contamination: A Survey from Static to Dynamic Evaluation.
Simin Chen, Yiming Chen, Zexin Li, Yifan Jiang, Zhongwei Wan, Yixin He, Dezhi Ran, Tianle Gu, Haizhou Li, Tao Xie, Baishakhi Ray
Browse the full EMNLP paper archive.