NLP Evaluation in trouble: On the Need to Measure LLM Data Contamination for each Benchmark.
Oscar Sainz, Jon Ander Campos, Iker Garca-Ferrero, Julen Etxaniz, Oier Lopez de Lacalle, Eneko Agirre
Browse the full EMNLP paper archive.
Oscar Sainz, Jon Ander Campos, Iker Garca-Ferrero, Julen Etxaniz, Oier Lopez de Lacalle, Eneko Agirre
Browse the full EMNLP paper archive.