SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks.
Pavel Adamenko, Mikhail Ivanov, Aidar Valeev, Rodion Levichev, Pavel Zadorozhny, Ivan Lopatin, Dmitrii Babaev, Alena Fenogenova, Valentin Malykh
VenueA*EMNLP
Year2025
ProceedingsEMNLP (System Demonstrations)
DBLP recordconf/emnlp/AdamenkoIVLZLBF25 ↗
Browse the full EMNLP paper archive.