Position: AI Competitions Provide the Gold Standard for Empirical Rigor in GenAI Evaluation.
D. Sculley, William Cukierski, Phil Culliton, Sohier Dane, Maggie Demkin, Ryan Holbrook, Addison Howard, Paul Mooney, Walter Reade, Meg Risdal, Nate Keating
Browse the full ICML paper archive.