Skip to content

AI Sandbagging: Language Models can Strategically Underperform on Evaluations.

Teun van der Weij, Felix Hofsttter, Oliver Jaffe, Samuel F. Brown, Francis Rhys Ward

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.