Skip to content

SAEBench: A Comprehensive Benchmark for Sparse Autoencoders in Language Model Interpretability.

Adam Karvonen, Can Rager, Johnny Lin, Curt Tigges, Joseph Isaac Bloom, David Chanin, Yeu-Tong Lau, Eoin Farrell, Callum McDougall, Kola Ayonrinde, Demian Till, Matthew Wearden, Arthur Conmy, Samuel Marks, Neel Nanda

VenueA*ICML
Year2025
ProceedingsICML

Browse the full ICML paper archive.