Skip to content

I Have Covered All the Bases Here: Interpreting Reasoning Features in Large Language Models via Sparse Autoencoders.

Andrey V. Galichin, Alexey Dontsov, Polina Druzhinina, Anton Razzhigaev, Oleg Rogov, Elena Tutubalina, Ivan V. Oseledets

VenueA*AAAI
Year2026
ProceedingsAAAI

Browse the full AAAI paper archive.