Skip to content

Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models.

Dan Shi, Zhuowen Han, Simon Ostermann, Renren Jin, Josef van Genabith, Deyi Xiong

VenueA*ACL
Year2026
ProceedingsACL (1)

Browse the full ACL paper archive.