Skip to content

Interpretable Reward Model via Sparse Autoencoder.

Shuyi Zhang, Wei Shi, Sihang Li, Jiayi Liao, Tao Liang, Hengxing Cai, Xiang Wang

VenueA*AAAI
Year2026
ProceedingsAAAI

Browse the full AAAI paper archive.