Beyond Interpretability: The Gains of Feature Monosemanticity on Model Robustness.
Qi Zhang, Yifei Wang, Jingyi Cui, Xiang Pan, Qi Lei, Stefanie Jegelka, Yisen Wang
Browse the full ICLR paper archive.
Qi Zhang, Yifei Wang, Jingyi Cui, Xiang Pan, Qi Lei, Stefanie Jegelka, Yisen Wang
Browse the full ICLR paper archive.