Sparse Feature Coactivation Reveals Causal Semantic Modules in Large Language Models.
Ruixuan Deng, Xiaoyang Hu, Miles Gilberti, Shane Storks, Aman Taxali, Mike Angstadt, Chandra Sekhar Sripada, Joyce Chai
Browse the full ACL paper archive.
Ruixuan Deng, Xiaoyang Hu, Miles Gilberti, Shane Storks, Aman Taxali, Mike Angstadt, Chandra Sekhar Sripada, Joyce Chai
Browse the full ACL paper archive.