| 2026 | AAAI | Fine-Grained Interpretation of Political Opinions in Large Language Models. | Jingyu Hu, Mengyue Yang, Mengnan Du, Weiru Liu |
| 2026 | AAAI | KnowThyself: An Agentic Assistant for LLM Interpretability. | Suraj Prasai, Mengnan Du, Ying Zhang, Fan Yang |
| 2026 | ACL | LLM Agents in Law: Taxonomy, Applications, and Challenges. | Shuang Liu, Ruijia Zhang, Ruoyun Ma, Yujia Deng, Lanyi Zhu, Jiayu Li, Zelong Li, Zhibin Shen, Mengnan Du |
| 2026 | ACL | AdaJudge: Adaptive Multi-Perspective Judging for Reward Modeling. | Yongliang Miao, Yangyang Liang, Mengnan Du |
| 2026 | ACL | FinCall-Surprise: A Large Scale Multi-modal Benchmark for Earning Surprise Prediction. | Dong Shu, Yanguang Liu, Huopu Zhang, Mengnan Du |
| 2026 | ACL | FinChart-Bench: Benchmarking Financial Chart Comprehension in Vision-Language Models. | Dong Shu, Haoyang Yuan, Yuchen Wang, Yanguang Liu, Huopu Zhang, Mengnan Du |
| 2026 | ACL | AdaptiveK: Complexity-Driven Sparse Autoencoders for Interpretable Language Model Representations. | Yifei Yao, Hanrong Zhang, Mengnan Du |
| 2026 | ACL | SAE-FiRE: Enhancing Earnings Surprise Predictions Through Sparse Autoencoder Feature Selection. | Huopu Zhang, Yanguang Liu, Miao Zhang, Zirui He, Mengnan Du |
| 2026 | EACL | FaithLM: Towards Faithful Explanations for Large Language Models. | Yu-Neng Chuang, Guanchu Wang, Chia-Yuan Chang, Ruixiang Tang, Shaochen Zhong, Fan Yang, Andrew Wen, Mengnan Du, Xuanting Cai, Vladimir Braverman, Xia Hu |
| 2026 | EACL | DeepSieve: Information Sieving via LLM-as-a-Knowledge-Router. | Minghao Guo, Qingcheng Zeng, Xujiang Zhao, Yanchi Liu, Wenchao Yu, Mengnan Du, Haifeng Chen, Wei Cheng |
| 2026 | EACL | SAGE: An Agentic Explainer Framework for Interpreting SAE Features in Language Models. | Jiaojiao Han, Wujiang Xu, Mingyu Jin, Mengnan Du |
| 2026 | EACL | Denoising Concept Vectors with Sparse Autoencoders for Improved Language Model Steering. | Haiyan Zhao, Xuansheng Wu, Fan Yang, Bo Shen, Ninghao Liu, Mengnan Du |
| 2025 | AAAI | Language Ranker: A Metric for Quantifying LLM Performance Across High and Low-Resource Languages. | Zihao Li, Yucheng Shi, Zirui Liu, Fan Yang, Ali Payani, Ninghao Liu, Mengnan Du |
| 2025 | AAAI | Comparative Analysis of Demonstration Selection Algorithms for In-Context Learning in Large Language Models (Student Abstract). | Dong Shu, Mengnan Du |
| 2025 | COLING | Exploring Concept Depth: How Large Language Models Acquire Knowledge and Concept at Different Layers? | Mingyu Jin, Qinkai Yu, Jingyuan Huang, Qingcheng Zeng, Zhenting Wang, Wenyue Hua, Haiyan Zhao, Kai Mei, Yanda Meng, Kaize Ding, Fan Yang, Mengnan Du, Yongfeng Zhang |
| 2025 | CVPR | Invisible Backdoor Attack against Self-supervised Learning. | Hanrong Zhang, Zhenting Wang, Boheng Li, Fulin Lin, Tingxu Han, Mingyu Jin, Chenlu Zhan, Mengnan Du, Hongwei Wang, Shiqing Ma |
| 2025 | EMNLP | SAE-SSV: Supervised Steering in Sparse Representation Spaces for Reliable Control of Language Models. | Zirui He, Mingyu Jin, Bo Shen, Ali Payani, Yongfeng Zhang, Mengnan Du |
| 2025 | EMNLP | Feature Extraction and Steering for Enhanced Chain-of-Thought Reasoning in Language Models. | Zihao Li, Xu Wang, Yuzhe Yang, Ziyu Yao, Haoyi Xiong, Mengnan Du |
| 2025 | EMNLP | Beyond Input Activations: Identifying Influential Latents by Gradient Sparse Autoencoders. | Dong Shu, Xuansheng Wu, Haiyan Zhao, Mengnan Du, Ninghao Liu |
| 2025 | EMNLP | A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models. | Dong Shu, Xuansheng Wu, Haiyan Zhao, Daking Rai, Ziyu Yao, Ninghao Liu, Mengnan Du |
| 2025 | EMNLP | Large Vision-Language Model Alignment and Misalignment: A Survey Through the Lens of Explainability. | Dong Shu, Haiyan Zhao, Jingyu Hu, Weiru Liu, Ali Payani, Lu Cheng, Mengnan Du |
| 2025 | EMNLP | Improving LLM Reasoning through Interpretable Role-Playing Steering. | Anyi Wang, Dong Shu, Yifan Wang, Yunpu Ma, Mengnan Du |
| 2025 | ICDM | Physics-Informed Attention-Enhanced Fourier Neural Operator for Solar Magnetic Field Extrapolations. | Jinghao Cao, Qi Li, Mengnan Du, Haimin Wang, Bo Shen |
| 2025 | ICDM | NPC-TAG: Node Prompts for Classification on Text Attributed Graphs with LLMs. | Uras Varolgunes, Mengnan Du, Dantong Yu |
| 2025 | ICLR | Beyond Single Concept Vector: Modeling Concept Subspace in LLMs with Gaussian Distribution. | Haiyan Zhao, Heng Zhao, Bo Shen, Ali Payani, Fan Yang, Mengnan Du |
| 2025 | ICLR | From Commands to Prompts: LLM-based Semantic File System for AIOS. | Zeru Shi, Kai Mei, Mingyu Jin, Yongye Su, Chaoji Zuo, Wenyue Hua, Wujiang Xu, Yujie Ren, Zirui Liu, Mengnan Du, Dong Deng, Yongfeng Zhang |
| 2025 | ICML | Massive Values in Self-Attention Modules are the Key to Contextual Knowledge Understanding. | Mingyu Jin, Kai Mei, Wujiang Xu, Mingjie Sun, Ruixiang Tang, Mengnan Du, Zirui Liu, Yongfeng Zhang |
| 2025 | ICML | Concept-Centric Token Interpretation for Vector-Quantized Generative Models. | Tianze Yang, Yucheng Shi, Mengnan Du, Xuansheng Wu, Qiaoyu Tan, Jin Sun, Ninghao Liu |
| 2025 | NAACL | Data-centric NLP Backdoor Defense from the Lens of Memorization. | Zhenting Wang, Zhizhi Wang, Mingyu Jin, Mengnan Du, Juan Zhai, Shiqing Ma |
| 2024 | ACL | The Impact of Reasoning Step Length on Large Language Models. | Mingyu Jin, Qinkai Yu, Dong Shu, Haiyan Zhao, Wenyue Hua, Yanda Meng, Yongfeng Zhang, Mengnan Du |
| 2024 | ACL | Data-Centric Explainable Debiasing for Improving Fairness in Pre-trained Language Models. | Yingji Li, Mengnan Du, Rui Song, Xin Wang, Ying Wang |
| 2024 | ACML | Knowledge Graph Large Language Model (KG-LLM) for Link Prediction. | Dong Shu, Tianle Chen, Mingyu Jin, Chong Zhang, Mengnan Du, Yongfeng Zhang |
| 2024 | ACML | DataFrame QA: A Universal LLM Framework on DataFrame Question Answering Without Data Exposure. | Junyi Ye, Mengnan Du, Guiling Wang |
| 2024 | CIKM | LawLLM: Law Large Language Model for the US Legal System. | Dong Shu, Haoran Zhao, Xukun Liu, David Demeter, Mengnan Du, Yongfeng Zhang |
| 2024 | COLING | Mitigating Shortcuts in Language Models with Soft Label Encoding. | Zirui He, Huiqi Deng, Haiyan Zhao, Ninghao Liu, Mengnan Du |
| 2024 | COLING | Unveiling Project-Specific Bias in Neural Code Models. | Zhiming Li, Yanzhou Li, Tianlin Li, Mengnan Du, Bozhi Wu, Yushi Cao, Junzhe Jiang, Yang Liu |
| 2024 | EMNLP | Strategic Demonstration Selection for Improved Fairness in LLM In-Context Learning. | Jingyu Hu, Weiru Liu, Mengnan Du |
| 2024 | ICLR | Enhancing Fairness in In-Context Learning: Prioritizing Minority Samples in Demonstrations. | Jingyu Hu, Mengnan Du |
| 2024 | ICLR | Explaining Time Series via Contrastive and Locally Sparse Perturbations. | Zichuan Liu, Yingying Zhang, Tianchun Wang, Zefan Wang, Dongsheng Luo, Mengnan Du, Min Wu, Yi Wang, Chunlin Chen, Lunting Fan, Qingsong Wen |
| 2024 | ICML | TVE: Learning Meta-attribution for Transferable Vision Explainer. | Guanchu Wang, Yu-Neng Chuang, Fan Yang, Mengnan Du, Chia-Yuan Chang, Shaochen Zhong, Zirui Liu, Zhaozhuo Xu, Kaixiong Zhou, Xuanting Cai, Xia Hu |
| 2024 | NAACL | Secure Your Model: An Effective Key Prompt Protection Mechanism for Large Language Models. | Ruixiang Tang, Yu-Neng Chuang, Xuanting Cai, Mengnan Du, Xia Hu |
| 2024 | WWW | AI Driven Online Advertising: Market Design, Generative AI, and Ethics. | Fengxiang He, Mengnan Du, Aris Filos-Ratsikas, Lu Cheng, Qingquan Song, Min Lin, John Vines |
| 2023 | ACL | Prompt Tuning Pushes Farther, Contrastive Learning Pulls Closer: A Two-Stage Approach to Mitigate Social Biases. | Yingji Li, Mengnan Du, Xin Wang, Ying Wang |
| 2023 | CIKM | Attacking Neural Networks with Neural Networks: Towards Deep Synchronization for Backdoor Attacks. | Zihan Guan, Lichao Sun, Mengnan Du, Ninghao Liu |
| 2023 | CIKM | Exposing Model Theft: A Robust and Transferable Watermark for Thwarting Model Extraction Attacks. | Ruixiang Tang, Hongye Jin, Mengnan Du, Curtis Wigington, Rajiv Jain, Xia Hu |
| 2023 | EACL | Robustness Challenges in Model Distillation and Pruning for Natural Language Understanding. | Mengnan Du, Subhabrata Mukherjee, Yu Cheng, Milad Shokouhi, Xia Hu, Ahmed Hassan Awadallah |
| 2023 | ECAI | XGBD: Explanation-Guided Graph Backdoor Detection. | Zihan Guan, Mengnan Du, Ninghao Liu |
| 2023 | ICML | FAIRER: Fairness as Decision Rationale Alignment. | Tianlin Li, Qing Guo, Aishan Liu, Mengnan Du, Zhiming Li, Yang Liu |
| 2023 | IJCAI | Fairness via Group Contribution Matching. | Tianlin Li, Zhiming Li, Anran Li, Mengnan Du, Aishan Liu, Qing Guo, Guozhu Meng, Yang Liu |
| 2023 | VLDB | Proportionate Diversification of Top-k LLM Results using Database Queries. | Thinh On, Subhodeep Ghosh, Mengnan Du, Senjuti Basu Roy |
| 2022 | AAAI | Towards Debiasing DNN Models from Spurious Feature Influence. | Mengnan Du, Ruixiang Tang, Weijie Fu, Xia Hu |
| 2022 | ICLR | DEGREE: Decomposition Based Explanation for Graph Neural Networks. | Qizhang Feng, Ninghao Liu, Fan Yang, Ruixiang Tang, Mengnan Du, Xia Hu |
| 2022 | ICML | Accelerating Shapley Explanation via Contributive Cooperator Selection. | Guanchu Wang, Yu-Neng Chuang, Mengnan Du, Fan Yang, Quan Zhou, Pushkar Tripathi, Xuanting Cai, Xia Ben Hu |
| 2022 | KDD | Towards Learning Disentangled Representations for Time Series. | Yuening Li, Zhengzhang Chen, Daochen Zha, Mengnan Du, Jingchao Ni, Denghui Zhang, Haifeng Chen, Xia Hu |
| 2021 | AAAI | A Unified Taylor Framework for Revisiting Attribution Methods. | Huiqi Deng, Na Zou, Mengnan Du, Weifu Chen, Guocan Feng, Xia Hu |
| 2021 | ICWSM | Machine Learning Explanations to Prevent Overtrust in Fake News Detection. | Sina Mohseni, Fan Yang, Shiva K. Pentyala, Mengnan Du, Yi Liu, Nic Lupfer, Xia Hu, Shuiwang Ji, Eric D. Ragan |
| 2021 | ISSRE | MultiCode: A Unified Code Analysis Framework based on Multi-type and Multi-granularity Semantic Learning. | Xu Duan, Jingzheng Wu, Mengnan Du, Tianyue Luo, Mutian Yang, Yanjun Wu |
| 2021 | KDD | Mutual Information Preserving Back-propagation: Learn to Invert for Faithful Attribution. | Huiqi Deng, Na Zou, Weifu Chen, Guocan Feng, Mengnan Du, Xia Hu |
| 2021 | NAACL | Towards Interpreting and Mitigating Shortcut Learning Behavior of NLU models. | Mengnan Du, Varun Manjunatha, Rajiv Jain, Ruchi Deshpande, Franck Dernoncourt, Jiuxiang Gu, Tong Sun, Xia Hu |
| 2021 | WWW | Mitigating Gender Bias in Captioning Systems. | Ruixiang Tang, Mengnan Du, Yuening Li, Zirui Liu, Na Zou, Xia Hu |
| 2020 | CIKM | Towards Generalizable Deepfake Detection with Locality-aware AutoEncoder. | Mengnan Du, Shiva K. Pentyala, Yuening Li, Xia Hu |
| 2020 | CVPR | Score-CAM: Score-Weighted Visual Explanations for Convolutional Neural Networks. | Haofan Wang, Zifan Wang, Mengnan Du, Fan Yang, Zijian Zhang, Sirui Ding, Piotr Mardziel, Xia Hu |
| 2020 | KDD | An Embarrassingly Simple Approach for Trojan Attack in Deep Neural Networks. | Ruixiang Tang, Mengnan Du, Ninghao Liu, Fan Yang, Xia Hu |
| 2020 | SDM | Deep Neural Networks with Knowledge Instillation. | Fan Yang, Ninghao Liu, Mengnan Du, Kaixiong Zhou, Shuiwang Ji, Xia Hu |
| 2019 | CIKM | SpecAE: Spectral AutoEncoder for Anomaly Detection in Attributed Networks. | Yuening Li, Xiao Huang, Jundong Li, Mengnan Du, Na Zou |
| 2019 | ICDM | Learning Credible Deep Neural Networks with Rationale Regularization. | Mengnan Du, Ninghao Liu, Fan Yang, Xia Hu |
| 2019 | IJCNN | Deep Structured Cross-Modal Anomaly Detection. | Yuening Li, Ninghao Liu, Jundong Li, Mengnan Du, Xia Hu |
| 2019 | WWW | On Attribution of Recurrent Neural Network Predictions via Additive Decomposition. | Mengnan Du, Ninghao Liu, Fan Yang, Shuiwang Ji, Xia Hu |
| 2019 | WWW | XFake: Explainable Fake News Detector with Visualizations. | Fan Yang, Shiva K. Pentyala, Sina Mohseni, Mengnan Du, Hao Yuan, Rhema Linder, Eric D. Ragan, Shuiwang Ji, Xia (Ben) Hu |
| 2019 | WSDM | Representation Interpretation with Spatial Encoding and Multimodal Analytics. | Ninghao Liu, Mengnan Du, Xia Hu |
| 2018 | KDD | Towards Explanation of DNN-based Prediction with Guided Feature Inversion. | Mengnan Du, Ninghao Liu, Qingquan Song, Xia Hu |