| 2026 | ACL | Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts. | Di Zhang, Xun Wu, Shaohan Huang, Lingjie Jiang, Yaru Hao, Li Dong, Zewen Chi, Zhifang Sui, Furu Wei |
| 2025 | ICLR | Data Selection via Optimal Control for Language Models. | Yuxian Gu, Li Dong, Hongning Wang, Yaru Hao, Qingxiu Dong, Furu Wei, Minlie Huang |
| 2024 | ICLR | Grounding Multimodal Large Language Models to the World. | Zhiliang Peng, Wenhui Wang, Li Dong, Yaru Hao, Shaohan Huang, Shuming Ma, Qixiang Ye, Furu Wei |
| 2023 | AAAI | Prototypical Fine-Tuning: Towards Robust Performance under Varying Data Sizes. | Yiqiao Jin, Xiting Wang, Yaru Hao, Yizhou Sun, Xing Xie |
| 2023 | ACL | Why Can GPT Learn In-Context? Language Models Secretly Perform Gradient Descent as Meta-Optimizers. | Damai Dai, Yutao Sun, Li Dong, Yaru Hao, Shuming Ma, Zhifang Sui, Furu Wei |
| 2023 | ICLR | Prototypical Calibration for Few-shot Learning of Language Models. | Zhixiong Han, Yaru Hao, Li Dong, Yutao Sun, Furu Wei |
| 2022 | ACL | Knowledge Neurons in Pretrained Transformers. | Damai Dai, Li Dong, Yaru Hao, Zhifang Sui, Baobao Chang, Furu Wei |
| 2021 | AAAI | Self-Attention Attribution: Interpreting Information Interactions Inside Transformer. | Yaru Hao, Li Dong, Furu Wei, Ke Xu |
| 2021 | ACL | Learning to Sample Replacements for ELECTRA Pre-Training. | Yaru Hao, Li Dong, Hangbo Bao, Ke Xu, Furu Wei |
| 2020 | IJCNLP | Investigating Learning Dynamics of BERT Fine-Tuning. | Yaru Hao, Li Dong, Furu Wei, Ke Xu |
| 2019 | EMNLP | Visualizing and Understanding the Effectiveness of BERT. | Yaru Hao, Li Dong, Furu Wei, Ke Xu |