| 2026 | AAAI | On the Learning Dynamics of Two-layer Linear Networks with Label Noise SGD. | Tongcheng Zhang, Zhanpeng Zhou, Mingze Wang, Andi Han, Wei Huang, Taiji Suzuki, Junchi Yan |
| 2025 | ICLR | On the Optimization and Generalization of Two-layer Transformers with Sign Gradient Descent. | Bingrui Li, Wei Huang, Andi Han, Zhanpeng Zhou, Taiji Suzuki, Jun Zhu, Jianfei Chen |
| 2025 | ICLR | Sharpness-Aware Minimization Efficiently Selects Flatter Minima Late In Training. | Zhanpeng Zhou, Mingze Wang, Yuchen Mao, Bingrui Li, Junchi Yan |
| 2025 | ICML | The Sharpness Disparity Principle in Transformers for Accelerating Language Model Pre-Training. | Jinbo Wang, Mingze Wang, Zhanpeng Zhou, Junchi Yan, Weinan E, Lei Wu |
| 2025 | ICML | On the Role of Label Noise in the Feature Learning Process. | Andi Han, Wei Huang, Zhanpeng Zhou, Gang Niu, Wuyang Chen, Junchi Yan, Akiko Takeda, Taiji Suzuki |
| 2025 | IJCNN | SE-Merging: A Self-Enhanced Approach for Dynamic Model Merging. | Zijun Chen, Zhanpeng Zhou, Bo Zhang, Weinan Zhang, Xi Sun, Junchi Yan |
| 2024 | AAAI | Batch Normalization Is Blind to the First and Second Derivatives of the Loss. | Zhanpeng Zhou, Wen Shen, Huixin Chen, Ling Tang, Yuefeng Chen, Quanshi Zhang |
| 2024 | ICLR | Going Beyond Neural Network Feature Similarity: The Network Feature Complexity and Its Interpretation Using Category Theory. | Yiting Chen, Zhanpeng Zhou, Junchi Yan |
| 2024 | ICML | On the Emergence of Cross-Task Linearity in Pretraining-Finetuning Paradigm. | Zhanpeng Zhou, Zijun Chen, Yilan Chen, Bo Zhang, Junchi Yan |
| 2023 | ICLR | Can We Faithfully Represent Absence States to Compute Shapley Values on a DNN? | Jie Ren, Zhanpeng Zhou, Qirui Chen, Quanshi Zhang |
| 2023 | ICML | Defects of Convolutional Decoder Networks in Frequency Representation. | Ling Tang, Wen Shen, Zhanpeng Zhou, Yuefeng Chen, Quanshi Zhang |