| 2026 | ACL | Native Hybrid Attention for Efficient Sequence Modeling. | Jusen Du, Jiaxi Hu, Zhang Tao, Weigao Sun, Yu Cheng |
| 2026 | ACL | Nirvana: A Specialized Generalist Model With Task-Aware Memory Mechanism. | Yuhua Jiang, Shuang Cheng, Yihao Liu, Ermo Hua, Che Jiang, Weigao Sun, Yu Cheng, Feifei Gao, Biqing Qi, Bowen Zhou |
| 2025 | AAAI | Sequence Accumulation and Beyond: Infinite Context Length on Single GPU and Large Clusters. | Weigao Sun, Yongtuo Liu, Xiaqiang Tang, Xiaoyu Mo |
| 2025 | ACL | CogniBench: A Legal-inspired Framework and Dataset for Assessing Cognitive Faithfulness of Large Language Models. | Xiaqiang Tang, Jian Li, Keyu Hu, Nan Du, Xiaolong Li, Xi Zhang, Weigao Sun, Sihong Xie |
| 2025 | ICML | Liger: Linearizing Large Language Models to Gated Recurrent Structures. | Disen Lan, Weigao Sun, Jiaxi Hu, Jusen Du, Yu Cheng |
| 2024 | EMNLP | Scaling Laws for Linear Complexity Language Models. | Xuyang Shen, Dong Li, Ruitao Leng, Zhen Qin, Weigao Sun, Yiran Zhong |
| 2024 | ICLR | CO2: Efficient Distributed Training with Full Communication-Computation Overlap. | Weigao Sun, Zhen Qin, Weixuan Sun, Shidi Li, Dong Li, Xuyang Shen, Yu Qiao, Yiran Zhong |
| 2024 | ICML | Various Lengths, Constant Speed: Efficient Language Modeling with Lightning Attention. | Zhen Qin, Weigao Sun, Dong Li, Xuyang Shen, Weixuan Sun, Yiran Zhong |
| 2020 | IJCAI | pbSGD: Powered Stochastic Gradient Descent Methods for Accelerated Non-Convex Optimization. | Beitong Zhou, Jun Liu, Weigao Sun, Ruijuan Chen, Claire J. Tomlin, Ye Yuan |