| 2026 | AAAI | KALL-E: Autoregressive Speech Synthesis with Next-Distribution Prediction. | Kangxiang Xia, Xinfa Zhu, Jixun Yao, Wenjie Tian, Wenhao Li, Lei Xie |
| 2025 | ACL | LLaSE-G1: Incentivizing Generalization Capability for LLaMA-based Speech Enhancement. | Boyi Kang, Xinfa Zhu, Zihan Zhang, Zhen Ye, Mingshuai Liu, Ziqian Wang, Yike Zhu, Guobin Ma, Jun Chen, Longshuai Xiao, Chao Weng, Wei Xue, Lei Xie |
| 2025 | ASRU | Llasa+: Free Lunch for Accelerated and Streaming Llama-Based Speech Synthesis. | Wenjie Tian, Xinfa Zhu, Hanke Xie, Zhen Ye, Wei Xue, Lei Xie |
| 2025 | ASRU | XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation. | Tianlun Zuo, Jingbin Hu, Yuke Li, Xinfa Zhu, Hai Li, Ying Yan, Junhui Liu, Danming Xie, Lei Xie |
| 2025 | ICASSP | ZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training. | Xinfa Zhu, Lei He, Yujia Xiao, Xi Wang, Xu Tan, Sheng Zhao, Lei Xie |
| 2025 | Interspeech | Weakly Supervised Data Refinement and Flexible Sequence Compression for Efficient Thai LLM-based ASR. | Mingchen Shao, Xinfa Zhu, Chengyou Wang, Bingshen Mu, Hai Li, Ying Yan, Junhui Liu, Danming Xie, Lei Xie |
| 2025 | Interspeech | FlowSE: Efficient and High-Quality Speech Enhancement via Flow Matching. | Ziqian Wang, Zikai Liu, Xinfa Zhu, Yike Zhu, Mingshuai Liu, Jun Chen, Longshuai Xiao, Chao Weng, Lei Xie |
| 2025 | Interspeech | U-SAM: An Audio Language Model for Unified Speech, Audio, and Music Understanding. | Ziqian Wang, Xianjun Xia, Xinfa Zhu, Lei Xie |
| 2024 | ICASSP | Spontts: Modeling and Transferring Spontaneous Style for TTS. | Hanzhao Li, Xinfa Zhu, Liumeng Xue, Yang Song, Yunlin Chen, Lei Xie |
| 2024 | ICASSP | SELM: Speech Enhancement using Discrete Tokens and Language Models. | Ziqian Wang, Xinfa Zhu, Zihan Zhang, Yuanjun Lv, Ning Jiang, Guoqing Zhao, Lei Xie |
| 2024 | Interspeech | Text-aware and Context-aware Expressive Audiobook Speech Synthesis. | Dake Guo, Xinfa Zhu, Liumeng Xue, Yongmao Zhang, Wenjie Tian, Lei Xie |
| 2024 | Interspeech | Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation. | Hanzhao Li, Liumeng Xue, Haohan Guo, Xinfa Zhu, Yuanjun Lv, Lei Xie, Yunlin Chen, Hao Yin, Zhifei Li |
| 2024 | Interspeech | Vec-Tok-VC+: Residual-enhanced Robust Zero-shot Voice Conversion with Progressive Constraints in a Dual-mode Training Strategy. | Linhan Ma, Xinfa Zhu, Yuanjun Lv, Zhichao Wang, Ziqian Wang, Wendi He, Hongbin Zhou, Lei Xie |
| 2023 | ASRU | HIGNN-TTS: Hierarchical Prosody Modeling With Graph Neural Networks for Expressive Long-Form TTS. | Dake Guo, Xinfa Zhu, Liumeng Xue, Tao Li, Yuanjun Lv, Yuepeng Jiang, Lei Xie |
| 2023 | ASRU | Zero-Shot Emotion Transfer for Cross-Lingual Speech Synthesis. | Yuke Li, Xinfa Zhu, Yi Lei, Hai Li, Junhui Liu, Danming Xie, Lei Xie |
| 2023 | ICASSP | Multi-Speaker Expressive Speech Synthesis via Multiple Factors Decoupling. | Xinfa Zhu, Yi Lei, Kun Song, Yongmao Zhang, Tao Li, Lei Xie |