| 2025 | AAAI | Language Model Can Listen While Speaking. | Ziyang Ma, Yakun Song, Chenpeng Du, Jian Cong, Zhuo Chen, Yuping Wang, Yuxuan Wang, Xie Chen |
| 2025 | ACL | Towards Reliable Large Audio Language Model. | Ziyang Ma, Xiquan Li, Yakun Song, Wenxi Chen, Chenpeng Du, Jian Wu, Yuanzhe Chen, Zhuo Chen, Yuping Wang, Yuxuan Wang, Xie Chen |
| 2025 | ICASSP | VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech. | Chenpeng Du, Yiwei Guo, Hankun Wang, Yifan Yang, Zhikang Niu, Shuai Wang, Hui Zhang, Xie Chen, Kai Yu |
| 2025 | ICML | DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation. | Dongya Jia, Zhuo Chen, Jiawei Chen, Chenpeng Du, Jian Wu, Jian Cong, Xiaobin Zhuang, Chumin Li, Zhen Wei, Yuping Wang, Yuxuan Wang |
| 2025 | Interspeech | LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec. | Yiwei Guo, Zhihan Li, Chenpeng Du, Hankun Wang, Xie Chen, Kai Yu |
| 2024 | AAAI | UniCATS: A Unified Context-Aware Text-to-Speech Framework with Contextual VQ-Diffusion and Vocoding. | Chenpeng Du, Yiwei Guo, Feiyu Shen, Zhijun Liu, Zheng Liang, Xie Chen, Shuai Wang, Hui Zhang, Kai Yu |
| 2024 | ICASSP | VoiceFlow: Efficient Text-To-Speech with Rectified Flow Matching. | Yiwei Guo, Chenpeng Du, Ziyang Ma, Xie Chen, Kai Yu |
| 2024 | ICASSP | DiffDub: Person-Generic Visual Dubbing Using Inpainting Renderer with Diffusion Auto-Encoder. | Tao Liu, Chenpeng Du, Shuai Fan, Feilong Chen, Kai Yu |
| 2024 | ICASSP | Acoustic BPE for Speech Generation with Discrete Tokens. | Feiyu Shen, Yiwei Guo, Chenpeng Du, Xie Chen, Kai Yu |
| 2024 | ICASSP | Towards Universal Speech Discrete Tokens: A Case Study for ASR and TTS. | Yifan Yang, Feiyu Shen, Chenpeng Du, Ziyang Ma, Kai Yu, Daniel Povey, Xie Chen |
| 2024 | ICASSP | Generation-Based Target Speech Extraction with Speech Discretization and Vocoder. | Linfeng Yu, Wangyou Zhang, Chenpeng Du, Leying Zhang, Zheng Liang, Yanmin Qian |
| 2023 | ICASSP | Multi-Speaker Multi-Lingual VQTTS System for LIMMITS 2023 Challenge. | Chenpeng Du, Yiwei Guo, Feiyu Shen, Kai Yu |
| 2023 | ICASSP | Emodiff: Intensity Controllable Emotional Text-to-Speech with Soft-Label Guidance. | Yiwei Guo, Chenpeng Du, Xie Chen, Kai Yu |
| 2023 | Interspeech | Improving Code-Switching and Name Entity Recognition in ASR with Speech Editing based Data Augmentation. | Zheng Liang, Zheshu Song, Ziyang Ma, Chenpeng Du, Kai Yu, Xie Chen |
| 2023 | Interspeech | DSE-TTS: Dual Speaker Embedding for Cross-Lingual Text-to-Speech. | Sen Liu, Yiwei Guo, Chenpeng Du, Xie Chen, Kai Yu |
| 2022 | ICASSP | Unsupervised Word-Level Prosody Tagging for Controllable Speech Synthesis. | Yiwei Guo, Chenpeng Du, Kai Yu |
| 2022 | Interspeech | VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature. | Chenpeng Du, Yiwei Guo, Xie Chen, Kai Yu |
| 2021 | ICASSP | SynAug: Synthesis-Based Data Augmentation for Text-Dependent Speaker Verification. | Chenpeng Du, Bing Han, Shuai Wang, Yanmin Qian, Kai Yu |
| 2021 | ICASSP | Towards Data Selection on TTS Data for Children's Speech Recognition. | Wei Wang, Zhikai Zhou, Yizhou Lu, Hongji Wang, Chenpeng Du, Yanmin Qian |
| 2021 | Interspeech | Rich Prosody Diversity Modelling with Phone-Level Mixture Density Network. | Chenpeng Du, Kai Yu |
| 2020 | ICASSP | Speaker Augmentation for Low Resource Speech Recognition. | Chenpeng Du, Kai Yu |