| 2026 | AAAI | AHAMask: Reliable Task Specification for Large Audio Language Models Without Instructions. | Yiwei Guo, Bohan Li, Hankun Wang, Zhihan Li, Shuai Wang, Xie Chen, Kai Yu |
| 2025 | ASRU | Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency. | Haoran Wang, Guanyu Chen, Bohan Li, Hankun Wang, Yiwei Guo, Zhihan Li, Xie Chen, Kai Yu |
| 2025 | ICASSP | VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech. | Chenpeng Du, Yiwei Guo, Hankun Wang, Yifan Yang, Zhikang Niu, Shuai Wang, Hui Zhang, Xie Chen, Kai Yu |
| 2025 | ICASSP | Fast and High-Quality Auto-Regressive Speech Synthesis via Speculative Decoding. | Bohan Li, Hankun Wang, Situo Zhang, Yiwei Guo, Kai Yu |
| 2025 | ICML | TimeStep Master: Asymmetrical Mixture of Timestep LoRA Experts for Versatile and Efficient Diffusion Models in Vision. | Shaobin Zhuang, Yiwei Guo, Yanbo Ding, Kunchang Li, Xinyuan Chen, Yaohui Wang, Fangyikang Wang, Ying Zhang, Chen Li, Yali Wang |
| 2025 | Interspeech | LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec. | Yiwei Guo, Zhihan Li, Chenpeng Du, Hankun Wang, Xie Chen, Kai Yu |
| 2025 | Interspeech | Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate. | Hanglei Zhang, Yiwei Guo, Zhihan Li, Xiang Hao, Xie Chen, Kai Yu |
| 2024 | AAAI | UniCATS: A Unified Context-Aware Text-to-Speech Framework with Contextual VQ-Diffusion and Vocoding. | Chenpeng Du, Yiwei Guo, Feiyu Shen, Zhijun Liu, Zheng Liang, Xie Chen, Shuai Wang, Hui Zhang, Kai Yu |
| 2024 | ICASSP | VoiceFlow: Efficient Text-To-Speech with Rectified Flow Matching. | Yiwei Guo, Chenpeng Du, Ziyang Ma, Xie Chen, Kai Yu |
| 2024 | ICASSP | SEF-VC: Speaker Embedding Free Zero-Shot Voice Conversion with Cross Attention. | Junjie Li, Yiwei Guo, Xie Chen, Kai Yu |
| 2024 | ICASSP | StoryTTS: A Highly Expressive Text-to-Speech Dataset with Rich Textual Expressiveness Annotations. | Sen Liu, Yiwei Guo, Xie Chen, Kai Yu |
| 2024 | ICASSP | Leveraging Speech PTM, Text LLM, And Emotional TTS For Speech Emotion Recognition. | Ziyang Ma, Wen Wu, Zhisheng Zheng, Yiwei Guo, Qian Chen, Shiliang Zhang, Xie Chen |
| 2024 | ICASSP | Acoustic BPE for Speech Generation with Discrete Tokens. | Feiyu Shen, Yiwei Guo, Chenpeng Du, Xie Chen, Kai Yu |
| 2024 | Interspeech | On the Effectiveness of Acoustic BPE in Decoder-Only TTS. | Bohan Li, Feiyu Shen, Yiwei Guo, Shuai Wang, Xie Chen, Kai Yu |
| 2024 | Interspeech | DiveSound: LLM-Assisted Automatic Taxonomy Construction for Diverse Audio Generation. | Baihan Li, Zeyu Xie, Xuenan Xu, Yiwei Guo, Ming Yan, Ji Zhang, Kai Yu, Mengyue Wu |
| 2024 | SMC | Detection Method of Teaching Discourse Richness Based on Prompt Learning and Pre-Trained Language Model. | Shuhua Liu, Yiwei Guo, Shihao Yang, Fengqin Yang |
| 2023 | ICASSP | Multi-Speaker Multi-Lingual VQTTS System for LIMMITS 2023 Challenge. | Chenpeng Du, Yiwei Guo, Feiyu Shen, Kai Yu |
| 2023 | ICASSP | Emodiff: Intensity Controllable Emotional Text-to-Speech with Soft-Label Guidance. | Yiwei Guo, Chenpeng Du, Xie Chen, Kai Yu |
| 2023 | ICASSP | DiffVoice: Text-to-Speech with Latent Diffusion. | Zhijun Liu, Yiwei Guo, Kai Yu |
| 2023 | IJCNN | Joint Node Representation Learning and Clustering for Attributed Graph via Graph Diffusion Convolution. | Yiwei Guo, Le Kang, Mengqi Wu, Lijuan Zhou, Zhihong Zhang |
| 2023 | Interspeech | DSE-TTS: Dual Speaker Embedding for Cross-Lingual Text-to-Speech. | Sen Liu, Yiwei Guo, Chenpeng Du, Xie Chen, Kai Yu |
| 2022 | ICASSP | Unsupervised Word-Level Prosody Tagging for Controllable Speech Synthesis. | Yiwei Guo, Chenpeng Du, Kai Yu |
| 2022 | Interspeech | VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature. | Chenpeng Du, Yiwei Guo, Xie Chen, Kai Yu |