| 2026 | AAAI | Say More with Less: Variable-Frame-Rate Speech Tokenization via Adaptive Clustering and Implicit Duration Coding. | Rui-Chen Zheng, Wenrui Liu, Hui-Peng Du, Qinglin Zhang, Chong Deng, Qian Chen, Wen Wang, Yang Ai, Zhen-Hua Ling |
| 2025 | ICASSP | CASC-XVC: Zero-Shot Cross-Lingual Voice Conversion with Content Accordant and Speaker Contrastive Losses. | Han-Jie Guo, Hui-Peng Du, Zheng-Yan Sheng, Li-Ping Chen, Yang Ai, Zhen-Hua Ling |
| 2025 | ICASSP | Incremental Disentanglement for Environment-Aware Zero-Shot Text-to-Speech Synthesis. | Ye-Xin Lu, Hui-Peng Du, Zheng-Yan Sheng, Yang Ai, Zhen-Hua Ling |
| 2025 | Interspeech | Vision-Integrated High-Quality Neural Speech Coding. | Yao Guo, Yang Ai, Rui-Chen Zheng, Hui-Peng Du, Xiao-Hang Jiang, Zhen-Hua Ling |
| 2025 | Interspeech | Improving Noise Robustness of LLM-based Zero-shot TTS via Discrete Acoustic Token Denoising. | Ye-Xin Lu, Hui-Peng Du, Fei Liu, Yang Ai, Zhen-Hua Ling |
| 2024 | ICASSP | Considering Temporal Connection between Turns for Conversational Speech Synthesis. | Kangdi Mei, Zhaoci Liu, Hui-Peng Du, Hengyu Li, Yang Ai, Liping Chen, Zhenhua Ling |
| 2024 | Interspeech | BiVocoder: A Bidirectional Neural Vocoder Integrating Feature Extraction and Waveform Generation. | Hui-Peng Du, Ye-Xin Lu, Yang Ai, Zhen-Hua Ling |