| 2025 | ICASSP | DetailTTS: Learning Residual Detail Information for Zero-shot Text-to-speech. | Cong Wang, Yichen Han, Yizhong Geng, Yingming Gao, Fengping Wang, Bingsong Bai, Qifei Li, Jinlong Xue, Yayue Deng, Zhengqi Wen, Ya Li |
| 2024 | ICASSP | Concss: Contrastive-based Context Comprehension for Dialogue-Appropriate Prosody in Conversational Speech Synthesis. | Yayue Deng, Jinlong Xue, Yukang Jia, Qifei Li, Yichen Han, Fengping Wang, Yingming Gao, Dengfeng Ke, Ya Li |
| 2024 | ICASSP | Frame-Level Emotional State Alignment Method for Speech Emotion Recognition. | Qifei Li, Yingming Gao, Cong Wang, Yayue Deng, Jinlong Xue, Yichen Han, Ya Li |
| 2024 | Interspeech | Retrieval Augmented Generation in Prompt-based Text-to-Speech Synthesis with Context-Aware Contrastive Language-Audio Pretraining. | Jinlong Xue, Yayue Deng, Yingming Gao, Ya Li |
| 2024 | Interspeech | Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model. | Jinlong Xue, Yayue Deng, Yicheng Han, Yingming Gao, Ya Li |
| 2023 | ICASSP | M | Jinlong Xue, Yayue Deng, Fengping Wang, Ya Li, Yingming Gao, Jianhua Tao, Jianqing Sun, Jiaen Liang |
| 2022 | MMSP | A Keypoint Based Enhancement Method for Audio Driven Free View Talking Head Synthesis. | Yichen Han, Ya Li, Yingming Gao, Jinlong Xue, Songpo Wang, Lei Yang |