| 2026 | ACL | ReStyle-TTS: Relative and Continuous Style Control for Zero-Shot Speech Synthesis. | Haitao Li, Chunxiang Jin, Chenglin Li, Wenhao Guan, Zhengxing Huang, Xie Chen |
| 2025 | ICASSP | Dynamic Language Group-based MoE: Enhancing Code-Switching Speech Recognition with Hierarchical Routing. | Hukai Huang, Shenghui Lu, Yahui Shan, He Qu, Fengrun Zhang, Wenhao Guan, Qingyang Hong, Lin Li |
| 2025 | ICASSP | SlimSpeech: Lightweight and Efficient Text-to-Speech with Slim Rectified Flow. | Kaidi Wang, Wenhao Guan, Shenghui Lu, Jianglong Yao, Lin Li, Qingyang Hong |
| 2025 | Interspeech | DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec. | Peijie Chen, Wenhao Guan, Kaidi Wang, Weijie Wu, Hukai Huang, Qingyang Hong, Lin Li |
| 2025 | Interspeech | ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization. | Pengyu Ren, Wenhao Guan, Kaidi Wang, Peijie Chen, Qingyang Hong, Lin Li |
| 2025 | Interspeech | Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion. | Kaidi Wang, Wenhao Guan, Ziyue Jiang, Hukai Huang, Peijie Chen, Weijie Wu, Qingyang Hong, Lin Li |
| 2024 | AAAI | MM-TTS: Multi-Modal Prompt Based Style Transfer for Expressive Text-to-Speech Synthesis. | Wenhao Guan, Yishuang Li, Tao Li, Hukai Huang, Feng Wang, Jiayan Lin, Lingyan Huang, Lin Li, Qingyang Hong |
| 2024 | ICASSP | Reflow-TTS: A Rectified Flow Model for High-Fidelity Text-to-Speech. | Wenhao Guan, Qi Su, Haodong Zhou, Shiyu Miao, Xingjia Xie, Lin Li, Qingyang Hong |
| 2024 | ICASSP | Multivariate Fourier Distribution Perturbation: Domain Shifts with Uncertainty in Frequency Domain. | Xianfeng Li, Weijie Chen, Shicai Yang, Yishuang Li, Wenhao Guan, Lin Li |
| 2024 | ICASSP | SR-HuBERT : An Efficient Pre-Trained Model for Speaker Verification. | Yishuang Li, Hukai Huang, Zhicong Chen, Wenhao Guan, Jiayan Lin, Lin Li, Qingyang Hong |
| 2024 | ICASSP | Improving Multi-Speaker ASR With Overlap-Aware Encoding And Monotonic Attention. | Tao Li, Feng Wang, Wenhao Guan, Lingyan Huang, Qingyang Hong, Lin Li |
| 2024 | ICRA | FastOcc: Accelerating 3D Occupancy Prediction by Fusing the 2D Bird's-Eye View and Perspective View. | Jiawei Hou, Xiaoyan Li, Wenhao Guan, Gang Zhang, Di Feng, Yuheng Du, Xiangyang Xue, Jian Pu |
| 2024 | Interspeech | LAFMA: A Latent Flow Matching Model for Text-to-Audio Generation. | Wenhao Guan, Kaidi Wang, Wangjin Zhou, Yang Wang, Feng Deng, Hui Wang, Lin Li, Qingyang Hong, Yong Qin |
| 2024 | Interspeech | Efficient Integrated Features Based on Pre-trained Models for Speaker Verification. | Yishuang Li, Wenhao Guan, Hukai Huang, Shiyu Miao, Qi Su, Lin Li, Qingyang Hong |
| 2024 | Interspeech | MinSpeech: A Corpus of Southern Min Dialect for Automatic Speech Recognition. | Jiayan Lin, Shenghui Lu, Hukai Huang, Wenhao Guan, Binbin Xu, Hui Bu, Qingyang Hong, Lin Li |
| 2023 | Interspeech | Interpretable Style Transfer for Text-to-Speech with ControlVAE and Diffusion Bridge. | Wenhao Guan, Tao Li, Yishuang Li, Hukai Huang, Qingyang Hong, Lin Li |