| 2025 | AAAI | Speech Recognition Meets Large Language Model: Benchmarking, Models, and Exploration. | Ziyang Ma, Guanrou Yang, Yifan Yang, Zhifu Gao, Jiaming Wang, Zhihao Du, Fan Yu, Qian Chen, Siqi Zheng, Shiliang Zhang, Xie Chen |
| 2025 | ACL | OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation. | Qinglin Zhang, Luyao Cheng, Chong Deng, Qian Chen, Wen Wang, Siqi Zheng, Jiaqing Liu, Hai Yu, Chao-Hong Tan, Zhihao Du, Shiliang Zhang |
| 2025 | EMNLP | UniSpeaker: A Unified Approach for Multimodality-driven Speaker Generation. | Zhengyan Sheng, Zhihao Du, Heng Lu, Shiliang Zhang, Zhen-Hua Ling |
| 2025 | ICASSP | Build LLM-Based Zero-Shot Streaming TTS System with Cosyvoice. | Xiang Lyu, Yuxuan Wang, Tianyu Zhao, Hao Wang, Huadai Liu, Zhihao Du |
| 2025 | ICASSP | Enhancing Low-Resource ASR through Versatile TTS: Bridging the Data Gap. | Guanrou Yang, Fan Yu, Ziyang Ma, Zhihao Du, Zhifu Gao, Shiliang Zhang, Xie Chen |
| 2025 | Interspeech | Differentiable Reward Optimization for LLM based TTS system. | Changfeng Gao, Zhihao Du, Shiliang Zhang |
| 2024 | ICASSP | FunCodec: A Fundamental, Reproducible and Integrable Open-Source Toolkit for Neural Speech Codec. | Zhihao Du, Shiliang Zhang, Kai Hu, Siqi Zheng |
| 2024 | Interspeech | Personality-memory Gated Adaptation: An Efficient Speaker Adaptation for Personalized End-to-end Automatic Speech Recognition. | Yue Gu, Zhihao Du, Shiliang Zhang, Jiqing Han, Yongjun He |
| 2023 | ASRU | The Second Multi-Channel Multi-Party Meeting Transcription Challenge (M2MeT 2.0): A Benchmark for Speaker-Attributed ASR. | Yuhao Liang, Mohan Shi, Fan Yu, Yangze Li, Shiliang Zhang, Zhihao Du, Qian Chen, Lei Xie, Yanmin Qian, Jian Wu, Zhuo Chen, Kong Aik Lee, Zhijie Yan, Hui Bu |
| 2023 | ASRU | Sa-Paraformer: Non-Autoregressive End-To-End Speaker-Attributed ASR. | Yangze Li, Fan Yu, Yuhao Liang, Pengcheng Guo, Mohan Shi, Zhihao Du, Shiliang Zhang, Lei Xie |
| 2023 | ICASSP | TOLD: a Novel Two-Stage Overlap-Aware Framework for Speaker Diarization. | Jiaming Wang, Zhihao Du, Shiliang Zhang |
| 2023 | Interspeech | FunASR: A Fundamental End-to-End Speech Recognition Toolkit. | Zhifu Gao, Zerui Li, Jiaming Wang, Haoneng Luo, Xian Shi, Mengzhe Chen, Yabin Li, Lingyun Zuo, Zhihao Du, Shiliang Zhang |
| 2023 | Interspeech | Personality-aware Training based Speaker Adaptation for End-to-end Speech Recognition. | Yue Gu, Zhihao Du, Shiliang Zhang, Qian Chen, Jiqing Han |
| 2023 | Interspeech | CASA-ASR: Context-Aware Speaker-Attributed ASR. | Mohan Shi, Zhihao Du, Qian Chen, Fan Yu, Yangze Li, Shiliang Zhang, Jie Zhang, Li-Rong Dai |
| 2022 | EMNLP | Speaker Overlap-aware Neural Diarization for Multi-party Meeting Analysis. | Zhihao Du, Shiliang Zhang, Siqi Zheng, Zhi-Jie Yan |
| 2022 | ICASSP | M2Met: The Icassp 2022 Multi-Channel Multi-Party Meeting Transcription Challenge. | Fan Yu, Shiliang Zhang, Yihui Fu, Lei Xie, Siqi Zheng, Zhihao Du, Weilong Huang, Pengcheng Guo, Zhijie Yan, Bin Ma, Xin Xu, Hui Bu |
| 2022 | ICASSP | Summary on the ICASSP 2022 Multi-Channel Multi-Party Meeting Transcription Grand Challenge. | Fan Yu, Shiliang Zhang, Pengcheng Guo, Yihui Fu, Zhihao Du, Siqi Zheng, Weilong Huang, Lei Xie, Zheng-Hua Tan, DeLiang Wang, Yanmin Qian, Kong Aik Lee, Zhijie Yan, Bin Ma, Xin Xu, Hui Bu |
| 2022 | Interspeech | A Comparative Study on Speaker-attributed Automatic Speech Recognition in Multi-party Meetings. | Fan Yu, Zhihao Du, Shiliang Zhang, Yuxiao Lin, Lei Xie |
| 2021 | ICASSP | Capturing Temporal Dependencies Through Future Prediction for CNN-Based Audio Classifiers. | Hongwei Song, Jiqing Han, Shiwen Deng, Zhihao Du |
| 2020 | ICASSP | Pan: Phoneme-Aware Network for Monaural Speech Enhancement. | Zhihao Du, Ming Lei, Jiqing Han, Shiliang Zhang |
| 2020 | ICONIP | An Efficient Joint Training Framework for Robust Small-Footprint Keyword Spotting. | Yue Gu, Zhihao Du, Hui Zhang, Xueliang Zhang |
| 2020 | Interspeech | Double Adversarial Network Based Monaural Speech Enhancement for Robust Speech Recognition. | Zhihao Du, Jiqing Han, Xueliang Zhang |
| 2020 | Interspeech | Self-Supervised Adversarial Multi-Task Learning for Vocoder-Based Monaural Speech Enhancement. | Zhihao Du, Ming Lei, Jiqing Han, Shiliang Zhang |
| 2019 | Interspeech | Acoustic Scene Classification by Implicitly Identifying Distinct Sound Events. | Hongwei Song, Jiqing Han, Shiwen Deng, Zhihao Du |