Skip to content

Zhihao Du

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

24

Venues

7

Active years

2019–2025

Best venue rank

A*

Where they publish

Papers

24 indexed papers, newest first.

YearVenueTitleAuthors
2025AAAISpeech Recognition Meets Large Language Model: Benchmarking, Models, and Exploration.Ziyang Ma, Guanrou Yang, Yifan Yang, Zhifu Gao, Jiaming Wang, Zhihao Du, Fan Yu, Qian Chen, Siqi Zheng, Shiliang Zhang, Xie Chen
2025ACLOmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation.Qinglin Zhang, Luyao Cheng, Chong Deng, Qian Chen, Wen Wang, Siqi Zheng, Jiaqing Liu, Hai Yu, Chao-Hong Tan, Zhihao Du, Shiliang Zhang
2025EMNLPUniSpeaker: A Unified Approach for Multimodality-driven Speaker Generation.Zhengyan Sheng, Zhihao Du, Heng Lu, Shiliang Zhang, Zhen-Hua Ling
2025ICASSPBuild LLM-Based Zero-Shot Streaming TTS System with Cosyvoice.Xiang Lyu, Yuxuan Wang, Tianyu Zhao, Hao Wang, Huadai Liu, Zhihao Du
2025ICASSPEnhancing Low-Resource ASR through Versatile TTS: Bridging the Data Gap.Guanrou Yang, Fan Yu, Ziyang Ma, Zhihao Du, Zhifu Gao, Shiliang Zhang, Xie Chen
2025InterspeechDifferentiable Reward Optimization for LLM based TTS system.Changfeng Gao, Zhihao Du, Shiliang Zhang
2024ICASSPFunCodec: A Fundamental, Reproducible and Integrable Open-Source Toolkit for Neural Speech Codec.Zhihao Du, Shiliang Zhang, Kai Hu, Siqi Zheng
2024InterspeechPersonality-memory Gated Adaptation: An Efficient Speaker Adaptation for Personalized End-to-end Automatic Speech Recognition.Yue Gu, Zhihao Du, Shiliang Zhang, Jiqing Han, Yongjun He
2023ASRUThe Second Multi-Channel Multi-Party Meeting Transcription Challenge (M2MeT 2.0): A Benchmark for Speaker-Attributed ASR.Yuhao Liang, Mohan Shi, Fan Yu, Yangze Li, Shiliang Zhang, Zhihao Du, Qian Chen, Lei Xie, Yanmin Qian, Jian Wu, Zhuo Chen, Kong Aik Lee, Zhijie Yan, Hui Bu
2023ASRUSa-Paraformer: Non-Autoregressive End-To-End Speaker-Attributed ASR.Yangze Li, Fan Yu, Yuhao Liang, Pengcheng Guo, Mohan Shi, Zhihao Du, Shiliang Zhang, Lei Xie
2023ICASSPTOLD: a Novel Two-Stage Overlap-Aware Framework for Speaker Diarization.Jiaming Wang, Zhihao Du, Shiliang Zhang
2023InterspeechFunASR: A Fundamental End-to-End Speech Recognition Toolkit.Zhifu Gao, Zerui Li, Jiaming Wang, Haoneng Luo, Xian Shi, Mengzhe Chen, Yabin Li, Lingyun Zuo, Zhihao Du, Shiliang Zhang
2023InterspeechPersonality-aware Training based Speaker Adaptation for End-to-end Speech Recognition.Yue Gu, Zhihao Du, Shiliang Zhang, Qian Chen, Jiqing Han
2023InterspeechCASA-ASR: Context-Aware Speaker-Attributed ASR.Mohan Shi, Zhihao Du, Qian Chen, Fan Yu, Yangze Li, Shiliang Zhang, Jie Zhang, Li-Rong Dai
2022EMNLPSpeaker Overlap-aware Neural Diarization for Multi-party Meeting Analysis.Zhihao Du, Shiliang Zhang, Siqi Zheng, Zhi-Jie Yan
2022ICASSPM2Met: The Icassp 2022 Multi-Channel Multi-Party Meeting Transcription Challenge.Fan Yu, Shiliang Zhang, Yihui Fu, Lei Xie, Siqi Zheng, Zhihao Du, Weilong Huang, Pengcheng Guo, Zhijie Yan, Bin Ma, Xin Xu, Hui Bu
2022ICASSPSummary on the ICASSP 2022 Multi-Channel Multi-Party Meeting Transcription Grand Challenge.Fan Yu, Shiliang Zhang, Pengcheng Guo, Yihui Fu, Zhihao Du, Siqi Zheng, Weilong Huang, Lei Xie, Zheng-Hua Tan, DeLiang Wang, Yanmin Qian, Kong Aik Lee, Zhijie Yan, Bin Ma, Xin Xu, Hui Bu
2022InterspeechA Comparative Study on Speaker-attributed Automatic Speech Recognition in Multi-party Meetings.Fan Yu, Zhihao Du, Shiliang Zhang, Yuxiao Lin, Lei Xie
2021ICASSPCapturing Temporal Dependencies Through Future Prediction for CNN-Based Audio Classifiers.Hongwei Song, Jiqing Han, Shiwen Deng, Zhihao Du
2020ICASSPPan: Phoneme-Aware Network for Monaural Speech Enhancement.Zhihao Du, Ming Lei, Jiqing Han, Shiliang Zhang
2020ICONIPAn Efficient Joint Training Framework for Robust Small-Footprint Keyword Spotting.Yue Gu, Zhihao Du, Hui Zhang, Xueliang Zhang
2020InterspeechDouble Adversarial Network Based Monaural Speech Enhancement for Robust Speech Recognition.Zhihao Du, Jiqing Han, Xueliang Zhang
2020InterspeechSelf-Supervised Adversarial Multi-Task Learning for Vocoder-Based Monaural Speech Enhancement.Zhihao Du, Ming Lei, Jiqing Han, Shiliang Zhang
2019InterspeechAcoustic Scene Classification by Implicitly Identifying Distinct Sound Events.Hongwei Song, Jiqing Han, Shiwen Deng, Zhihao Du