| 2025 | AAAI | Speech Recognition Meets Large Language Model: Benchmarking, Models, and Exploration. | Ziyang Ma, Guanrou Yang, Yifan Yang, Zhifu Gao, Jiaming Wang, Zhihao Du, Fan Yu, Qian Chen, Siqi Zheng, Shiliang Zhang, Xie Chen |
| 2025 | ICASSP | Enhancing Low-Resource ASR through Versatile TTS: Bridging the Data Gap. | Guanrou Yang, Fan Yu, Ziyang Ma, Zhihao Du, Zhifu Gao, Shiliang Zhang, Xie Chen |
| 2024 | ACL | emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation. | Ziyang Ma, Zhisheng Zheng, Jiaxin Ye, Jinchao Li, Zhifu Gao, Shiliang Zhang, Xie Chen |
| 2024 | ICASSP | SeACo-Paraformer: A Non-Autoregressive ASR System with Flexible and Effective Hotword Customization Ability. | Xian Shi, Yexin Yang, Zerui Li, Yanni Chen, Zhifu Gao, Shiliang Zhang |
| 2024 | Interspeech | MaLa-ASR: Multimedia-Assisted LLM-Based ASR. | Guanrou Yang, Ziyang Ma, Fan Yu, Zhifu Gao, Shiliang Zhang, Xie Chen |
| 2023 | Interspeech | FunASR: A Fundamental End-to-End Speech Recognition Toolkit. | Zhifu Gao, Zerui Li, Jiaming Wang, Haoneng Luo, Xian Shi, Mengzhe Chen, Yabin Li, Lingyun Zuo, Zhihao Du, Shiliang Zhang |
| 2023 | Interspeech | Accurate and Reliable Confidence Estimation Based on Non-Autoregressive End-to-End Speech Recognition System. | Xian Shi, Haoneng Luo, Zhifu Gao, Shiliang Zhang, Zhijie Yan |
| 2022 | Interspeech | Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition. | Zhifu Gao, Shiliang Zhang, Ian McLoughlin, Zhijie Yan |
| 2021 | Interspeech | Extremely Low Footprint End-to-End ASR System for Smart Device. | Zhifu Gao, Yiwu Yao, Shiliang Zhang, Jun Yang, Ming Lei, Ian McLoughlin |
| 2020 | Interspeech | SAN-M: Memory Equipped Self-Attention for End-to-End Speech Recognition. | Zhifu Gao, Shiliang Zhang, Ming Lei, Ian McLoughlin |
| 2020 | Interspeech | Streaming Chunk-Aware Multihead Attention for Online End-to-End Speech Recognition. | Shiliang Zhang, Zhifu Gao, Haoneng Luo, Ming Lei, Jie Gao, Zhijie Yan, Lei Xie |
| 2019 | Interspeech | Improving Aggregation and Loss Function for Better Embedding Learning in End-to-End Speaker Verification System. | Zhifu Gao, Yan Song, Ian McLoughlin, Pengcheng Li, Yiheng Jiang, Li-Rong Dai |
| 2019 | Interspeech | An Effective Deep Embedding Learning Architecture for Speaker Verification. | Yiheng Jiang, Yan Song, Ian McLoughlin, Zhifu Gao, Li-Rong Dai |
| 2018 | Interspeech | An Improved Deep Embedding Learning Method for Short Duration Speaker Verification. | Zhifu Gao, Yan Song, Ian McLoughlin, Wu Guo, Lirong Dai |