| 2026 | AAAI | Detect All-Type Deepfake Audio: Wavelet Prompt Tuning for Enhanced Auditory Perception. | Yuankun Xie, Ruibo Fu, Xiaopeng Wang, Zhiyong Wang, Songjun Cao, Long Ma, Haonan Cheng, Long Ye |
| 2025 | ICASSP | M-MoE: Mixture of Mixture-of-Expert Model for CTC-based Streaming Multilingual ASR. | Songjun Cao, Xiong Wang, Yike Zhang, Xiaoming Zhang, Long Ma |
| 2025 | ICASSP | DiffCSS: Diverse and Expressive Conversational Speech Synthesis with Diffusion Models. | Weihao Wu, Zhiwei Lin, Yixuan Zhou, Jingbei Li, Rui Niu, Qinghua Wu, Songjun Cao, Long Ma, Zhiyong Wu |
| 2025 | Interspeech | MPE-TTS: Customized Emotion Zero-Shot Text-To-Speech Using Multi-Modal Prompt. | Zhichao Wu, Yueteng Kang, Songjun Cao, Long Ma, Qiulin Li, Qun Yang |
| 2025 | Interspeech | Monotonic Attention for Robust Text-to-Speech Synthesis in Large Language Model Frameworks. | Yike Zhang, Yiming Li, Jie Chen, Qinghua Wu, Songjun Cao, Long Ma |
| 2025 | Interspeech | SonarGuard2: Ultrasonic Face Liveness Detection Based on Adaptive Doppler Effect Feature Extraction. | Xiaoming Zhang, Ke-Yue Zhang, Taiping Yao, Songjun Cao, Shouhong Ding, Long Ma |
| 2024 | Interspeech | A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition. | Yangze Li, Xiong Wang, Songjun Cao, Yike Zhang, Long Ma, Lei Xie |
| 2022 | ICASSP | Improving CTC-Based Speech Recognition Via Knowledge Transferring from Pre-Trained Language Models. | Keqi Deng, Songjun Cao, Yike Zhang, Long Ma, Gaofeng Cheng, Ji Xu, Pengyuan Zhang |
| 2022 | Interspeech | Censer: Curriculum Semi-supervised Learning for Speech Recognition Based on Self-supervised Pre-training. | Bowen Zhang, Songjun Cao, Xiaoming Zhang, Yike Zhang, Long Ma, Takahiro Shinozaki |
| 2021 | ASRU | Improving Hybrid CTC/Attention End-to-End Speech Recognition with Pretrained Acoustic and Language Models. | Keqi Deng, Songjun Cao, Yike Zhang, Long Ma |
| 2021 | Interspeech | Improving Streaming Transformer Based ASR Under a Framework of Self-Supervised Learning. | Songjun Cao, Yueteng Kang, Yanzhe Fu, Xiaoshuo Xu, Sining Sun, Yike Zhang, Long Ma |
| 2021 | Interspeech | Improving Accent Identification and Accented Speech Recognition Under a Framework of Self-Supervised Learning. | Keqi Deng, Songjun Cao, Long Ma |
| 2021 | Interspeech | Explore wav2vec 2.0 for Mispronunciation Detection. | Xiaoshuo Xu, Yueteng Kang, Songjun Cao, Binghuai Lin, Long Ma |