| 2025 | Mitigating Overfitting During Speech Foundation Model Fine-tuning: Applications to Dysarthric Speech Detection. | Yan Xiong, Visar Berisha, Julie Liss, Chaitali Chakrabarti |
| 2025 | Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition. | Dominik Wagner, Ilja Baumann, Natalie Engert, Seanie Lee, Elmar Nth, Korbinian Riedhammer, Tobias Bocklet |
| 2025 | ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction. | Minu Kim, Kangwook Jang, Hoirin Kim |
| 2025 | Alzheimer's Disease Detection Using Co-Attention Mechanism for Acoustic and ASR-Transcribed Text Features. | Yongqi Shao, Tao Fang |
| 2025 | CAMER: Contribution-Aware Multimodal Emotion Recognition. | Sun-Kyung Lee, Jong-Hwan Kim |
| 2024 | CrisperWhisper: Accurate Timestamps on Verbatim Speech Transcriptions. | Mario Zusag, Laurin Wagner, Bernhard Thallinger |
| 2024 | Analyzing Speech Motor Movement using Surface Electromyography in Minimally Verbal Adults with Autism Spectrum Disorder. | Wazeer Zulfikar, Nishat Protyasha, Camila Canales, Heli Patel, James Williamson, Laura Sarnie, Lisa Nowinski, Nataliya Kosmyna, Paige Townsend, Sophia Yuditskaya, Tanya Talkar, Utkarsh Oggy Sarawgi, Christopher J. McDougle, Thomas F. Quatieri, Pattie Maes, Maria Mody |
| 2024 | E-Paraformer: A Faster and Better Parallel Transformer for Non-autoregressive End-to-End Mandarin Speech Recognition. | Kun Zou, Fengyun Tan, Ziyang Zhuang, Chenfeng Miao, Tao Wei, Shaodan Zhai, Zijian Li, Wei Hu, Shaojun Wang, Jing Xiao |
| 2024 | Prompt Link Multimodal Fusion in Multimodal Sentiment Analysis. | Kang Zhu, Cunhang Fan, Jianhua Tao, Zhao Lv |
| 2024 | TraceableSpeech: Towards Proactively Traceable Text-to-Speech with Watermarking. | Junzuo Zhou, Jiangyan Yi, Tao Wang, Jianhua Tao, Ye Bai, Chu Yuan Zhang, Yong Ren, Zhengqi Wen |
| 2024 | A Comprehensive Investigation on Speaker Augmentation for Speaker Recognition. | Zhenyu Zhou, Shibiao Xu, Shi Yin, Lantian Li, Dong Wang |
| 2024 | Cross-Modal Denoising: A Novel Training Paradigm for Enhancing Speech-Image Retrieval. | Lifeng Zhou, Yuke Li, Rui Deng, Yuting Yang, Haoqi Zhu |
| 2024 | YOLO-Stutter: End-to-end Region-Wise Speech Dysfluency Detection. | Xuanru Zhou, Anshul Kashyap, Steve Li, Ayati Sharma, Brittany Morin, David Baquirin, Jet Vonk, Zoe Ezzes, Zachary A. Miller, Maria Luisa Gorno-Tempini, Jiachen Lian, Gopala Anumanchipalli |
| 2024 | PLDNet: PLD-Guided Lightweight Deep Network Boosted by Efficient Attention for Handheld Dual-Microphone Speech Enhancement. | Nan Zhou, Youhai Jiang, Jialin Tan, Chongmin Qi |
| 2024 | Leveraging Large Language Models to Refine Automatic Feedback Generation at Articulatory Level in Computer Aided Pronunciation Training. | Huihang Zhong, Yanlu Xie, ZiJin Yao |
| 2024 | Enhancing Partially Spoofed Audio Localization with Boundary-aware Attention Mechanism. | Jiafeng Zhong, Bin Li, Jiangyan Yi |
| 2024 | Multi-Modal Automatic Prosody Annotation with Contrastive Pretraining of Speech-Silence and Word-Punctuation. | Jinzuomu Zhong, Yang Li, Hui Huang, Korin Richmond, Jie Liu, Zhiba Su, Jing Guo, Benlai Tang, Fengjie Zhu |
| 2024 | An efficient text augmentation approach for contextualized Mandarin speech recognition. | Naijun Zheng, Xucheng Wan, Kai Liu, Ziqing Du, Huan Zhou |
| 2024 | SOT Triggered Neural Clustering for Speaker Attributed ASR. | Xianrui Zheng, Guangzhi Sun, Chao Zhang, Philip C. Woodland |
| 2024 | Streamlining Speech Enhancement DNNs: an Automated Pruning Method Based on Dependency Graph with Advanced Regularized Loss Strategies. | Zugang Zhao, Jinghong Zhang, Yonghui Liu, Jianbing Liu, Kai Niu, Zhiqiang He |
| 2024 | Deep Echo Path Modeling for Acoustic Echo Cancellation. | Fei Zhao, Chenggang Zhang, Shulin He, Jinjiang Liu, Xueliang Zhang |
| 2024 | MINT: Boosting Audio-Language Model via Multi-Target Pre-Training and Instruction Tuning. | Hang Zhao, Yifei Xin, Zhesong Yu, Bilei Zhu, Lu Lu, Zejun Ma |
| 2024 | Whisper-PMFA: Partial Multi-Scale Feature Aggregation for Speaker Verification using Whisper Models. | Yiyang Zhao, Shuai Wang, Guangzhi Sun, Zehua Chen, Chao Zhang, Mingxing Xu, Thomas Fang Zheng |
| 2024 | SAML: Speaker Adaptive Mixture of LoRA Experts for End-to-End ASR. | Qiuming Zhao, Guangzhi Sun, Chao Zhang, Mingxing Xu, Thomas Fang Zheng |
| 2024 | SDAEC: Signal Decoupling for Advancing Acoustic Echo Cancellation. | Fei Zhao, Jinjiang Liu, Xueliang Zhang |