| 2025 | MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing. | Junjie Zheng, Zihao Chen, Chaofan Ding, Yunming Liang, Yihan Fan, Huan Yang, Lei Xie, Xinhan Di |
| 2025 | Prosody-Adaptable Audio Codecs for Zero-Shot Voice Conversion via In-Context Learning. | Junchuan Zhao, Xintong Wang, Ye Wang |
| 2025 | Lightweight Front-end Enhancement for Robust ASR via Frame Resampling and Sub-Band Pruning. | Siyi Zhao, Wei Wang, Yanmin Qian |
| 2025 | Investigating Glottal Stop Coda Loss During Sound Change of Checked Syllables Based on Speech-EGG Voice Offset Alignment. | Bingliang Zhao, Xiyu Wu |
| 2025 | Restoring Harmonics: Enhancing Speech Quality with Deep Mask and Harmonic Restoration Network. | Yu Zhao, Zengqiang Shang, Mou Wang, Xin Liu, Pengyuan Zhang |
| 2025 | ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment. | Shengkui Zhao, Zexu Pan, Bin Ma |
| 2025 | Defending Unauthorized Voice Cloning with Watermark-Aware Codecs. | Jiankun Zhao, Lingwei Meng, Chengxi Deng, Helen Meng, Xixin Wu |
| 2025 | The Role of Contextual Variation in Learning Cantonese Tones from Naturalistic Speech. | Fengyue Lisa Zhao, Jennifer Kuo |
| 2025 | On the Design of a Robust Superdirective Beamformer and Topology Parameter Optimization with Frustum-Shaped Microphone Arrays Featuring Multiple Rings. | Kunlong Zhao, Gongping Huang, Xudong Zhao, Jingdong Chen, Jacob Benesty, Zoran Cvetkovic |
| 2025 | Room Impulse Response as a Prompt for Acoustic Echo Cancellation. | Fei Zhao, Shulin He, Xueliang Zhang |
| 2025 | TA-RIR: Topology-Aware Neural Modeling of Acoustic Propagation for Room Impulse Response Synthesis. | Junhui Zhao, Hang Chen, Qing Wang, Jun Du, Yanhui Tu, Feng Ma |
| 2025 | Multi-Channel Acoustic Echo Cancellation Based on Direction-of-Arrival Estimation. | Fei Zhao, Xueliang Zhang, Zhong-Qiu Wang |
| 2025 | SonarGuard2: Ultrasonic Face Liveness Detection Based on Adaptive Doppler Effect Feature Extraction. | Xiaoming Zhang, Ke-Yue Zhang, Taiping Yao, Songjun Cao, Shouhong Ding, Long Ma |
| 2025 | Analysis and Evaluation of Synthetic Data Generation in Speech Dysfluency Detection. | Jinming Zhang, Xuanru Zhou, Jiachen Lian, Shuhe Li, William Li, Zoe Ezzes, Rian Bogley, Lisa Wauters, Zachary A. Miller, Jet Vonk, Brittany Morin, Maria Luisa Gorno-Tempini, Gopala Anumanchipalli |
| 2025 | PartialEdit: Identifying Partial Deepfakes in the Era of Neural Speech Editing. | You Zhang, Baotong Tian, Lin Zhang, Zhiyao Duan |
| 2025 | Employing self-supervised learning models for cross-linguistic child speech maturity classification. | Theo Zhang, Madurya Suresh, Anne Warluamont, Kasia Hitczenko, Alejandrina Cristi, Margaret Cychosz |
| 2025 | Lessons Learned from the URGENT 2024 Speech Enhancement Challenge. | Wangyou Zhang, Kohei Saijo, Samuele Cornell, Robin Scheibler, Chenda Li, Zhaoheng Ni, Anurag Kumar, Marvin Sach, Wei Wang, Yihui Fu, Shinji Watanabe, Tim Fingscheidt, Yanmin Qian |
| 2025 | GraphemeAug: A Systematic Approach to Synthesized Hard Negative Keyword Spotting Examples. | Harry Zhang, Kurt Partridge, Pai Zhu, Neng Chen, Hyun Jin Park, Dhruuv Agarwal, Quan Wang |
| 2025 | LSPnet: an ultra-low bitrate hybrid neural codec. | Bowen Zhang, Ian McLoughlin, Xiaoxiao Miao, A. S. Madhukumar |
| 2025 | Towards atypical speech transcription using LLM-based ASR. | Jinda Zhang, Aanchan Mohan |
| 2025 | Automated evaluation of children's speech fluency for low-resource languages. | Bowen Zhang, Nur Afiqah Abdul Latiff, Justin Kan, Rong Tong, Donny Soh, Xiaoxiao Miao, Ian McLoughlin |
| 2025 | Monotonic Attention for Robust Text-to-Speech Synthesis in Large Language Model Frameworks. | Yike Zhang, Yiming Li, Jie Chen, Qinghua Wu, Songjun Cao, Long Ma |
| 2025 | Co-registration of real-time MRI and respiration for speech research. | Yubin Zhang, Prakash Kumar, Ye Tian, Ziwei Zhao, Xuan Shi, Kevin Huang, Kevin Lee, Haley Hsu, Shrikanth Narayanan, Krishna S. Nayak, Louis Goldstein |
| 2025 | Knowledge Distillation Method for Pruned RNN-T Models via Pruning Bounds Sharing and Losses Confusion. | Xiaocan Zhang, Weiwei Jiang, Guibin Zheng, Chenhao Jing, Jiqing Han, Tieran Zheng |
| 2025 | Effect of Noise Floor in Room Impulse Response on Speech Perception Under Spherical Harmonics-based Spatial Sound Reproduction. | Yunqi C. Zhang, Dhruv Jagmohan, Hong Kit Li, C. T. Justine Hui, Yusuke Hioka |