| 2025 | Mitigating Language Mismatch in SSL-Based Speaker Anonymization. | Zhe Zhang, Wen-Chin Huang, Xin Wang, Xiaoxiao Miao, Junichi Yamagishi |
| 2025 | Tonal Perception in Changde Mandarin. | Zhenrui Zhang, Fang Hu |
| 2025 | Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate. | Hanglei Zhang, Yiwei Guo, Zhihan Li, Xiang Hao, Xie Chen, Kai Yu |
| 2025 | Quantifying and Reducing Speaker Heterogeneity within the Common Voice Corpus for Phonetic Analysis. | Miao Zhang, Aref Farhadipour, Annie Baker, Jiachen Ma, Bogdan Pricop, Eleanor Chodroff |
| 2025 | DiffStereo: End-to-End Mono-to-Stereo Audio Generation with Diffusion Transformer. | Suqi Zhang, Zheqi Dai, Yongyi Zang, Yin Cao, Qiuqiang Kong |
| 2025 | X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance. | Junbo Zhang, Heinrich Dinkel, Yadong Niu, Chenyu Liu, Si Cheng, Anbei Zhao, Jian Luan |
| 2025 | Selective Channel Attention based Target Speaker Voice Activity Detection for Speaker Diarization under AD-HOC Microphone Array Settings. | Hongyu Zhang, Ming Cheng, Jing Feng, Ming Li |
| 2025 | Multi-task learning for speech emotion recognition in naturalistic conditions. | Bartlomiej Zgrzynski, Juliusz Wjtowicz-Kruk, Piotr Masztalski, Wladyslaw Sredniawa |
| 2025 | Feature Importance across Domains for Improving Non-Intrusive Speech Intelligibility Prediction in Hearing Aids. | Ryandhimas E. Zezario, Sabato Marco Siniscalchi, Fei Chen, Hsin-Min Wang, Yu Tsao |
| 2025 | Assessing the Performance and Efficiency of Mamba ASR in Low-Resource Scenarios. | Rodolfo Zevallos, Mart Cortada Garcia, Sarah Solito, Carlos Mena, Alex Peir Lilja, Javier Hernando |
| 2025 | How to Recover Long Audio Sequences Through Gradient Inversion Attack With Dynamic Segment-based Reconstruction. | Xijie Zeng, Frank Rudzicz |
| 2025 | Text Entry for All: Towards Speech-based Multimodal Interaction for Inclusion, Accessibility and the Preservation of the World's Linguistic Heritage. | Julin Zapata, Lara Hanna |
| 2025 | Bridging the Training-Inference Gap in TTS: Training Strategies for Robust Generative Postprocessing for Low-Resource Speakers. | Frank Zalkow, Paolo Sani, Kishor Kayyar Lakshminarayana, Emanul A. P. Habets, Nicola Pia, Christian Dittmar |
| 2025 | Flexible VAD-PVAD Transition: A Detachable PVAD Module for Dynamic Encoder RNN VAD. | En-Lun Yu, Chien-Chun Wang, Jeih-Weih Hung, Shih-Chieh Huang, Berlin Chen |
| 2025 | Mimic Blocker: Self-Supervised Adversarial Training for Voice Conversion Defense with Pretrained Feature Extractors. | Gwangyeol Yu, Junhyeok Lee, Seoryeong Kim, Jimin Lee, Jehyuk Lee |
| 2025 | Online AV-CrossNet: a Causal and Efficient Audiovisual System for Speech Enhancement and Target Speaker Extraction. | Cheng Yu, Vahid Ahmadi Kalkhorani, Buye Xu, DeLiang Wang |
| 2025 | Bona fide Cross Testing Reveals Weak Spot in Audio Deepfake Detection Systems. | Kwok Chin Yuen, Jia Qi Yip, Zhen Qiu, Chi-Hung Chi, Kwok-Yan Lam |
| 2025 | Improving Synthetic Data Training for Contextual Biasing Models with a Keyword-Aware Cost Function. | Kwok Chin Yuen, Jia Qi Yip, Eng Siong Chng |
| 2025 | Efficient Trie-based Biasing using K-step Prediction for Rare Word Recognition. | Kwok Chin Yuen, Jia Qi Yip |
| 2025 | How do both phonological and syntactic complexity influence speech planning? | Ivan Yuen, Katherine Demuth, Stefanie Shattuck-Hufnagel |
| 2025 | Challenges and practical guidelines for atypical speech data collection, annotation, usage and sharing: A multi-project perspective. | Zhengjun Yue, Mara Barberis, Tanvina Patel, Judith Dineley, Willemijn Doedens, Lottie Stipdonk, Yuanyuan Zhang, Elke De Witte, Erfan Loweimi, Hugo Van hamme, Djaina Satoer, Marina B. Ruiter, Laureano Moro-Velzquez, Nicholas Cummins, Odette Scharenborg |
| 2025 | SaD: A Scenario-Aware Discriminator for Speech Enhancement. | Xihao Yuan, Siqi Liu, Yan Chen, Hang Zhou, Chang Liu, Hanting Chen, Jie Hu |
| 2025 | M3L: A Multi-Modal and Multi-Lingual Depression Detection Framework. | Jiajun You, Shuai Wang, Xun Gong, Xiang Wan |
| 2025 | Can Speech Accurately Detect Depression in Patients With Comorbid Dementia? An Approach for Mitigating Confounding Effects of Depression and Dementia. | Sophie Young, Fuxiang Tao, Bahman Mirheidari, Madhurananda Pahar, Markus Reuber, Heidi Christensen |
| 2025 | Training Onset-and-Offset-Aware Sound Event Detection on a Heterogeneous Dataset via Probabilistic Sequential Modeling. | Tomoya Yoshinaga, Yoshiaki Bando, Keitaro Tanaka, Keisuke Imoto, Masaki Onishi, Shigeo Morishima |