| 2025 | Listen, Analyze, and Adapt to Learn New Attacks: An Exemplar-Free Class Incremental Learning Method for Audio Deepfake Source Tracing. | Yang Xiao, Rohan Kumar Das |
| 2025 | TF-Mamba: A Time-Frequency Network for Sound Source Localization. | Yang Xiao, Rohan Kumar Das |
| 2025 | Alzheimer's Dementia Detection Using Perplexity from Paired Large Language Models. | Yao Xiao, Heidi Christensen, Stefan Goetze |
| 2025 | Speech Mutil-label Emotion Recognition Using Asymmetric Class Loss Function Based on Effective Samples. | Shanshan Xiang, Hankiz Yilahun, Askar Hamdulla |
| 2025 | Modeling Formant Dynamics in Mandarin /ai/: Effects of Speech Style and Speech Rate. | Yunzhuo Xiang, Jingyi Sun |
| 2025 | A Semantic Information-based Hierarchical Speech Enhancement Method Using Factorized Codec and Diffusion Model. | Yang Xiang, Canan Huang, Desheng Hu, Jingguang Tian, Xinhui Hu, Chao Zhang |
| 2025 | MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition. | Yinfeng Xia, Huiyan Li, Chenyang Le, Manhong Wang, Yutao Sun, Xingyang Ma, Yanmin Qian |
| 2025 | Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction. | Wenxuan Wu, Shuai Wang, Xixin Wu, Helen Meng, Haizhou Li |
| 2025 | A Novel Deep Learning Framework for Efficient Multichannel Acoustic Feedback Control. | Yuan-Kuei Wu, Juan Azcarreta Ortiz, Kashyap Patel, Buye Xu, Jung-Suk Lee, Sanha Lee, Ashutosh Pandey |
| 2025 | 2D Immersed Boundary Method in Vocal Tract Acoustics: An Eulerian-Lagrangian Model for Simulation of Diphthongs. | Rongshuai Wu, Debasish Ray Mohapatra, Sidney Fels |
| 2025 | Towards Few-Shot Training-Free Anomaly Sound Detection. | Ho-Hsiang Wu, Wei-Cheng Lin, Abinaya Kumar, Luca Bondi, Shabnam Ghaffarzadegan, Juan Pablo Bello |
| 2025 | GALAXY: A Large-Scale Open-Domain Dataset for Multimodal Learning. | Yihan Wu, Yichen Lu, Yijing Chen, Jiaqi Song, William Chen, Ruihua Song, Shinji Watanabe |
| 2025 | TS3-Codec: Transformer-Based Simple Streaming Single Codec. | Haibin Wu, Naoyuki Kanda, Sefik Emre Eskimez, Jinyu Li |
| 2025 | MPE-TTS: Customized Emotion Zero-Shot Text-To-Speech Using Multi-Modal Prompt. | Zhichao Wu, Yueteng Kang, Songjun Cao, Long Ma, Qiulin Li, Qun Yang |
| 2025 | A Comparative Study on Proactive and Passive Detection of Deepfake Speech. | Chia-Hua Wu, Wanying Ge, Xin Wang, Junichi Yamagishi, Yu Tsao, Hsin-Min Wang |
| 2025 | CrossPhon: An Auto Phone Mapping Tool to Streamline Cross-language Modeling for Phone Alignment of Low-resource Languages. | Hongchen Wu, Yixin Gu |
| 2025 | Evaluating Automatic Speech Recognition Pipelines for Mandarin-English Bilingual Child Language Assessment in Telehealth. | Hongchen Wu, Yao Du, Zirong Li, Yixin Gu, Disha Thotappala Jayaprakash, Li Sheng |
| 2025 | A Watermark for Auto-Regressive Speech Generation Models. | Yihan Wu, Ruibo Chen, Georgios Milis, Junfeng Guo, Heng Huang |
| 2025 | The 1st SpeechWellness Challenge: Detecting Suicide Risk Among Adolescents. | Wen Wu, Ziyun Cui, Chang Lei, Yinan Duan, Diyang Qu, Ji Wu, Bowen Zhou, Runsen Chen, Chao Zhang |
| 2025 | ClaritySpeech: Dementia Obfuscation in Speech. | Dominika C. Woszczyk, Ranya Aloufi, Soteris Demetriou |
| 2025 | Variability in Intervocalic /t/ and Community Diversity in Australian English. | Hannah White, Joshua Penney, Felicity Cox |
| 2025 | Speech Reference Intervals: An Assessment of Feasibility in Depression Symptom Severity Prediction. | Lauren L. White, Ewan Carr, Judith Dineley, Catarina Botelho, Pauline Conde, Faith Matcham, Carolin Oetzmann, Amos Folarin, George Fairs, Agnes Norbury, Stefano Goria, Srinivasan Vairavan, Til Wykes, Richard J. B. Dobson, Vaibhav A. Narayan, Matthew Hotopf, Alberto Abad, Isabel Trancoso, Nicholas Cummins |
| 2025 | Towards Early Prediction of Self-Supervised Speech Model Performance. | Ryan Whetten, Lucas Maison, Titouan Parcollet, Marco Dinarelli, Yannick Estve |
| 2025 | What the Filler? Both ASR Systems and Humans Struggle More With Other Kinds of Disfluencies Than With Filler Particles. | Saskia Wepner, Lucas Eckert, Gernot Kubin, Barbara Schuppler |
| 2025 | SPCODEC: Split and Prediction for Neural Speech Codec. | Liang Wen, Lizhong Wang, Yuxing Zheng, Weijing Shi, Kwang Pyo Choi |