| 2025 | Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding. | Yu Xi, Xiaoyu Gu, Haoyu Li, Jun Song, Bo Zheng, Kai Yu |
| 2025 | CASPER: A Large Scale Spontaneous Speech Dataset. | Cihan Xiao, Ruixing Liang, Xiangyu Zhang, Mehmet Emre Tiryaki, Veronica Bae, Lavanya Shankar, Rong Yang, Ethan Poon, Emmanuel Dupoux, Sanjeev Khudanpur, Leibny Paola Garca-Perera |
| 2025 | Learning Marmoset Vocal Patterns with a Masked Autoencoder for Robust Call Segmentation, Classification, and Caller Identification. | Bin Wu, Shinnosuke Takamichi, Sakriani Sakti, Satoshi Nakamura |
| 2025 | DyMEvalNet: Dynamic Text-Audio-Personalization Fusion for Multimodal Music Quality Assessment. | Xiaoxun Wu, Kailai Shen, Yuheng Huang, Naiyuan Li, Diqun Yan |
| 2025 | ASR for Affective Speech: Investigating Impact of Emotion and Speech Generative Strategy. | Ya-Tse Wu, Chi-Chun Lee |
| 2025 | Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model. | Haibin Wu, Yuxuan Hu, Ruchao Fan, Xiaofei Wang, Ken'ichi Kumatani, Bo Ren, Jianwei Yu, Heng Lu, Lijuan Wang, Yao Qian, Jinyu Li |
| 2025 | CLAIRA: Leveraging Large Language Models to Judge Audio Captions. | Tsung-Han Wu, Joseph E. Gonzalez, Trevor Darrell, David M. Chan |
| 2025 | Diversity and complementarity of speech encoders across diverse tasks in a multi-modal large language model. | Jeremy H. M. Wong, Muhammad Huzaifah, Hardik B. Sailor, Shuo Sun, Kye Min Tan, Bin Wang, Qiongqiong Wang, Wenyu Zhang, Xunlong Zou, Nancy F. Chen, Ai Ti Aw |
| 2025 | Speech in-context learning of paralinguistic tasks. | Jeremy H. M. Wong, Muhammad Huzaifah, Nancy F. Chen, Ai Ti Aw |
| 2025 | Obtaining objective labels and analysing annotator subjectivity by using a Rasch model for ordinal speech processing. | Jeremy H. M. Wong, Nancy F. Chen |
| 2025 | Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings. | Dyah A. M. G. Wisnu, Ryandhimas E. Zezario, Stefano Rini, Hsin-Min Wang, Yu Tsao |
| 2025 | Multi-Distillation from Speech and Music Representation Models. | Jui-Chiang Wei, Yi-Cheng Lin, Fabian Ritter-Gutierrez, Hung-Yi Lee |
| 2025 | MNSC: Advancing Singlish Speech Understanding with Carefully Curated Corpora. | Bin Wang, Xunlong Zou, Shuo Sun, Wenyu Zhang, Yingxu He, Zhuohan Liu, Chengwei Wei, Nancy F. Chen, AiTi Aw |
| 2025 | Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment. | Wei Wang, Wangyou Zhang, Chenda Li, Jaitong Shi, Shinji Watanabe, Yanmin Qian |
| 2025 | SincQDR-VAD: A Noise-Robust Voice Activity Detection Framework Leveraging Learnable Filters and Ranking-Aware Optimization. | Chien-Chun Wang, En-Lun Yu, Jeih-Weih Hung, Shih-Chieh Huang, Berlin Chen |
| 2025 | SSVD: Structured SVD for Parameter-Efficient Fine-Tuning and Benchmarking under Domain Shift in ASR. | Pu Wang, Shinji Watanabe, Hugo Van hamme |
| 2025 | Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models. | Qiongqiong Wang, Hardik Bhupendra Sailor, Jeremy H. M. Wong, Tianchi Liu, Shuo Sun, Wenyu Zhang, Muhammad Huzaifah, Nancy F. Chen, Ai Ti Aw |
| 2025 | Geolocation-Aware Robust Spoken Language Identification. | Qingzheng Wang, Hye-Jin Shim, Jiancheng Sun, Shinji Watanabe |
| 2025 | URGENT-PK: Perceptually-Aligned Ranking Model Designed for Speech Enhancement Competition. | Jiahe Wang, Chenda Li, Wei Wang, Wangyou Zhang, Samuele Cornell, Marvin Sach, Robin Scheibler, Kohei Saijo, Yihui Fu, Zhaoheng Ni, Anurag Kumar, Tim Fingscheidt, Shinji Watanabe, Yanmin Qian |
| 2025 | OOQ: Outlier-Oriented Quantization for Efficient Large Language Models. | Haoyu Wang, Bei Liu, Hang Shao, Bo Xiao, Ke Zeng, Guanglu Wan, Yanmin Qian |
| 2025 | QAMRO: Quality-aware Adaptive Margin Ranking Optimization for Human-aligned Assessment of Audio Generation Systems. | Chien-Chun Wang, Kuan-Tang Huang, Cheng-Yeh Yang, Hung-Shin Lee, Hsin-Min Wang, Berlin Chen |
| 2025 | Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency. | Haoran Wang, Guanyu Chen, Bohan Li, Hankun Wang, Yiwei Guo, Zhihan Li, Xie Chen, Kai Yu |
| 2025 | Recognizing Dementia from Neuropsychological Tests with State Space Models. | Liming Wang, Saurabhchand Bhati, Cody Karjadi, Rhoda Au, James R. Glass |
| 2025 | Can self-supervised speech models predict the perceived acceptability of prosodic variation? | Sarenne Wallbridge, Adaeze Adigwe, Peter Bell |
| 2025 | Joint ASR and Speech Attribute Prediction for Conversational Dysarthric Speech Analysis with Multimodal Language Models. | Dominik Wagner, Ilja Baumann, Natalie Engert, Elmar Nth, Korbinian Riedhammer, Tobias Bocklet |