| 2025 | Transcribing Oral History Recordings Using the Transcription Portal. | Christoph Draxler, Julian Pmp, Henk van den Heuvel, Fabio Ardolino, Arjan van Hessen |
| 2025 | Adaptive Differential Denoising for Respiratory Sounds Classification. | Gaoyang Dong, Zhicheng Zhang, Ping Sun, Minghui Zhang |
| 2025 | Multitalker Babble in English Vowel Perception Training: A Comparison between Humans and Neural Models. | Wenwei Dong, Alif Silpachai, Catia Cucchiarini, Helmer Strik |
| 2025 | Neutral Tone Variation in Beijing Mandarin: Is Neutral Tone Toneless? | Xiao Dong, Fengming Liu, Chien-Jer Charles Lin, Monica Nesbitt, Shuju Shi |
| 2025 | FFD: Fine-Finger Diffusion Model for Music to Fine-grained Finger Dance Generation. | Boya Dong, Wentao Lei, Li Liu |
| 2025 | Evaluating Progress of CALL System Users on Accentedness and Comprehensibility: An Acoustic and ASR-Based Approach. | Wenwei Dong, Catia Cucchiarini, Roeland van Hout, Helmer Strik |
| 2025 | ViToSA: Audio-Based Toxic Spans Detection on Vietnamese Speech Utterances. | Huy Ba Do, Vy Le-Phuong Huynh, Luan Thanh Nguyen |
| 2025 | VIB-based Real Pre-emphasis Audio Deepfake Source Tracing. | Thien-Phuc Doan, Kihun Hong, Souhwan Jung |
| 2025 | PruneSLU: Efficient On-device Spoken Language Understanding through Vocabulary and Structural Pruning. | Truong Do, Phuong Minh Nguyen, Le-Minh Nguyen |
| 2025 | Extended Loss: Incorporating Long Context into Training Models when using Short Audio Frames. | Quang Minh Dinh, Hoda Rezaee Kaviani, Mehrdad Hosseinzadeh, Yuanhao Yu |
| 2025 | Linguistic Masking and Its Release in Simulated Electric-acoustic Hearing. | Yuting Ding, Xuefei Wang, Fei Chen |
| 2025 | Study of vocal fold vibration using M-mode ultrasound: a proof of concept. | Juliette Dindart, Agns Rouxel, Crystal Lin, Trung Kien Bui, Muriel Lefort, Claire Pillot-Loiseau, Christophe Trsallet, Frdrique Frouin |
| 2025 | Teacher-Free Knowledge Distillation for Improving Short-Utterance Spoken Language Identification. | Spandan Dey, Hirak Mondal, Sanjay Kumar Kurmi |
| 2025 | Nosey: Open-Source Hardware for Acoustic Nasalance. | Maya Dewhurst, Jack Collins, Justin J. H. Lo, Roy Alderton, Sam Kirkham |
| 2025 | MOPSA: Mixture of Prompt-Experts Based Speaker Adaptation for Elderly Speech Recognition. | Chengxi Deng, Xurong Xie, Shujie Hu, Mengzhe Geng, Yicong Jiang, Jiankun Zhao, Jiajun Deng, Guinan Li, Youjun Chen, Huimeng Wang, Haoning Xu, Mingyu Cui, Xunying Liu |
| 2025 | An interpretable speech foundation model for depression detection by revealing prediction-relevant acoustic features from long speech. | Qingkun Deng, Saturnino Luz, Sofia de la Fuente Garcia |
| 2025 | Improved Intelligibility of Dysarthric Speech using Conditional Flow Matching. | Shoutrik Das, Nishant Singh, Arjun Gangwar, S. Umesh |
| 2025 | Generalizable Audio Spoofing Detection using Non-Semantic Representations. | Arnab Das, Yassine El Kheir, Carlos Franzreb, Tim Herzig, Tim Polzehl, Sebastian Mller |
| 2025 | Speechless: Speech Instruction Training Without Speech for Low Resource Languages. | Alan Dao, Dinh Bach Vu, Huy Hoang Ha, Tuan Le Duc Anh, Shreyas Gopal, Yue Heng Yeo, Warren Keng Hoong Low, Eng Siong Chng, Jia Qi Yip |
| 2025 | First Analyze Then Enhance: A Task-Aware System for Speech Separation, Denoising, and Dereverberation. | Shaoxiang Dang, Li Li, Shogo Seki, Hiroaki Kudo |
| 2025 | MSDA: Combining Pseudo-labeling and Self-Supervision for Unsupervised Domain Adaptation in ASR. | Dimitrios Damianos, Georgios Paraskevopoulos, Alexandros Potamianos |
| 2025 | Robust Unsupervised Adaptation of a Speech Recogniser Using Entropy Minimisation and Speaker Codes. | Rogier C. van Dalen, Shucong Zhang, Titouan Parcollet, Sourav Bhattacharya |
| 2025 | Leveraging Multi-Level Features of ATST with Conformer-Based Dual-Branch Network for Sound Event Detection. | Lipeng Dai, Qing Wang, Jie Zhang, Shengyu Peng, Yu Guan, Wu Guo |
| 2025 | AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition. | Yuhang Dai, He Wang, Xingchen Li, Zihan Zhang, Shuiyuan Wang, Lei Xie, Xin Xu, Hongxiao Guo, Shaoji Zhang, Hui Bu, Wei Chen |
| 2025 | Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction. | Wang Dai, Archontis Politis, Tuomas Virtanen |