| 2025 | Exploring Pre-trained models on Ultrasound Modeling for Mice Autism Detection with Uniform Filter Bank and Attentive Scoring. | Yuchen Song, Yucong Zhang, Ming Li |
| 2025 | REB-former: RWKV-enhanced E-branchformer for Speech Recognition. | Jie Song, Wang Xiang, Jian Zhou, Cunhang Fan, Zhao Lv |
| 2025 | Leveraging Self-Supervised Learning Based Speaker Diarization for MISP 2025 AVSD Challenge. | Zeyan Song, Tianchi Sun, Ronghui Hu, Kai Chen, Jing Lu |
| 2025 | Lightweight Speech Enhancement Model Based on Harmonic Attention and Phase Estimation with Skin-Attachable Accelerometer. | Yonghun Song, Yeeun Kim, Yoonyoung Chung |
| 2025 | Context-Driven Dynamic Pruning for Large Speech Foundation Models. | Masao Someki, Shikhar Bharadwaj, Atharva Anand Joshi, Chyi-Jiunn Lin, Jinchuan Tian, Jee-weon Jung, Markus Mller, Nathan Susanj, Jing Liu, Shinji Watanabe |
| 2025 | Pull It Together: Reducing the Modality Gap in Contrastive Learning. | Amit Sofer, Yoav Goldman, Shlomo E. Chazan |
| 2025 | Prompting Whisper for Improved Verbatim Transcription and End-to-end Miscue Detection. | Griffin Dietz Smith, Dianna Yee, Jennifer King Chen, Leah Findlater |
| 2025 | Exploratory Analysis of Brainstem fMRI Data During Sustained Phonation. | Carey Smith, Hu Cheng, Pertti Palo, Daniel Aalto, Steven M. Lulich |
| 2025 | Impact of Background Noise on Turn-Taking Dynamics in Triadic Conversations. | Valeska Slomianka, Tobias May, Torsten Dau |
| 2025 | GoP2Vec: A few shot learning for pronunciation assessment with goodness of pronunciation (GoP) based representations from an i-vector framework and augmentation. | Meenakshi Sirigiraju, Chiranjeevi Yarra |
| 2025 | Beyond Traditional Speech Modifications : Utilizing Self Supervised Features for Enhanced Zero-Shot Children ASR. | Abhijit Sinha, Hemant Kumar Kathania, Mikko Kurimo |
| 2025 | Causal Structure Discovery for Error Diagnostics of Children's ASR. | Vishwanath Pratap Singh, Md. Sahidullah, Tomi Kinnunen |
| 2025 | Language-Agnostic Speech Tokenizer for Spoken Term Detection with Efficient Retrieval. | Anup Singh, Kris Demuynck, Vipul Arora |
| 2025 | H-QuEST: Accelerating Query-by-Example Spoken Term Detection with Hierarchical Indexing. | Akanksha Singh, Yi-Ping Phoebe Chen, Vipul Arora |
| 2025 | Count Your Speakers! Multitask Learning for Multimodal Speaker Diarization. | Prabhav Singh, Jess Villalba, Najim Dehak |
| 2025 | EmoJudge: LLM Based Post-Hoc Refinement for Multimodal Speech Emotion Recognition. | Prabhav Singh, Jess Villalba |
| 2025 | Self-supervised Optimality-Guided Learning of Speech Articulation. | Juraj Simko, Benjamin Elie, Alice Turk |
| 2025 | Probing Prosodic Differences Between Two Regional Varieties of Brazilian Portuguese. | Gustavo Silveira, Aviad Albert, Martine Grice |
| 2025 | NeuroSpex+: Dual-Task Training of Neuro-Guided Speaker Extraction with Speech Envelope and Waveform. | Dashanka De Silva, Siqi Cai, Saurav Pahuja, Tanja Schultz, Haizhou Li |
| 2025 | Fully Few-shot Class-incremental Audio Classification Using Multi-level Embedding Extractor and Ridge Regression Classifier. | Yongjie Si, Yanxiong Li, Jiaxin Tan, Qianhua He, Il-Youp Kwak |
| 2025 | Queer Waves: A German Speech Dataset Capturing Gender and Sexual Diversity from Podcasts and YouTube. | Ingo Siegert, Jan Marquenie, Sven Grawunder |
| 2025 | 75-Speaker Annot-16: A benchmark dataset for speech articulatory rt-MRI annotation with articulator contours and phonetic alignment. | Xuan Shi, Yubin Zhang, Yijing Lu, Marcus Ma, Tiantian Feng, Asterios Toutios, Haley Hsu, Louis Goldstein, Shrikanth Narayanan |
| 2025 | CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning. | Jiacheng Shi, Yanfu Zhang, Ye Gao |
| 2025 | Examining Test-Time Adaptation for Personalized Child Speech Recognition. | Zhonghao Shi, Xuan Shi, Anfeng Xu, Tiantian Feng, Harshvardhan Srivastava, Shrikanth Narayanan, Maja J. Mataric |
| 2025 | Uni-VERSA: Versatile Speech Assessment with a Unified Network. | Jiatong Shi, Hye-jin Shim, Shinji Watanabe |