| 2025 | Utilizing Kolmogorov-Arnold Network in Self-Supervised Learning for Speaker Diarization. | Minh Vu, Phuong Tuan Dat, Kah Kuan Teh, Van Tuan Nguyen, Tran Huy Dat |
| 2025 | The JHU-MIT System for NIST SRE24: Post-Evaluation Analysis. | Jess Villalba, Jonas Borgstrom, Prabhav Singh, Leibny Paola Garca, Pedro A. Torres-Carrasquillo, Najim Dehak |
| 2025 | Speaker Style-Aware Phoneme Anchoring For Improved Cross-Lingual Speech Emotion Recognition. | Shreya G. Upadhyay, Carlos Busso, Chi-Chun Lee |
| 2025 | Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training. | Sathvik Udupa, Shinji Watanabe, Petr Schwarz, Jan Cernock |
| 2025 | Speech Synthesis From Continuous Features Using Per-Token Latent Diffusion. | Arnon Turetzky, Avihu Dekel, Nimrod Shabtay, Slava Shechtman, David Haws, Hagai Aronowitz, Ron Hoory, Yossi Adi |
| 2025 | Spiralformer: Low Latency Encoder for Streaming Speech Recognition with Circular Layer Skipping and Early Exiting. | Emiru Tsunoo, Hayato Futami, Yosuke Kashiwagi, Siddhant Arora, Shinji Watanabe |
| 2025 | Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition. | Yuan Tseng, Titouan Parcollet, Rogier C. van Dalen, Shucong Zhang, Sourav Bhattacharya |
| 2025 | Codec2Vec: Self-Supervised Speech Representation Learning Using Neural Speech Codecs. | Wei-Cheng Tseng, David Harwath |
| 2025 | CO-VADA: A Confidence-Oriented Voice Augmentation Debiasing Approach for Fair Speech Emotion Recognition. | Yun-Shao Tsai, Yi-Cheng Lin, Huang-Cheng Chou, Hung-Yi Lee |
| 2025 | Meta Audiobox Aesthetics: Unified Automatic Assessment for Speech, Music and Sound. | Andros Tjandra, Yi-Chiao Wu, Baishan Guo, John Hoffman, Brian Ellis, Apoorv Vyas, Bowen Shi, Sanyuan Chen, Matt Le, Nick Zacharov, Carleigh Wood, Ann Lee, Wei-Ning Hsu |
| 2025 | Llasa+: Free Lunch for Accelerated and Streaming Llama-Based Speech Synthesis. | Wenjie Tian, Xinfa Zhu, Hanke Xie, Zhen Ye, Wei Xue, Lei Xie |
| 2025 | Enhancing Dialogue Annotation with Speaker Characteristics Leveraging a Frozen LLM. | Thomas Thebaud, Yen-Ju Lu, Matthew Wiesner, Peter Viechnicki, Najim Dehak |
| 2025 | More Similar than Dissimilar: Modeling Annotators for Cross-Corpus Speech Emotion Recognition. | James Tavernor, Emily Mower Provost |
| 2025 | LauraTSE: Target Speaker Extraction using Auto-Regressive Decoder-Only Language Models. | Beilong Tang, Bang Zeng, Ming Li |
| 2025 | SEF-MK: Speaker-Embedding-Free Voice Anonymization through Multi-k-means Quantization. | Beilong Tang, Xiaoxiao Miao, Xin Wang, Ming Li |
| 2025 | Reliability of Lexical Richness Measures for ASR-Based Children's Speech Assessment. | Imen Talbi, Christopher Gebauer, Lars Rumberg, Edith Beaulac, Hanna Ehlert, Jrn Ostermann |
| 2025 | Acoustic to Articulatory Speech Inversion for Children with Velopharyngeal Insufficiency. | Saba Tabatabaee, Suzanne Boyce, Liran Oren, Mark Tiede, Carol Y. Espy-Wilson |
| 2025 | Continual Pre-training for Codec-Based Speech LLMs: Balancing Understanding and Generation. | Jiatong Shi, Chunlei Zhang, Jinchuan Tian, Junrui Ni, Hao Zhang, Shinji Watanabe, Dong Yu |
| 2025 | PURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning. | Jiatong Shi, Haoran Wang, William Chen, Chenda Li, Wangyou Zhang, Jinchuan Tian, Shinji Watanabe |
| 2025 | Group Relative Policy Optimization for Speech Recognition. | Prashanth Gurunath Shivakumar, Yile Gu, Ankur Gandhe, Ivan Bulyko |
| 2025 | VERSA-v2: A Modular and Scalable Toolkit for Speech and Audio Evaluation with Expanded Metrics, Visualization, and LLM Integration. | Jiatong Shi, Bo-Hao Su, Shikhar Bharadwaj, Yiwen Zhao, Shih-Heng Wang, Jionghao Hang, Haoran Wang, Wei Wang, Wenhao Feng, Yuxun Tang, Nezih Topaloglu, Siddhant Arora, Jinchuan Tian, William Chen, Hye-jin Shim, Wangyou Zhang, Wen-Chin Huang, Shinji Watanabe |
| 2025 | Unifying Model and Layer Fusion for Speech Foundation Models. | Yi-Jen Shih, David Harwath |
| 2025 | Serialized Output Prompting for Large Language Model-based Multi-Talker Speech Recognition. | Hao Shi, Yusuke Fujita, Tomoya Mizumoto, Lianbo Liu, Atsushi Kojima, Yui Sudo |
| 2025 | L2 Vowel Acquisition Analysis at the Inventory Level. | Shuju Shi |
| 2025 | PhysMVNet: Physics-Informed End-to-End MVDR Beamformer with Residual Spectral Mapping for Multichannel Speech Enhancement. | Xingyu Shen, Wei-Ping Zhu, Benot Champagne |