| 2025 | Improving Streaming ASR via Differentially Private Fusion of Data from Multiple Sources. | Virat Shejwalkar, Om Thakkar, Steve Chien, Nicole Rafidi, Arun Narayanan |
| 2025 | Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder. | Muhammad Shakeel, Yui Sudo, Yifan Peng, Chyi-Jiunn Lin, Shinji Watanabe |
| 2025 | Granite-speech: open-source speech-aware LLMs with strong English ASR capabilities. | George Saon, Avihu Dekel, Alexander Brooks, Tohru Nagano, Abraham Daniels, Aharon Satt, Ashish R. Mittal, Brian Kingsbury, David Haws, Edmilson da Silva Morais, Gakuto Kurata, Hagai Aronowitz, Ibrahim Ibrahim, Hong-Kwang Kuo, Kate Soule, Luis A. Lastras, Masayuki Suzuki, Ron Hoory, Samuel Thomas, Sashi Novitasari, Takashi Fukuda, Vishal Sunder, Xiaodong Cui, Zvi Kons |
| 2025 | Controllable Singing Voice Synthesis using Phoneme-Level Energy Sequence. | Yerin Ryu, Inseop Shin, Chanwoo Kim |
| 2025 | Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM? | Andrew Rouditchenko, Saurabhchand Bhati, Edson Araujo, Samuel Thomas, Hilde Kuehne, Rogrio Feris, James R. Glass |
| 2025 | Lightweight Prompt Biasing for Contextualized End-to-End ASR Systems. | Bo Ren, Yu Shi, Jinyu Li |
| 2025 | HighRateMOS: Sampling-Rate Aware Modeling for Speech Quality Assessment. | Wenze Ren, Yi-Cheng Lin, Wen-Chin Huang, Ryandhimas E. Zezario, Szu-Wei Fu, Sung-Feng Huang, Erica Cooper, Haibin Wu, Hung-Yu Wei, Hsin-Min Wang, Hung-Yi Lee, Yu Tsao |
| 2025 | Improving Multimodal Speech-To-Slide Alignment for Academic Lectures with Vision LLMs. | Thomas Ranzenberger, Dominik Wagner, Steffen Freisinger, Tobias Bocklet, Korbinian Riedhammer |
| 2025 | Analysis of Domain Shift across ASR Architectures via TTS-Enabled Separation of Target Domain and Acoustic Conditions. | Tina Raissi, Nick Rossenbach, Ralf Schlter |
| 2025 | DarkStream: real-time speech anonymization with low latency. | Waris Quamer, Ricardo Gutierrez-Osuna |
| 2025 | Enhancing In-the-Wild Speech Emotion Conversion with Resynthesis-based Duration Modeling. | Navin Raj Prabhu, Danilo de Oliveira, Nale Lehmann-Willenbrock, Timo Gerkmann |
| 2025 | DeCRED: Decoder-Centric Regularization for Encoder-Decoder Based Speech Recognition. | Alexander Polok, Santosh Kesiraju, Karel Benes, Bolaji Yusuf, Luks Burget, Jan Cernock |
| 2025 | ZO-ASR: Zeroth-Order Fine-Tuning of Speech Foundation Models without Back-Propagation. | Yuezhang Peng, Yuxin Liu, Yao Li, Sheng Wang, Fei Wen, Xie Chen |
| 2025 | Analysing the Language of Neural Audio Codecs. | Joonyong Park, Shinnosuke Takamichi, David M. Chan, Shunsuke Kando, Yuki Saito, Hiroshi Saruwatari |
| 2025 | Lightweight Wasserstein Audio-Visual Model for Unified Speech Enhancement and Separation. | Jisoo Park, Seonghak Lee, Guisik Kim, Taewoo Kim, Junseok Kwon |
| 2025 | Towards Scalable and Robust Multilingual ASR for Indian Languages with MixLoRA-Whisper. | Yeseul Park, Bowon Lee |
| 2025 | Interpreting the Role of Visemes in Audio-Visual Speech Recognition. | Aristeidis Papadopoulos, Naomi Harte |
| 2025 | MoLEx: Mixture of LoRA Experts in Speech Self-Supervised Models for Audio Deepfake Detection. | Zihan Pan, Hardik B. Sailor, Jinyang Wu |
| 2025 | Benchmarking Prosody Encoding in Discrete Speech Tokens. | Kentaro Onda, Satoru Fukayama, Daisuke Saito, Nobuaki Minematsu |
| 2025 | Speech Masking System Based on Spatially Separated Multiple TTS Maskers With A Compact Circular Loudspeaker Array. | Takuma Okamoto |
| 2025 | Voice Factor Control Using FIR-Based Fast Neural Vocoder for Speech Generation Applications. | Yamato Ohtani, Takuma Okamoto, Tomoki Toda, Hisashi Kawai |
| 2025 | Transcribe, Translate, or Transliterate: An Investigation of Intermediate Representations in Spoken Language Models. | Tollop gnrm, Christopher D. Manning, Dan Jurafsky, Karen Livescu |
| 2025 | Multi-Sampling-Frequency Naturalness MOS Prediction Using Self-Supervised Learning Model with Sampling-Frequency-Independent Layer. | Go Nishikawa, Wataru Nakata, Yuki Saito, Kanami Imamura, Hiroshi Saruwatari, Tomohiko Nakamura |
| 2025 | AsyncSwitch: Asynchronous Text-Speech Adaptation for Code-Switched ASR. | Tuan Nguyen, Huy-Dat Tran |
| 2025 | Efficient Scaling for LLM-based ASR. | Bingshen Mu, Yiwen Shao, Kun Wei, Dong Yu, Lei Xie |