| 2025 | Effect of Loudspeaker Emitted Speech on ASR performance. | Vikram C. M, Sanjoy Pal, Nidhi Mantri, Gopal Kumar Agrawal |
| 2025 | Brain-tuned Speech Models Better Reflect Speech Processing Stages in the Brain. | Omer Moussa, Mariya Toneva |
| 2025 | LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs. | Pooneh Mousavi, Shubham Gupta, Cem Subakan, Mirco Ravanelli |
| 2025 | Vector Quantized Cross-lingual Unsupervised Domain Adaptation for Speech Emotion Recognition. | Pravin Mote, Donita Robinson, Elizabeth Richerson, Carlos Busso |
| 2025 | Analysis of Phonetic Level Similarities Across Languages in Emotional Speech. | Pravin Mote, Abinay Reddy Naini, Donita Robinson, Elizabeth Richerson, Carlos Busso |
| 2025 | Attention-Free Dual-Mode ASR with Latency-Controlled Selective State Spaces. | Takafumi Moriya, Masato Mimura, Kiyoaki Matsui, Hiroshi Sato, Kohei Matsuura |
| 2025 | What Do Humans Hear When Interacting? Experiments on Selective Listening for Evaluating ASR of Spoken Dialogue Systems. | Kiyotada Mori, Seiya Kawano, Chaoran Liu, Carlos Toshinori Ishi, Angel F. Garcia Contreras, Koichiro Yoshino |
| 2025 | Dialogue Response Prefetching Based on Semantic Similarity and Prediction Confidence of Language Model. | Kiyotada Mori, Seiya Kawano, Angel F. Garcia Contreras, Koichiro Yoshino |
| 2025 | Exploring the Limits of Conformer CTC-Encoder for Speech Emotion Recognition using Large Language Models. | Edmilson da Silva Morais, Hagai Aronowitz, Aharon Satt, Ron Hoory, Avihu Dekel, Brian Kingsbury, George Saon |
| 2025 | From Talking and Listening Devices to Intelligent Communicative Machines. | Roger K. Moore |
| 2025 | Beyond Conventional Metrics: using Entropic Triangles to Explain Balancing Methods in Acoustic Scene Classification. | Claudia Montero-Ramrez, Alba Martnez-Serrano, Jorge Garceln-Gmez, Francisco J. Valverde-Albacete, Carmen Pelez-Moreno |
| 2025 | ExagTTS: An Approach Towards Controllable Word Stress Incorporated TTS for Exaggerated Synthesized Speech Aiding Second Language Learners. | Anindita Mondal, Monica Surtani, Anil Kumar Vuppala, Parameswari Krishnamurthy, Chiranjeevi Yarra |
| 2025 | ProBiEM: Acoustic and Lexical Correlates of Prosodic Prominence in English-Malayalam Bilingual Speech. | Anindita Mondal, Rahul Biju, Anil Kumar Vuppala, Reni K. Cherian, Chiranjeevi Yarra |
| 2025 | Automatic Speech Recognition of African American English: Lexical and Contextual Effects. | Hamid Mojarad, Kevin Tang |
| 2025 | Investigating Gender Bias in Text-to-Audio Generation Models. | Aarish Shah Mohsin, Mohammad Nadeem, Shahab Saquib Sohail, Tughrul Arslan, Mandar Gogate, Nasir Saleem, Amir Hussain |
| 2025 | Scaling pseudo-labeling data for end-to-end low-resource speech translation (the case of Kurdish language). | Mohammad MohammadAmini, Aghilas Sini, Marie Tahon, Antoine Laurent |
| 2025 | Is Synthetic Data Truly Effective for Training Speech Language Models? | Tomoya Mizumoto, Atsushi Kojima, Yusuke Fujita, Lianbo Liu, Yui Sudo |
| 2025 | Stuttering Detection Based on Self-Attention Weights of Temporal Acoustic Vector Sequence. | Genzo Miyahara, Tsuneo Kato, Akihiro Tamura |
| 2025 | Skip-Salsa: Skip Synchronous Fusion of ASR LLM Decoders. | Ashish R. Mittal, Darshan Prabhu, Sunita Sarawagi, Preethi Jyothi |
| 2025 | Cross-lingual Data Selection Using Clip-level Acoustic Similarity for Enhancing Low-resource Automatic Speech Recognition. | Shunsuke Mitsumori, Sara Kashiwagi, Keitaro Tanaka, Shigeo Morishima |
| 2025 | Cryfish: On deep audio analysis with Large Language Models. | Anton Mitrofanov, Sergey Novoselov, Tatiana Prisyach, Vladislav Marchevskiy, Arseniy Karelin, Nikita Khmelev, Dmitry Dutov, Stepan Malykh, Igor Agafonov, Aleksandr Nikitin, Oleg Petrov |
| 2025 | Hybrid HMM-SVM classifier using frication-based features for detection of non-normative sibilant articulation patterns in Polish children's speech. | Zuzanna Miodonska |
| 2025 | Scaling Laws for Synthetic Speech for Model Training. | Christoph Minixhofer, Ondrej Klejch, Peter Bell |
| 2025 | When The MOS Predictor Asks For Training Annotation In Cross Lingual/Domain Adaptation. | Natacha Miniconi, Meysam Shamsi, Anthony Larcher |
| 2025 | Switch Conformer with Universal Phonetic Experts for Multilingual ASR. | Masato Mimura, Jaeyoung Lee, Tatsuya Kawahara |