| 2025 | GenECA: A General-Purpose Framework for Real-Time Adaptive Multimodal Embodied Conversational Agents. | Santosh V. Patapati, Aashrith Tatineni, Trisanth Srinivasan |
| 2025 | Semantic-Aware Interpretable Multimodal Music Auto-Tagging. | Andreas Patakis, Vassilis Lyberatos, Spyridon Kantarelis, Edmund Dervakos, Giorgos Stamou |
| 2025 | MSFNet: A Nested Model for Multi-Sampling-Frequency Speech Enhancement. | Venkatesh Parvathala, K. Sri Rama Murty |
| 2025 | Dynamic Layer Gating for Speech Enhancement. | Venkatesh Parvathala, K. Sri Rama Murty |
| 2025 | Exploiting Bispectral Features for Single-Channel Speech Enhancement. | Venkatesh Parvathala, Ramesh Gundluru, Sreekanth Sankala, K. Sri Rama Murty |
| 2025 | Effects of Prosodic Information on Dialect Classification Using Whisper Features. | Phoebe Parsons, Heming Strmholt Bremnes, Knut Kvale, Torbjrn Svendsen, Giampiero Salvi |
| 2025 | Character Error Rate Estimation for Semi-Supervised Training of Speech Recognition for Arabic Dialects. | Chanho Park, Oscar Saz |
| 2025 | RapFlow-TTS: Rapid and High-Fidelity Text-to-Speech with Improved Consistency Flow Matching. | Hyun Joon Park, Jeongmin Liu, Jin Sob Kim, Jeong Yeol Yang, Sung Won Han, Eunwoo Song |
| 2025 | Fine-tuning Strategies for Automatic Speech Recognition of Low-Resource Speech with Autism Spectrum Disorder. | Yeseul Park, Bowon Lee |
| 2025 | MultiActor-Audiobook: Zero-Shot Audiobook Generation with Faces and Voices of Multiple Speakers. | Kyeongman Park, Seongho Joo, Kyomin Jung |
| 2025 | Semi-Supervised Learning for Automatic Speech Recognition with Word Error Rate Estimation and Targeted Domain Data Selection. | Chanho Park, Thomas Hain |
| 2025 | Towards Temporally Explainable Dysarthric Speech Clarity Assessment. | Seohyun Park, Chitralekha Gupta, Michelle Kah Yian Kwan, Xinhui Fung, Alexander Wenjun Yip, Suranga Nanayakkara |
| 2025 | Reasoning-Based Approach with Chain-of-Thought for Alzheimer's Detection Using Speech and Large Language Models. | Chanwoo Park, Anna Seo Gyeong Choi, Sunghye Cho, Chanwoo Kim |
| 2025 | Enhancing GOP in CTC-Based Mispronunciation Detection with Phonological Knowledge. | Aditya Kamlesh Parikh, Cristian Tejedor Garca, Catia Cucchiarini, Helmer Strik |
| 2025 | Evaluating Logit-Based GOP Scores for Mispronunciation Detection. | Aditya Kamlesh Parikh, Cristian Tejedor Garca, Catia Cucchiarini, Helmer Strik |
| 2025 | Loquacious Set: 25, 000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use. | Titouan Parcollet, Yuan Tseng, Shucong Zhang, Rogier C. van Dalen |
| 2025 | A Multi-Stream Framework Utilizing 3D Human Reconstruction for Cued Speech Recognition. | Katerina Papadimitriou, Gerasimos Potamianos |
| 2025 | Plug-and-Play Co-Occurring Face Attention for Robust Audio-Visual Speaker Extraction. | Zexu Pan, Shengkui Zhao, Tingting Wang, Kun Zhou, Yukun Ma, Chong Zhang, Bin Ma |
| 2025 | Online Audio-Visual Autoregressive Speaker Extraction. | Zexu Pan, Wupeng Wang, Shengkui Zhao, Chong Zhang, Kun Zhou, Yukun Ma, Bin Ma |
| 2025 | A Chinese Heart Failure Status Speech Database with Universal and Personalised Classification. | Yue Pan, Liwei Liu, Changxin Li, Xingyao Wang, Yili Xia, Hanyue Zhang, Ming Chu |
| 2025 | ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech. | Yu Pan, Yanni Hu, Yuguang Yang, Jixun Yao, Jianhao Ye, Hongbin Zhou, Lei Ma, Jianjun Zhao |
| 2025 | EmbedAug: An Augmentation Scheme for End-to-End Automatic Speech Recognition. | Ashish Panda, Sunil Kumar Kopparapu |
| 2025 | End-to-End Diarization utilizing Attractor Deep Clustering. | David Palzer, Matthew Maciejewski, Eric Fosler-Lussier |
| 2025 | TargetVoice: Single Channel Low-Latency Target Speaker Extraction. | Arun Kumar Pallala, Nivedita Chennupati, Balaji Padmanaban, Rakesh Pogula, Uma Subhashini Ravuri, Naveen Ellanki, Harish Rajamani, Naveen Ambati |
| 2025 | Continuous prediction of backchannel timing for human-robot interaction. | Michael Paierl, Martin Hagmller, Barbara Schuppler |