| 2025 | Distilling a speech and music encoder with task arithmetic. | Fabian Ritter Gutierrez, Yi-Cheng Lin, Jui-Chiang Wei, Jeremy H. M. Wong, Eng Siong Chng, Nancy F. Chen, Hung-yi Lee |
| 2025 | A Domain Robust Pre-Training Method with Local Prototypes for Speaker Verification. | Qing Gu, Yan Song, Haoyu Song, Nan Jiang, Lirong Dai, Ian McLoughlin |
| 2025 | Low Complex IIR Adaptive Hear-Through Ambient Filtering for Overcoming Practical Constraints in Earbuds. | Rishabh Gupta, MLNS Karthik, Yughendaran Palanivel |
| 2025 | Sub-band based Adaptive IIR Algorithm with Biquad Filter Stability Constraints for Feedforward Hear-Through Equalization. | Rishabh Gupta, MLNS Karthik, Omsrinath Chelamkuri |
| 2025 | Dysfluent WFST: A Framework for Zero-Shot Speech Dysfluency Transcription and Detection. | Chenxu Guo, Jiachen Lian, Xuanru Zhou, Jinming Zhang, Shuhe Li, Zongli Ye, Peter Park, Anaisha Das, Zoe Ezzes, Jet Vonk, Brittany Morin, Rian Bogley, Lisa Wauters, Zachary A. Miller, Maria Luisa Gorno-Tempini, Gopala Anumanchipalli |
| 2025 | LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec. | Yiwei Guo, Zhihan Li, Chenpeng Du, Hankun Wang, Xie Chen, Kai Yu |
| 2025 | Extended High-frequency Cues to Phoneme Recognition: Insights from ASR. | Zhe-chen Guo, Bharath Chandrasekaran |
| 2025 | Vision-Integrated High-Quality Neural Speech Coding. | Yao Guo, Yang Ai, Rui-Chen Zheng, Hui-Peng Du, Xiao-Hang Jiang, Zhen-Hua Ling |
| 2025 | Leveraging LLMs for Written to Spoken Style Data Transformation to Enhance Spoken Dialog State Tracking. | Haris Gulzar, Monikka Roslianna Busto, Akiko Masaki, Takeharu Eda, Ryo Masumura |
| 2025 | Theoretical proposal for a unified Bayesian model of adaptation in non-interactive and interactive speech production. | Mlen Guillaume, Anahita Basirat, Julien Diard |
| 2025 | Ultra-Low Bit Post-Training Quantization of Large Speech Models via K-Means Clustering and Mixed Precision Allocation. | Tianteng Gu, Bei Liu, Haoyu Wang, Yanmin Qian |
| 2025 | SPGISpeech 2.0: Transcribed multi-speaker financial audio for speaker-tagged transcription. | Raymond Grossman, Taejin Park, Kunal Dhawan, Andrew Titus, Sophia Zhi, Yulia Shchadilova, Weiqing Wang, Jagadeesh Balam, Boris Ginsburg |
| 2025 | Objective and Subjective Evaluation of Diffusion-Based Speech Enhancement for Dysarthric Speech. | Dimme de Groot, Tanvina Patel, Devendra Kayande, Odette Scharenborg, Zhengjun Yue |
| 2025 | Unified Text and Speaker Verification using SSL model for Text-Dependent Speaker Verification. | Nathan Griot, Driss Matrouf, Raphal Blouet, Jean-Franois Bonastre, Ana Mantecon |
| 2025 | A Data-Driven Diffusion-based Approach for Audio Deepfake Explanations. | Petr Grinberg, Ankur Kumar, Surya Koppisetti, Gaurav Bharaj |
| 2025 | Towards High-Quality LLM-Based Data for French Spontaneous Speech Simplification: an Exo-Refinement Approach. | Lucia Ormaechea Grijalba, Nikos Tsourakis, Pierrette Bouillon, Benjamin Lecouteux, Didier Schwab |
| 2025 | Pushing the Limits of Beam Search Decoding for Transducer-based ASR models. | Lilit Grigoryan, Vladimir Bataev, Andrei Andrusenko, Hainan Xu, Vitaly Lavrukhin, Boris Ginsburg |
| 2025 | The 2024 NIST Speaker Recognition Evaluation. | Craig S. Greenberg, Lukas L. Diduch, Audrey Tong, Elliot Singer, Trang Nguyen, Robert Dunn, Lisa P. Mason, Beth Matys |
| 2025 | Code Mix TTS: An Approach to Infer Human Like Speech for Multi-Lingual Input Texts. | Vishal Gourav, Phanindra Mankale |
| 2025 | FUSE: Universal Speech Enhancement using Multi-Stage Fusion of Sparse Compression and Token Generation Models for the URGENT 2025 Challenge. | Nabarun Goswami, Tatsuya Harada |
| 2025 | LitMAS: A Lightweight and Generalized Multi-Modal Anti-Spoofing Framework for Biometric Security. | Nidheesh Gorthi, Kartik Thakral, Rishabh Ranjan, Richa Singh, Mayank Vatsa |
| 2025 | Learning More with Less: Self-Supervised Approaches forLow-Resource Speech Emotion Recognition. | Ziwei Gong, Pengyuan Shi, Kaan Donbekci, Lin Ai, Run Chen, David Sasu, Zehui Wu, Julia Hirschberg |
| 2025 | Comparison-Based Automatic Evaluation for Meeting Summarization. | Ziwei Gong, Lin Ai, Harsh Deshpande, Alexander Johnson, Emmy Phung, Zehui Wu, Ahmad Emami, Julia Hirschberg |
| 2025 | Speech and Text Foundation Models for Depression Detection: Cross-Task and Cross-Language Evaluation. | Luca Gmez-Zaragoz, Javier Marn-Morales, Mariano Alcaiz, Mohammad Soleymani |
| 2025 | EmoSpeechAuth: Emotion-Aware Speaker Verification. | Magdalena Golebiowska, Piotr Syga |