| 2025 | XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation. | Tianlun Zuo, Jingbin Hu, Yuke Li, Xinfa Zhu, Hai Li, Ying Yan, Junhui Liu, Danming Xie, Lei Xie |
| 2025 | Non-Autoregressive Multi-Speaker ASR with Decoupled Speaker Change Detection. | Yingke Zhu, Lahiru Samarakoon |
| 2025 | KyotoMOS2: MOS Prediction for Speech Across Multiple Sampling Rates. | Wangjin Zhou, Yizhou Zhang, Keisuke Imoto, Tatsuya Kawahara |
| 2025 | Robust Training of Singing Voice Synthesis Using Prior and Posterior Uncertainty. | Yiwen Zhao, Jiatong Shi, Yuxun Tang, William Chen, Shinji Watanabe |
| 2025 | Efficient Deployment of Large Speech Recognition Models on GPU. | Yuekai Zhang, Shuang Yu, Junjie Lai |
| 2025 | Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion. | Yu Zhang, Baotong Tian, Zhiyao Duan |
| 2025 | Benchmarking Rotary Position Embeddings for Automatic Speech Recognition. | Shucong Zhang, Titouan Parcollet, Rogier C. van Dalen, Sourav Bhattacharya |
| 2025 | MBENet: Bone-conduction and Air-conduction Fusion Network for Target Speaker Extraction. | Chen Zhang, Linfeng Feng, Zhi Liu, Xiao-Lei Zhang, Xuelong Li |
| 2025 | Training and Inference Efficiency of Encoder-Decoder Speech Models. | Piotr Zelasko, Kunal Dhawan, Daniel Galvez, Krishna C. Puvvada, Ankita Pasad, Travis M. Bartley, Nithin Rao Koluguri, Ke Hu, Vitaly Lavrukhin, Jagadeesh Balam, Boris Ginsburg |
| 2025 | Advancing Controllable Music Generation with Latent Rectified Flow Guided by Rhythm and Harmony. | Haibin Yu, Jiayi Zhou, Wei Wang, Zhiming Wang, Huijia Zhu, Yanmin Qian |
| 2025 | Deep Audio Zooming: Creating a Sound Barrier With Microphone Array Processing. | Meng Yu, Dong Yu |
| 2025 | Enhancing Fully Formatted End-to-End Speech Recognition with Knowledge Distillation via Multi-Codebook Vector Quantization. | Jian You, Xiangfeng Li, Erwan Zerhouni |
| 2025 | Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody. | Jinsung Yoon, Wooyeol Jeong, Jio Gim, Young-Joo Suh |
| 2025 | LCS-CTC: Leveraging Soft Alignments to Enhance Phonetic Transcription Robustness. | Zongli Ye, Jiachen Lian, Akshaj Gupta, Xuanru Zhou, Haodong Li, Krish Patel, Hwi Joo Park, Dingkun Zhou, Chenxu Guo, Shuhe Li, Sam Wang, Iris Zhou, Cheol Jun Cho, Zoe Ezzes, Jet Vonk, Brittany Morin, Rian Bogley, Lisa Wauters, Zachary A. Miller, Maria Luisa Gorno-Tempini, Gopala Anumanchipalli |
| 2025 | Whisper Has an Internal Word Aligner. | Sung-Lin Yeh, Yen Meng, Hao Tang |
| 2025 | Personalized Federated Learning with Fuzzy Clustering for Dysarthric Speech Recognition. | Jie-Shiang Yang, Jing-Tong Tzeng, Chi-Chun Lee |
| 2025 | AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models. | Chih-Kai Yang, Neo Ho, Yi-Jyun Lee, Hung-Yi Lee |
| 2025 | Bridging the Modality Gap: Softly Discretizing Audio Representation for LLM-based Automatic Speech Recognition. | Mu Yang, Szu-Jui Chen, Jiamin Xie, John H. L. Hansen |
| 2025 | The T12 System for AudioMOS Challenge 2025: Audio Aesthetics Score Prediction System Using KAN- and VERSA-based Models. | Katsuhiko Yamamoto, Koichi Miyazaki, Shogo Seki |
| 2025 | JOOCI: a Novel Method for Learning Comprehensive Speech Representations. | Hemant Yadav, Sunayana Sitaram, Rajiv Ratn Shah |
| 2025 | Audio Aesthetics Prediction System QAM16k Based on Pre-trained Audio Encoder. | Linping Xu, Ziqian Wu, Dejun Zhang |
| 2025 | Enhancing Code-switched Text-to-Speech Synthesis Capability in Large Language Models with only Monolingual Corpora. | Jing Xu, Daxin Tan, Jiaqi Wang, Xiao Chen |
| 2025 | A Universal Harmonic Discriminator for High-quality GAN-based Vocoder. | Nan Xu, Zhaolong Huang, Xiao Zeng |
| 2025 | Fake-Mamba: Real-Time Speech Deepfake Detection Using Bidirectional Mamba as Self-Attention's Alternative. | Xi Xuan, Zimo Zhu, Wenxin Zhang, Yi-Cheng Lin, Tomi Kinnunen |
| 2025 | Scalable Controllable Accented TTS. | Henry Li Xinyuan, Zexin Cai, Ashi Garg, Kevin Duh, Leibny Paola Garca-Perera, Sanjeev Khudanpur, Nicholas Andrews, Matthew Wiesner |