| 2025 | WhiStress: Enriching Transcriptions with Sentence Stress Detection. | Iddo Yosha, Dorin Shteyman, Yossi Adi |
| 2025 | APTTS: Adversarial Post-training in Latent Flow Matching for Fast and High-fidelity Text-to-Speech. | Hyungchan Yoon, Chanwoo Lee, Hoodong Lee, Stanley Jungkyu Choi |
| 2025 | Effects of Speaker Count, Duration, and Accent Diversity on Zero-Shot Accent Robustness in Low-Resource ASR. | Zheng Xin Yong, Vineel Pratap, Michael Auli, Jean Maillard |
| 2025 | HK-GenSpeech: A Generative AI Scene Creation Framework for Speech Based Cognitive Assessment. | Vi Jun Sean Yong, Serkan Kumyol, Pau Le Lisa Low, Winnie Suk Wai Leung, Tristan Braud |
| 2025 | Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments. | Reo Yoneyama, Masaya Kawamura, Ryo Terashima, Ryuichi Yamamoto, Tomoki Toda |
| 2025 | EnvSDD: Benchmarking Environmental Sound Deepfake Detection. | Han Yin, Yang Xiao, Rohan Kumar Das, Jisheng Bai, Haohe Liu, Wenwu Wang, Mark D. Plumbley |
| 2025 | A Gradient Effect of Hand Beat Timing on Spoken Word Recognition. | Chengjia Ye, James M. McQueen, Hans Rutger Bosker |
| 2025 | Seamless Dysfluent Speech Text Alignment for Disordered Speech Analysis. | Zongli Ye, Jiachen Lian, Xuanru Zhou, Jinming Zhang, Haodong Li, Shuhe Li, Chenxu Guo, Anaisha Das, Peter Park, Zoe Ezzes, Jet Vonk, Brittany Morin, Rian Bogley, Lisa Wauters, Zachary A. Miller, Maria Luisa Gorno-Tempini, Gopala Anumanchipalli |
| 2025 | A Bayesian Approach to L2 Fluency Ratings by Native and Nonnative Listeners. | Kakeru Yazawa, Takayuki Konishi |
| 2025 | SCD-Conformer: Semantic Content Disentanglement for Text-Independent Speaker Verification. | Shanshan Yao, Dianlong Liu, Tian Li |
| 2025 | EASY: Emotion-aware Speaker Anonymization via Factorized Distillation. | Jixun Yao, Hexin Liu, Eng Siong Chng, Lei Xie |
| 2025 | Overestimated performance of auditory attention decoding caused by experimental design in EEG recordings. | Yujie Yan, Xiran Xu, Haolin Zhu, Songyi Li, Bo Wang, Xihong Wu, Jing Chen |
| 2025 | Developing a LeFF Transformer Model for Exacerbated Speech Detection in COPD and Asthma. | Yuyang Yan, Sami O. Simons, Visara Urovi |
| 2025 | CS-FLEURS: A Massively Multilingual and Code-Switched Speech Dataset. | Brian Yan, Injy Hamed, Shuichiro Shimizu, Vasista Sai Lodagala, William Chen, Olga Iakovenko, Bashar Talafha, Amir Hussein, Alexander Polok, Kalvin Chang, Dominik Klement, Sara Althubaiti, Puyuan Peng, Matthew Wiesner, Thamar Solorio, Ahmed Ali, Sanjeev Khudanpur, Shinji Watanabe |
| 2025 | Mel-McNet: A Mel-Scale Framework for Online Multichannel Speech Enhancement. | Yujie Yang, Bing Yang, Xiaofei Li |
| 2025 | Efficient and Microphone-Fault-Tolerant 3D Sound Source Localization. | Yiyuan Yang, Shitong Xu, Niki Trigoni, Andrew Markham |
| 2025 | Investigating continuous autoregressive generative speech enhancement. | Haici Yang, Gordon Wichern, Ryo Aihara, Yoshiki Masuyama, Sameer Khurana, Franois G. Germain, Jonathan Le Roux |
| 2025 | Cross-Attention-Based Target Sound Extraction by Fully Leveraging Enrollment in a Shared Latent Space. | Xue Yang, Guiru Shen, Yu Yang |
| 2025 | Speaker Separation for an Unknown Number of Speakers with Encoder-Decoder-Based Contextual Information Module. | Xue Yang, Guiru Shen, Yu Yang |
| 2025 | On Retrieval of Long Audios with Complex Text Queries. | Ruochu Yang, Milind Rao, Harshavardhan Sundar, Anirudh Raju, Aparna Khare, Srinath Tankasala, Di He, Venkatesh Ravichandran |
| 2025 | Temporal organization of prenuclear glides in Hefei Mandarin. | Yifan Yang, Zhiheng Qian |
| 2025 | Label-Context-Dependent Internal Language Model Estimation for CTC. | Zijian Yang, Minh-Nghia Phan, Ralf Schlter, Hermann Ney |
| 2025 | Adapting Whisper for Parameter-efficient Code-Switching Speech Recognition via Soft Prompt Tuning. | Hongli Yang, Yizhou Peng, Hao Huang, Sheng Li |
| 2025 | Visually-Adaptive Guided Robust Speech Recognition with Parameter-Efficient Adaptation. | Zhao Yang, Rui Jiang, Yue Heng Yeo, Xiao Fu, Wei Xi, Jizhong Zhao |
| 2025 | SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information. | Chih-Kai Yang, Neo Ho, Yen-Ting Piao, Hung-yi Lee |