| 2025 | Generalizable Audio Deepfake Detection via Hierarchical Structure Learning and Feature Whitening in Poincar sphere. | Mingru Yang, Yanmei Gu, Qianhua He, Yanxiong Li, Peirong Zhang, Yongqiang Chen, Zhiming Wang, Huijia Zhu, Jian Liu, Weiqiang Wang |
| 2025 | TVC-MusicGen: Time-Varying Structure Control for Background Music Generation via Self-Supervised Training. | Chenyu Yang, Hangting Chen, Shuai Wang, Haina Zhu, Haizhou Li |
| 2025 | Band-SCNet: A Causal, Lightweight Model for High-Performance Real-Time Music Source Separation. | Junqi Yang, Yuhong Yang, Weiping Tu, Xin Zhao, Cedar Lin |
| 2025 | Language-Aware Prompt Tuning for Parameter-Efficient Seamless Language Expansion in Multilingual ASR. | Hongli Yang, Sheng Li, Hao Huang, Ayiduosi Tuohan, Yizhou Peng |
| 2025 | Audiobox TTA-RAG: Improving Zero-Shot and Few-Shot Text-To-Audio with Retrieval-Augmented Generation. | Mu Yang, Bowen Shi, Matthew Le, Wei-Ning Hsu, Andros Tjandra |
| 2025 | LLM-based Generative Error Correction for Rare Words with Synthetic Data and Phonetic Context. | Natsuo Yamashita, Masaaki Yamamoto, Hiroaki Kokubo, Yohei Kawaguchi |
| 2025 | Non-Intrusive Binaural Speech Intelligibility Prediction Using Mamba for Hearing-Impaired Listeners. | Katsuhiko Yamamoto, Koichi Miyazaki |
| 2025 | AxLSTMs: learning self-supervised audio representations with xLSTMs. | Sarthak Yadav, Sergios Theodoridis, Zheng-Hua Tan |
| 2025 | WAKE: Watermarking Audio with Key Enrichment. | Yaoxun Xu, Jianwei Yu, Hangting Chen, Zhiyong Wu, Xixin Wu, Dong Yu, Rongzhi Gu, Yi Luo |
| 2025 | Position also matters! Separating Same Instruments in String Quartet using Timbral and Positional Cues. | Yuetonghui Xu, Yiwen Wang, Xihong Wu, Xiaobing Li, Feng Yu |
| 2025 | Towards Diverse and Efficient Audio Captioning via Diffusion Models. | Manjie Xu, Chenxing Li, Yong Ren, Xinyi Tu, Ruibo Fu, Wei Liang, Dong Yu |
| 2025 | Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning. | Le Xu, Chenxing Li, Yong Ren, Yujie Chen, Yu Gu, Ruibo Fu, Shan Yang, Dong Yu |
| 2025 | Effective and Efficient One-pass Compression of Speech Foundation Models Using Sparsity-aware Self-pinching Gates. | Haoning Xu, Zhaoqing Li, Youjun Chen, Huimeng Wang, Guinan Li, Mengzhe Geng, Chengxi Deng, Xunying Liu |
| 2025 | MDDM: A Multi-view Discriminative Enhanced Diffusion-based Model for Speech Enhancement. | Nan Xu, Zhaolong Huang, Xiaonan Zhi |
| 2025 | Large Language Models based ASR Error Correction for Child Conversations. | Anfeng Xu, Tiantian Feng, So Hyun Kim, Somer Bishop, Catherine Lord, Shrikanth Narayanan |
| 2025 | The Effect of Word Predictability on Spoken Cross-Language Intelligibility. | Wei Xue, Iuliia Zaitova, Bernd Mbius |
| 2025 | Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty. | Hongfei Xue, Yufeng Tang, Jun Zhang, Xuelong Geng, Lei Xie |
| 2025 | WIND: Accelerated RNN-T Decoding with Windowed Inference for Non-blank Detection. | Hainan Xu, Vladimir Bataev, Lilit Grigoryan, Boris Ginsburg |
| 2025 | Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis. | Tianyi Xu, Hongjie Chen, Qing Wang, Hang Lv, Jian Kang, Jie Li, Zhennan Lin, Yongxiang Li, Lei Xie |
| 2025 | Language and Accent Familiarity Effects on the Use of Acoustic Cues in Talker Identification. | Shengyue Xiong, Zhe-chen Guo, Bharath Chandrasekaran |
| 2025 | EATS-Speech: Emotion-Adaptive Transformation and Priority Synthesis for Zero-Shot Text-to-Speech. | Jingyuan Xing, Zhipeng Li, Shuaiqi Chen, Xiaofen Xing, Xiangmin Xu |
| 2025 | Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving. | Jingran Xie, Xiang Li, Hui Wang, Yue Yu, Yang Xiang, Xixin Wu, Zhiyong Wu |
| 2025 | Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition. | Jiamin Xie, Ju Lin, Yiteng Huang, Tyler Vuong, Zhaojiang Lin, Zhaojun Yang, Peng Su, Prashant Rawat, Sangeeta Srivastava, Ming Sun, Florian Metze |
| 2025 | Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R. | Yixuan Xiao, Ngoc Thang Vu |
| 2025 | AdaKWS: Towards Robust Keyword Spotting with Test-Time Adaptation. | Yang Xiao, Tianyi Peng, Yanghao Zhou, Rohan Kumar Das |