| 2024 | Improving Speech-Based Dysarthria Detection using Multi-task Learning with Gradient Projection. | Yan Xiong, Visar Berisha, Julie Liss, Chaitali Chakrabarti |
| 2024 | Audio-text Retrieval with Transformer-based Hierarchical Alignment and Disentangled Cross-modal Representation. | Yifei Xin, Zhihong Zhu, Xuxin Cheng, Xusheng Yang, Yuexian Zou |
| 2024 | A Joint Noise Disentanglement and Adversarial Training Framework for Robust Speaker Verification. | Xujiang Xing, Mingxing Xu, Thomas Fang Zheng |
| 2024 | DiffATR: Diffusion-based Generative Modeling for Audio-Text Retrieval. | Yifei Xin, Xuxin Cheng, Zhihong Zhu, Xusheng Yang, Yuexian Zou |
| 2024 | DB-PMAE: Dual-Branch Prototypical Masked AutoEncoder with locality for domain robust speaker verification. | Wei-Lin Xie, Yu-Xuan Xi, Yan Song, Jian-Tao Zhang, Hao-Yu Song, Ian McLoughlin |
| 2024 | FakeSound: Deepfake General Audio Detection. | Zeyu Xie, Baihan Li, Xuenan Xu, Zheng Liang, Kai Yu, Mengyue Wu |
| 2024 | Generalized Source Tracing: Detecting Novel Audio Deepfake Algorithm with Real Emphasis and Fake Dispersion Strategy. | Yuankun Xie, Ruibo Fu, Zhengqi Wen, Zhiyong Wang, Xiaopeng Wang, Haonan Cheng, Long Ye, Jianhua Tao |
| 2024 | Dynamic Data Pruning for Automatic Speech Recognition. | Qiao Xiao, Pingchuan Ma, Adriana Fernandez-Lopez, Boqian Wu, Lu Yin, Stavros Petridis, Mykola Pechenizkiy, Maja Pantic, Decebal Constantin Mocanu, Shiwei Liu |
| 2024 | An Effective Local Prototypical Mapping Network for Speech Emotion Recognition. | Yuxuan Xi, Yan Song, Lirong Dai, Haoyu Song, Ian McLoughlin |
| 2024 | TokSing: Singing Voice Synthesis based on Discrete Tokens. | Yuning Wu, Chunlei Zhang, Jiatong Shi, Yuxun Tang, Shan Yang, Qin Jin |
| 2024 | Influences of Morphosyntax and Semantics on the Intonation of Mandarin Chinese Wh-indeterminates. | Hongchen Wu, Jiwon Yun |
| 2024 | Prompting Large Language Models with Mispronunciation Detection and Diagnosis Abilities. | Minglin Wu, Jing Xu, Xixin Wu, Helen Meng |
| 2024 | Depression Enhances Internal Inconsistency between Spoken and Semantic Emotion: Evidence from the Analysis of Emotion Expression in Conversation. | Xinyi Wu, Changqing Xu, Nan Li, Rongfeng Su, Lan Wang, Nan Yan |
| 2024 | CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems. | Haibin Wu, Yuan Tseng, Hung-yi Lee |
| 2024 | Modeling Vocal Tract Like Acoustic Tubes Using the Immersed Boundary Method. | Rongshuai Wu, Debasish Ray Mohapatra, Sidney Fels |
| 2024 | Towards EMG-to-Speech with Necklace Form Factor. | Peter Wu, Ryan Kaveh, Raghav Nautiyal, Christine Zhang, Albert Guo, Anvitha Kachinthaya, Tavish Mishra, Bohan Yu, Alan W. Black, Rikky Muller, Gopala Krishna Anumanchipalli |
| 2024 | Unified Audio Visual Cues for Target Speaker Extraction. | Tianci Wu, Shulin He, Jiahui Pan, Haifeng Huang, Zhijian Mo, Xueliang Zhang |
| 2024 | Spoofing Speech Detection by Modeling Local Spectro-Temporal and Long-term Dependency. | Haochen Wu, Wu Guo, Zhentao Zhang, Wenting Zhao, Shengyu Peng, Jie Zhang |
| 2024 | Adapter Learning from Pre-trained Model for Robust Spoof Speech Detection. | Haochen Wu, Wu Guo, Shengyu Peng, Zhuhai Li, Jie Zhang |
| 2024 | Improving Multilingual Text-to-Speech with Mixture-of-Language-Experts and Accent Disentanglement. | Jing Wu, Ting Chen, Minchuan Chen, Wei Hu, Shaojun Wang, Jing Xiao |
| 2024 | Optimizing Automatic Speech Assessment: W-RankSim Regularization and Hybrid Feature Fusion Strategies. | Chung-Wen Wu, Berlin Chen |
| 2024 | Mandarin T3 Production by Chinese and Japanese Native Speakers. | Qi Wu |
| 2024 | Can Modelling Inter-Rater Ambiguity Lead To Noise-Robust Continuous Emotion Predictions? | Ya-Tse Wu, Jingyao Wu, Vidhyasaharan Sethu, Chi-Chun Lee |
| 2024 | Prosody-Driven Privacy-Preserving Dementia Detection. | Dominika Woszczyk, Ranya Aloufi, Soteris Demetriou |
| 2024 | Speech foundation models in healthcare: Effect of layer selection on pathological speech feature prediction. | Daniela A. Wiepert, Rene L. Utianski, Joseph R. Duffy, John L. Stricker, Leland R. Barnard, David T. Jones, Hugo Botha |