| 2024 | Optical Flow Guided Tongue Trajectory Generation for Diffusion-based Acoustic to Articulatory Inversion. | Yudong Yang, Rongfeng Su, Rukiye Ruzi, Manwa L. Ng, Shaofeng Zhao, Nan Yan, Lan Wang |
| 2024 | Genhancer: High-Fidelity Speech Enhancement via Generative Modeling on Discrete Codec Tokens. | Haici Yang, Jiaqi Su, Minje Kim, Zeyu Jin |
| 2024 | Contemplative Mechanism for Speech Recognition: Speech Encoders can Think. | Tien-Ju Yang, Andrew Rosenberg, Bhuvana Ramabhadran |
| 2024 | Intrusive schwa within French stop-liquid clusters: An acoustic analysis. | Minmin Yang, Rachid Ridouane |
| 2024 | MaLa-ASR: Multimedia-Assisted LLM-Based ASR. | Guanrou Yang, Ziyang Ma, Fan Yu, Zhifu Gao, Shiliang Zhang, Xie Chen |
| 2024 | Learning from Back Chunks: Acquiring More Future Knowledge for Streaming ASR Models via Self Distillation. | Yuting Yang, Guodong Ma, Yuke Li, Binbin Du, Haoqi Zhu, Liang Ruan |
| 2024 | DualSpeech: Enhancing Speaker-Fidelity and Text-Intelligibility Through Dual Classifier-Free Guidance. | Jinhyeok Yang, Junhyeok Lee, Hyeong-Seok Choi, Seunghoon Ji, Hyeongju Kim, Juheon Lee |
| 2024 | Frame-Wise Breath Detection with Self-Training: An Exploration of Enhancing Breath Naturalness in Text-to-Speech. | Dong Yang, Tomoki Koriyama, Yuki Saito |
| 2024 | Bilingual and Code-switching TTS Enhanced with Denoising Diffusion Model and GAN. | Huai-Zhe Yang, Chia-Ping Chen, Shan-Yun He, Cheng-Ruei Li |
| 2024 | Bridging Language Gaps in Audio-Text Retrieval. | Zhiyong Yan, Heinrich Dinkel, Yongqing Wang, Jizhong Liu, Junbo Zhang, Yujun Wang, Bin Wang |
| 2024 | Reshape Dimensions Network for Speaker Recognition. | Ivan Yakovlev, Rostislav Makarov, Andrei Balykin, Pavel Malov, Anton Okhotnikov, Nikita Torgashov |
| 2024 | Audio Mamba: Selective State Spaces for Self-Supervised Audio Representations. | Sarthak Yadav, Zheng-Hua Tan |
| 2024 | MS-HuBERT: Mitigating Pre-training and Inference Mismatch in Masked Language Modelling methods for learning Speech Representations. | Hemant Yadav, Sunayana Sitaram, Rajiv Ratn Shah |
| 2024 | Enhancing Zero-shot Audio Classification using Sound Attribute Knowledge from Large Language Models. | Xuenan Xu, Pingyue Zhang, Ming Yan, Ji Zhang, Mengyue Wu |
| 2024 | Residual Speaker Representation for One-Shot Voice Conversion. | Le Xu, Jiangyan Yi, Tao Wang, Yong Ren, Rongxiu Zhong, Zhengqi Wen, Jianhua Tao |
| 2024 | Seamless Language Expansion: Enhancing Multilingual Mastery in Self-Supervised Models. | Jing Xu, Minglin Wu, Xixin Wu, Helen Meng |
| 2024 | Voice quality in telephone speech: Comparing acoustic measures between VoIP telephone and high-quality recordings. | Chenzi Xu, Jessica Wormald, Paul Foulkes, Philip Harrison, Vincent Hughes, Poppy Welch, Finnian Kelly, David van der Vloed |
| 2024 | Efficient Audio Captioning with Encoder-Level Knowledge Distillation. | Xuenan Xu, Haohe Liu, Mengyue Wu, Wenwu Wang, Mark D. Plumbley |
| 2024 | Towards Rehearsal-Free Multilingual ASR: A LoRA-based Case Study on Whisper. | Tianyi Xu, Kaixun Huang, Pengcheng Guo, Yu Zhou, Longtao Huang, Hui Xue, Lei Xie |
| 2024 | Exploring Speech Foundation Models for Speaker Diarization in Child-Adult Dyadic Interactions. | Anfeng Xu, Kevin Huang, Tiantian Feng, Lue Shen, Helen Tager-Flusberg, Shrikanth Narayanan |
| 2024 | Towards a better understanding of receptive multilingualism: listening conditions and priming effects. | Wei Xue, Ivan Yuen, Bernd Mbius |
| 2024 | Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model. | Jinlong Xue, Yayue Deng, Yicheng Han, Yingming Gao, Ya Li |
| 2024 | Retrieval Augmented Generation in Prompt-based Text-to-Speech Synthesis with Context-Aware Contrastive Language-Audio Pretraining. | Jinlong Xue, Yayue Deng, Yingming Gao, Ya Li |
| 2024 | FoVNet: Configurable Field-of-View Speech Enhancement with Low Computation and Distortion for Smart Glasses. | Zhongweiyang Xu, Ali Aroudi, Ke Tan, Ashutosh Pandey, Jung-Suk Lee, Buye Xu, Francesco Nesta |
| 2024 | Comparing Discrete and Continuous Space LLMs for Speech Recognition. | Yaoxun Xu, Shi-Xiong Zhang, Jianwei Yu, Zhiyong Wu, Dong Yu |