| 2024 | Speaker Conditional Sinc-Extractor for Personal VAD. | En-Lun Yu, Kuan-Hsun Ho, Jeih-weih Hung, Shih-Chieh Huang, Berlin Chen |
| 2024 | Differentiable Time-Varying Linear Prediction in the Context of End-to-End Analysis-by-Synthesis. | Chin-Yun Yu, Gyrgy Fazekas |
| 2024 | Towards Speech Classification from Acoustic and Vocal Tract data in Real-time MRI. | Yaoyao Yue, Michael Proctor, Luping Zhou, Rijul Gupta, Tharinda Piyadasa, Amelia Gully, Kirrie J. Ballard, Craig T. Jin |
| 2024 | Continual Learning Optimizations for Auto-regressive Decoder of Multilingual ASR systems. | Kwok Chin Yuen, Jia Qi Yip, Eng Siong Chng |
| 2024 | Few-Shot Keyword Spotting from Mixed Speech. | Junming Yuan, Ying Shi, Lantian Li, Dong Wang, Askar Hamdulla |
| 2024 | DeWinder: Single-Channel Wind Noise Reduction using Ultrasound Sensing. | Kuang Yuan, Shuo Han, Swarun Kumar, Bhiksha Raj |
| 2024 | LI-TTA: Language Informed Test-Time Adaptation for Automatic Speech Recognition. | Eunseop Yoon, Hee Suk Yoon, John B. Harvill, Mark Hasegawa-Johnson, Chang D. Yoo |
| 2024 | HuBERT-EE: Early Exiting HuBERT for Efficient Speech Recognition. | Ji Won Yoon, Beom Jun Woo, Nam Soo Kim |
| 2024 | UNIQUE : Unsupervised Network for Integrated Speech Quality Evaluation. | Juhwan Yoon, WooSeok Ko, Seyun Um, Sungwoong Hwang, Soojoong Hwang, Changhwan Kim, Hong-Goo Kang |
| 2024 | Visualization for improving foreign language pronunciation. | Charlotte Yoder, Karrie Karahalios, Mark Hasegawa-Johnson, Shreyansh Agrawal |
| 2024 | Towards Audio Codec-based Speech Separation. | Jia Qi Yip, Shengkui Zhao, Dianwen Ng, Eng Siong Chng, Bin Ma |
| 2024 | SVSNet+: Enhancing Speaker Voice Similarity Assessment Models with Representations from Speech Foundation Models. | Chun Yin, Tai-Shih Chi, Yu Tsao, Hsin-Min Wang |
| 2024 | AFL-Net: Integrating Audio, Facial, and Lip Modalities with a Two-step Cross-attention for Robust Speaker Diarization in the Wild. | Yongkang Yin, Xu Li, Ying Shan, Yuexian Zou |
| 2024 | Language-Universal Speech Attributes Modeling for Zero-Shot Multilingual Spoken Keyword Recognition. | Hao Yen, Pin-Jui Ku, Sabato Marco Siniscalchi, Chin-Hui Lee |
| 2024 | Cross-Modality Diffusion Modeling and Sampling for Speech Recognition. | Chia-Kai Yeh, Chih-Chun Chen, Ching-Hsien Hsu, Jen-Tzung Chien |
| 2024 | SC-MoE: Switch Conformer Mixture of Experts for Unified Streaming and Non-streaming Code-Switching ASR. | Shuaishuai Ye, Shunfei Chen, Xinhui Hu, Xinkang Xu |
| 2024 | Neuromorphic Keyword Spotting with Pulse Density Modulation MEMS Microphones. | Sidi Yaya Arnaud Yarga, Sean U. N. Wood |
| 2024 | Speech enabled visual acuity test. | Boon Peng Yap, Kok Liang Tan, Zhenghao Li, Rong Tong |
| 2024 | Auditory Attention Decoding in Four-Talker Environment with EEG. | Yujie Yan, Xiran Xu, Haolin Zhu, Pei Tian, Zhongshu Ge, Xihong Wu, Jing Chen |
| 2024 | RASU: Retrieval Augmented Speech Understanding through Generative Modeling. | Hao Yang, Min Zhang, Minghan Wang, Jiaxin Guo |
| 2024 | Contextual Biasing with Confidence-based Homophone Detector for Mandarin End-to-End Speech Recognition. | Chengxu Yang, Lin Zheng, Sanli Tian, Gaofeng Cheng, Sujie Xiao, Ta Li |
| 2024 | MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis. | Qian Yang, Jialong Zuo, Zhe Su, Ziyue Jiang, Mingze Li, Zhou Zhao, Feiyang Chen, Zhefeng Wang, Baoxing Huai |
| 2024 | SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models. | Dongchao Yang, Dingdong Wang, Haohan Guo, Xueyuan Chen, Xixin Wu, Helen Meng |
| 2024 | RW-VoiceShield: Raw Waveform-based Adversarial Attack on One-shot Voice Conversion. | Ching-Yu Yang, Shreya G. Upadhyay, Ya-Tse Wu, Bo-Hao Su, Chi-Chun Lee |
| 2024 | Pre-training Feature Guided Diffusion Model for Speech Enhancement. | Yiyuan Yang, Niki Trigoni, Andrew Markham |