| 2025 | Talker Normalization in Chinese Bilinguals: A Comparative Study. | Mingxi Lu, Ran Tao, Yujia Tian |
| 2025 | Cross-modal Knowledge Transfer Learning as Graph Matching Based on Optimal Transport for ASR. | Xugang Lu, Peng Shen, Yu Tsao, Hisashi Kawai |
| 2025 | Pseudo Labels-based Neural Speech Enhancement for the AVSR Task in the MISP-Meeting Challenge. | Longjie Luo, Shenghui Lu, Lin Li, Qingyang Hong |
| 2025 | SuPseudo: A Pseudo-supervised Learning Method for Neural Speech Enhancement in Far-field Speech Recognition. | Longjie Luo, Lin Li, Qingyang Hong |
| 2025 | ToxicTone: A Mandarin Audio Dataset Annotated for Toxicity and Toxic Utterance Tonality. | Yu-Xiang Luo, Yi-Cheng Lin, Ming-To Chuang, Jia-Hung Chen, I-Ning Tsai, Pei Xing Kiew, Yueh-Hsuan Huang, Chien-Feng Liu, Yu-Chen Chen, Bo-Han Feng, Wenze Ren, Hung-yi Lee |
| 2025 | Speech-IFEval: Evaluating Instruction-Following and Quantifying Catastrophic Forgetting in Speech-Aware Language Models. | Ke-Han Lu, Chun-Yi Kuan, Hung-yi Lee |
| 2025 | Towards a dynamical model of transitions between fluent and stuttered speech. | Yijing Lu, Khalil Iskarous, Louis Goldstein |
| 2025 | A Two-Stage Hierarchical Deep Filtering Framework for Real-Time Speech Enhancement. | Shenghui Lu, Hukai Huang, Jinanglong Yao, Kaidi Wang, Qingyang Hong, Lin Li |
| 2025 | The Role of Syntactic Structures in Shaping Directionality in Trisyllabic Tone Sandhi: Evidence from Tianjin Mandarin. | Siqi Lu, Hui Feng, Ziyu Xiong |
| 2025 | Improving Noise Robustness of LLM-based Zero-shot TTS via Discrete Acoustic Token Denoising. | Ye-Xin Lu, Hui-Peng Du, Fei Liu, Yang Ai, Zhen-Hua Ling |
| 2025 | MelRe: Vision-Based Mel-Spectrogram Restoration. | Kaixuan Luan, Xiaoda Yang, Shile Cai, Ruofan Hu, Minghui Fang, Wenrui Liu, Jialong Zuo, Jiaqi Duan, Yuhang Ma, Junyu Lu |
| 2025 | Robust Neural Codec Language Modeling with Phoneme Position Prediction for Zero-Shot TTS. | Chunhui Lu, Xue Wen, Liming Song, Junkwang Oh |
| 2025 | Zero-Shot Speech-Based Depression and Anxiety Assessment with LLMs. | Erfan Loweimi, Sofia de la Fuente Garcia, Saturnino Luz |
| 2025 | Articulatory Strategy in Vowel Production as a Basis for Speaker Discrimination. | Justin J. H. Lo, Patrycja Strycharczuk, Sam Kirkham |
| 2025 | SawtArabi: A Benchmark Corpus for Arabic TTS. Standard, Dialectal and Code-Switching. | Vasista Sai Lodagala, Lamya Alkanhal, Daniel Izham, Shivam Mehta, Shammur Absar Chowdhury, Aqeelah Makki, Hamdy S. Hussein, Gustav Eje Henter, Ahmed Ali |
| 2025 | Gradual modeling of the Lombard effect by modifying speaker embeddings from a Text-To-Speech model. | Thiago Henrique Gomes Lobato, Magnus Schfer |
| 2025 | Training-Free Voice Conversion with Factorized Optimal Transport. | Alexander Lobashev, Assel Yermekova, Maria A. Larchenko |
| 2025 | Identifying Primary Stress Across Related Languages and Dialects with Transformer-based Speech Encoder Models. | Nikola Ljubesic, Ivan Porupski, Peter Rupnik |
| 2025 | Lexical competition in the process of Cantonese tone merging: Diverse Impact Mechanisms Across Different Individuals and Tone Pairs. | Lishan Li, Yaolin Zhou, Xiaoying Xu |
| 2025 | Dog2vec: Self-Supervised Pre-Training for Canine Vocal Representation. | Xingyuan Li, Kenny Q. Zhu, Mengyue Wu |
| 2025 | Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge. | Zhaoyang Li, Haodong Zhou, Longjie Luo, XiaoXiao Li, Yongxin Chen, Lin Li, Qingyang Hong |
| 2025 | Leveraging Large Language Models for Sarcastic Speech Annotation in Sarcasm Detection. | Zhu Li, Yuqing Zhang, Xiyuan Gao, Shekhar Nayak, Matt Coler |
| 2025 | LRBA: Stealthy Backdoor Attacks on Speech Classification via Latent Rearrangement in VITS. | Zexin Li, Wenhan Yao, Ye Xiao, Jinsu Yang, Fen Xiao, Weiping Wen |
| 2025 | Towards Inclusive ASR: Investigating Voice Conversion for Dysarthric Speech Recognition in Low-Resource Languages. | Chin-Jou Li, Eunjung Yeo, Kwanghee Choi, Paula Andrea Prez-Toro, Masao Someki, Rohan Kumar Das, Zhengjun Yue, Juan Rafael Orozco-Arroyave, Elmar Nth, David R. Mortensen |
| 2025 | SA-RAS: Speaker-Aware Style Retrieval Augmented Generation for Expressive Zero-Shot Text-to-Speech Synthesis. | Xueru Li, Jingyuan Xing, Xiaofen Xing, Zhipeng Li, Xiangmin Xu |