| 2026 | AAAI | DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis. | Yinghao Aaron Li, Xilin Jiang, Fei Tao, Cheng Niu, Kaifeng Xu, Juntong Song, Nima Mesgarani |
| 2025 | ICASSP | Speech Slytherin: Examining the Performance and Efficiency of Mamba for Speech Separation, Recognition, and Synthesis. | Xilin Jiang, Yinghao Aaron Li, Adrian Nicolas Florea, Cong Han, Nima Mesgarani |
| 2025 | ICML | DMOSpeech: Direct Metric Optimization via Distilled Diffusion Model in Zero-Shot Speech Synthesis. | Yinghao Aaron Li, Rithesh Kumar, Zeyu Jin |
| 2025 | NAACL | StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style Diffusion. | Yinghao Aaron Li, Xilin Jiang, Cong Han, Nima Mesgarani |
| 2024 | ICASSP | Exploring Self-supervised Contrastive Learning of Spatial Sound Event Representation. | Xilin Jiang, Cong Han, Yinghao Aaron Li, Nima Mesgarani |
| 2023 | ICASSP | Phoneme-Level Bert for Enhanced Prosody of Text-To-Speech with Grapheme Predictions. | Yinghao Aaron Li, Cong Han, Xilin Jiang, Nima Mesgarani |
| 2023 | Interspeech | DeCoR: Defy Knowledge Forgetting by Predicting Earlier Audio Codes. | Xilin Jiang, Yinghao Aaron Li, Nima Mesgarani |
| 2021 | Interspeech | StarGANv2-VC: A Diverse, Unsupervised, Non-Parallel Framework for Natural-Sounding Voice Conversion. | Yinghao Aaron Li, Ali Zare, Nima Mesgarani |