| 2026 | AAAI | DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis. | Yinghao Aaron Li, Xilin Jiang, Fei Tao, Cheng Niu, Kaifeng Xu, Juntong Song, Nima Mesgarani |
| 2025 | ACL | AAD-LLM: Neural Attention-Driven Auditory Scene Understanding. | Xilin Jiang, Sukru Samet Dindar, Vishal Choudhari, Stephan Bickel, Ashesh D. Mehta, Guy M. McKhann II, Daniel Friedman, Adeen Flinker, Nima Mesgarani |
| 2025 | EMNLP | Layer-wise Minimal Pair Probing Reveals Contextual Grammatical-Conceptual Hierarchy in Speech Representations. | Linyang He, Qiaolin Wang, Xilin Jiang, Nima Mesgarani |
| 2025 | ICASSP | Dual-path Mamba: Short and Long-term Bidirectional Selective Structured State Space Models for Speech Separation. | Xilin Jiang, Cong Han, Nima Mesgarani |
| 2025 | ICASSP | Speech Slytherin: Examining the Performance and Efficiency of Mamba for Speech Separation, Recognition, and Synthesis. | Xilin Jiang, Yinghao Aaron Li, Adrian Nicolas Florea, Cong Han, Nima Mesgarani |
| 2025 | ICML | ArrayDPS: Unsupervised Blind Speech Separation with a Diffusion Prior. | Zhongweiyang Xu, Xulin Fan, Zhong-Qiu Wang, Xilin Jiang, Romit Roy Choudhury |
| 2025 | NAACL | StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style Diffusion. | Yinghao Aaron Li, Xilin Jiang, Cong Han, Nima Mesgarani |
| 2024 | ICASSP | Exploring Self-supervised Contrastive Learning of Spatial Sound Event Representation. | Xilin Jiang, Cong Han, Yinghao Aaron Li, Nima Mesgarani |
| 2023 | ICASSP | Phoneme-Level Bert for Enhanced Prosody of Text-To-Speech with Grapheme Predictions. | Yinghao Aaron Li, Cong Han, Xilin Jiang, Nima Mesgarani |
| 2023 | Interspeech | DeCoR: Defy Knowledge Forgetting by Predicting Earlier Audio Codes. | Xilin Jiang, Yinghao Aaron Li, Nima Mesgarani |