| 2025 | CHI | SpeakEasy: Enhancing Text-to-Speech Interactions for Expressive Content Creation. | Stephen Brade, Sam Anderson, Rithesh Kumar, Zeyu Jin, Anh Truong |
| 2025 | ICASSP | Everyone-Can-Sing: Zero-Shot Singing Voice Synthesis and Conversion with Speech Reference. | Shuqi Dai, Yunyun Wang, Roger B. Dannenberg, Zeyu Jin |
| 2025 | ICASSP | Code Drift: Towards Idempotent Neural Audio Codecs. | Patrick O'Reilly, Prem Seetharaman, Jiaqu Su, Zeyu Jin, Bryan Pardo |
| 2025 | ICLR | Visual Description Grounding Reduces Hallucinations and Boosts Reasoning in LVLMs. | Sreyan Ghosh, Chandra Kiran Reddy Evuru, Sonal Kumar, Utkarsh Tyagi, Oriol Nieto, Zeyu Jin, Dinesh Manocha |
| 2025 | ICML | DMOSpeech: Direct Metric Optimization via Distilled Diffusion Model in Zero-Shot Speech Synthesis. | Yinghao Aaron Li, Rithesh Kumar, Zeyu Jin |
| 2025 | IJCNN | V-CASS: Vision-context-aware Expressive Speech Synthesis for Enhancing User Understanding of Videos. | Qixin Wang, Songtao Zhou, Zeyu Jin, Chenglin Guo, Shikun Sun, Xiaoyu Qin |
| 2024 | CHI | SoulSkipper: A Voice-Controlled Emotional Adaptive Game to Complement Therapy for Social Anxiety Disorder. | Xiaohan Li, Qixin Wang, Zishan Wang, Zeyu Jin, Jia Jia |
| 2024 | ICASSP | MDX-GAN: Enhancing Perceptual Quality in Multi-Class Source Separation Via Adversarial Training. | Ke Chen, Jiaqi Su, Zeyu Jin |
| 2024 | ICASSP | Maskmark: Robust Neuralwatermarking for Real and Synthetic Speech. | Patrick O'Reilly, Zeyu Jin, Jiaqi Su, Bryan Pardo |
| 2024 | ICASSP | GR0: Self-Supervised Global Representation Learning for Zero-Shot Voice Conversion. | Yunyun Wang, Jiaqi Su, Adam Finkelstein, Zeyu Jin |
| 2024 | ICML | A Closer Look at the Limitations of Instruction Tuning. | Sreyan Ghosh, Chandra Kiran Reddy Evuru, Sonal Kumar, Ramaneswaran S., Deepali Aneja, Zeyu Jin, Ramani Duraiswami, Dinesh Manocha |
| 2024 | Interspeech | Improving Generalization of Speech Separation in Real-World Scenarios: Strategies in Simulation, Optimization, and Evaluation. | Ke Chen, Jiaqi Su, Taylor Berg-Kirkpatrick, Shlomo Dubnov, Zeyu Jin |
| 2024 | Interspeech | Genhancer: High-Fidelity Speech Enhancement via Generative Modeling on Discrete Codec Tokens. | Haici Yang, Jiaqi Su, Minje Kim, Zeyu Jin |
| 2023 | Interspeech | Efficient Spoken Language Recognition via Multilabel Classification. | Oriol Nieto, Zeyu Jin, Franck Dernoncourt, Justin Salamon |
| 2022 | ICASSP | Music Enhancement via Image Translation and Vocoding. | Nikhil Kandpal, Oriol Nieto, Zeyu Jin |
| 2022 | ICASSP | SQAPP: No-Reference Speech Quality Assessment Via Pairwise Preference. | Pranay Manocha, Zeyu Jin, Adam Finkelstein |
| 2022 | ICASSP | Controllable Speech Representation Learning Via Voice Conversion and AIC Loss. | Yunyun Wang, Jiaqi Su, Adam Finkelstein, Zeyu Jin |
| 2022 | Interspeech | Audio Similarity is Unreliable as a Proxy for Audio Quality. | Pranay Manocha, Zeyu Jin, Adam Finkelstein |
| 2022 | UIST | Record Once, Post Everywhere: Automatic Shortening of Audio Stories for Social Media. | Bryan Wang, Zeyu Jin, Gautham J. Mysore |
| 2021 | ICASSP | CDPAM: Contrastive Learning for Perceptual Audio Similarity. | Pranay Manocha, Zeyu Jin, Richard Zhang, Adam Finkelstein |
| 2021 | ICASSP | Context-Aware Prosody Correction for Text-Based Speech Editing. | Max Morrison, Lucas Rencker, Zeyu Jin, Nicholas J. Bryan, Juan Pablo Cceres, Bryan Pardo |
| 2021 | ICASSP | Bandwidth Extension is All You Need. | Jiaqi Su, Yunyun Wang, Adam Finkelstein, Zeyu Jin |
| 2020 | CHI | Music Creation by Example. | Emma Frid, Celso Gomes, Zeyu Jin |
| 2020 | ICASSP | Disentangled Multidimensional Metric Learning for Music Similarity. | Jongpil Lee, Nicholas J. Bryan, Justin Salamon, Zeyu Jin, Juhan Nam |
| 2020 | ICASSP | F0-Consistent Many-To-Many Non-Parallel Voice Conversion Via Conditional Autoencoder. | Kaizhi Qian, Zeyu Jin, Mark Hasegawa-Johnson, Gautham J. Mysore |
| 2020 | ICASSP | Acoustic Matching By Embedding Impulse Responses. | Jiaqi Su, Zeyu Jin, Adam Finkelstein |
| 2020 | Interspeech | A Differentiable Perceptual Audio Metric Learned from Just Noticeable Differences. | Pranay Manocha, Adam Finkelstein, Richard Zhang, Nicholas J. Bryan, Gautham J. Mysore, Zeyu Jin |
| 2020 | Interspeech | Controllable Neural Prosody Synthesis. | Max Morrison, Zeyu Jin, Justin Salamon, Nicholas J. Bryan, Gautham J. Mysore |
| 2020 | Interspeech | HiFi-GAN: High-Fidelity Denoising and Dereverberation Based on Speech Deep Features in Adversarial Networks. | Jiaqi Su, Zeyu Jin, Adam Finkelstein |
| 2020 | IUI | Pose2Pose: pose selection and transfer for 2D character animation. | Nora S. Willett, Hijung Valentina Shin, Zeyu Jin, Wilmot Li, Adam Finkelstein |
| 2019 | ICASSP | Learning Bandwidth Expansion Using Perceptually-motivated Loss. | Berthy Feng, Zeyu Jin, Jiaqi Su, Adam Finkelstein |
| 2019 | ICASSP | Perceptually-motivated Environment-specific Speech Enhancement. | Jiaqi Su, Adam Finkelstein, Zeyu Jin |
| 2018 | ICASSP | Fftnet: A Real-Time Speaker-Dependent Neural Vocoder. | Zeyu Jin, Adam Finkelstein, Gautham J. Mysore, Jingwan Lu |
| 2016 | ICASSP | Cute: A concatenative method for voice conversion using exemplar-based unit selection. | Zeyu Jin, Adam Finkelstein, Stephen DiVerdi, Jingwan Lu, Gautham J. Mysore |