| 2026 | ACL | VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation. | Puyuan Peng, Zhisheng Zheng, Shang-Wen Li, Abdelrahman Mohamed, David Harwath |
| 2025 | EMNLP | Scaling Rich Style-Prompted Text-to-Speech Datasets. | Anuj Diwan, Zhisheng Zheng, David Harwath, Eunsol Choi |
| 2025 | EMNLP | VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing. | Zhisheng Zheng, Puyuan Peng, Anuj Diwan, Cong Phuoc Huynh, Xiaohang Sun, Zhu Liu, Vimal Bhat, David Harwath |
| 2025 | ICASSP | SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs. | Wenxi Chen, Ziyang Ma, Xiquan Li, Xuenan Xu, Yuzhe Liang, Zhisheng Zheng, Kai Yu, Xie Chen |
| 2025 | ICASSP | DRCap: Decoding CLAP Latents with Retrieval-Augmented Generation for Zero-shot Audio Captioning. | Xiquan Li, Wenxi Chen, Ziyang Ma, Xuenan Xu, Yuzhe Liang, Zhisheng Zheng, Qiuqiang Kong, Xie Chen |
| 2025 | ICTAI | Compositional Neural Distance Field with Latent Code Embedding for Dynamic Objects. | Xiang Gao, Zhisheng Zheng, Alois Knoll |
| 2024 | ACL | emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation. | Ziyang Ma, Zhisheng Zheng, Jiaxin Ye, Jinchao Li, Zhifu Gao, Shiliang Zhang, Xie Chen |
| 2024 | ICASSP | Leveraging Speech PTM, Text LLM, And Emotional TTS For Speech Emotion Recognition. | Ziyang Ma, Wen Wu, Zhisheng Zheng, Yiwei Guo, Qian Chen, Shiliang Zhang, Xie Chen |
| 2024 | ICML | BAT: Learning to Reason about Spatial Sounds with Large Language Models. | Zhisheng Zheng, Puyuan Peng, Ziyang Ma, Xie Chen, Eunsol Choi, David Harwath |
| 2024 | IJCAI | EAT: Self-Supervised Pre-Training with Efficient Audio Transformer. | Wenxi Chen, Yuzhe Liang, Ziyang Ma, Zhisheng Zheng, Xie Chen |
| 2024 | Interspeech | EmoBox: Multilingual Multi-corpus Speech Emotion Recognition Toolkit and Benchmark. | Ziyang Ma, Mingjie Chen, Hezhao Zhang, Zhisheng Zheng, Wenxi Chen, Xiquan Li, Jiaxin Ye, Xie Chen, Thomas Hain |
| 2023 | ASRU | Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition. | Yujin Wang, Changli Tang, Ziyang Ma, Zhisheng Zheng, Xie Chen, Wei-Qiang Zhang |
| 2023 | ASRU | Fast-Hubert: an Efficient Training Framework for Self-Supervised Speech Representation Learning. | Guanrou Yang, Ziyang Ma, Zhisheng Zheng, Yakun Song, Zhikang Niu, Xie Chen |
| 2023 | ICASSP | Front-End Adapter: Adapting Front-End Input of Speech Based Self-Supervised Learning for Speech Recognition. | Xie Chen, Ziyang Ma, Changli Tang, Yujin Wang, Zhisheng Zheng |
| 2023 | Interspeech | MT4SSL: Boosting Self-Supervised Speech Representation Learning by Integrating Multiple Targets. | Ziyang Ma, Zhisheng Zheng, Changli Tang, Yujin Wang, Xie Chen |
| 2023 | Interspeech | Pushing the Limits of Unsupervised Unit Discovery for SSL Speech Representation. | Ziyang Ma, Zhisheng Zheng, Guanrou Yang, Yu Wang, Chao Zhang, Xie Chen |
| 2023 | Interspeech | Unsupervised Active Learning: Optimizing Labeling Cost-Effectiveness for Automatic Speech Recognition. | Zhisheng Zheng, Ziyang Ma, Yu Wang, Xie Chen |