| 2025 | ACL | PodAgent: A Comprehensive Framework for Podcast Generation. | Yujia Xiao, Lei He, Haohan Guo, Fenglong Xie, Tan Lee |
| 2025 | ICASSP | Speaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation. | Haohan Guo, Fenglong Xie, Dongchao Yang, Xixin Wu, Helen Meng |
| 2025 | ICML | ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling. | Dongchao Yang, Songxiang Liu, Haohan Guo, Jiankun Zhao, Yuanyuan Wang, Helin Wang, Zeqian Ju, Xubo Liu, Xueyuan Chen, Xu Tan, Xixin Wu, Helen M. Meng |
| 2024 | ICASSP | Cross-Speaker Encoding Network for Multi-Talker Speech Recognition. | Jiawen Kang, Lingwei Meng, Mingyu Cui, Haohan Guo, Xixin Wu, Xunying Liu, Helen Meng |
| 2024 | ICASSP | Unifying One-Shot Voice Conversion and Cloning with Disentangled Speech Representations. | Hui Lu, Xixin Wu, Haohan Guo, Songxiang Liu, Zhiyong Wu, Helen Meng |
| 2024 | ICML | UniAudio: Towards Universal Audio Generation with Large Language Models. | Dongchao Yang, Jinchuan Tian, Xu Tan, Rongjie Huang, Songxiang Liu, Haohan Guo, Xuankai Chang, Jiatong Shi, Sheng Zhao, Jiang Bian, Zhou Zhao, Xixin Wu, Helen M. Meng |
| 2024 | Interspeech | Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation. | Hanzhao Li, Liumeng Xue, Haohan Guo, Xinfa Zhu, Yuanjun Lv, Lei Xie, Yunlin Chen, Hao Yin, Zhifei Li |
| 2024 | Interspeech | SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models. | Dongchao Yang, Dingdong Wang, Haohan Guo, Xueyuan Chen, Xixin Wu, Helen Meng |
| 2022 | ICASSP | Improving Adversarial Waveform Generation Based Singing Voice Conversion with Harmonic Signals. | Haohan Guo, Zhiping Zhou, Fanbo Meng, Kai Liu |
| 2022 | Interspeech | A Multi-Scale Time-Frequency Spectrogram Discriminator for GAN-based Non-Autoregressive TTS. | Haohan Guo, Hui Lu, Xixin Wu, Helen Meng |
| 2022 | Interspeech | A Multi-Stage Multi-Codebook VQ-VAE Approach to High-Performance Neural TTS. | Haohan Guo, Feng-Long Xie, Frank K. Soong, Xixin Wu, Helen Meng |
| 2019 | Interspeech | A New GAN-Based End-to-End TTS Training Algorithm. | Haohan Guo, Frank K. Soong, Lei He, Lei Xie |
| 2019 | Interspeech | Exploiting Syntactic Features in a Parsed Tree to Improve End-to-End TTS. | Haohan Guo, Frank K. Soong, Lei He, Lei Xie |