| 2025 | AAAI | Language Model Can Listen While Speaking. | Ziyang Ma, Yakun Song, Chenpeng Du, Jian Cong, Zhuo Chen, Yuping Wang, Yuxuan Wang, Xie Chen |
| 2025 | ICML | DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation. | Dongya Jia, Zhuo Chen, Jiawei Chen, Chenpeng Du, Jian Wu, Jian Cong, Xiaobin Zhuang, Chumin Li, Zhen Wei, Yuping Wang, Yuxuan Wang |
| 2023 | ICASSP | DSPGAN: A Gan-Based Universal Vocoder for High-Fidelity TTS by Time-Frequency Domain Supervision from DSP. | Kun Song, Yongmao Zhang, Yi Lei, Jian Cong, Hanzhao Li, Lei Xie, Gang He, Jinfeng Bai |
| 2022 | ICASSP | VISinger: Variational Inference with Adversarial Learning for End-to-End Singing Voice Synthesis. | Yongmao Zhang, Jian Cong, Heyang Xue, Lei Xie, Pengcheng Zhu, Mengxiao Bi |
| 2022 | Interspeech | Glow-WaveGAN 2: High-quality Zero-shot Text-to-speech Synthesis and Any-to-any Voice Conversion. | Yi Lei, Shan Yang, Jian Cong, Lei Xie, Dan Su |
| 2021 | Interspeech | Controllable Context-Aware Conversational Speech Synthesis. | Jian Cong, Shan Yang, Na Hu, Guangzhi Li, Lei Xie, Dan Su |
| 2021 | Interspeech | Glow-WaveGAN: Learning Speech Representations from GAN-Based Variational Auto-Encoder for High Fidelity Flow-Based Speech Synthesis. | Jian Cong, Shan Yang, Lei Xie, Dan Su |
| 2020 | Interspeech | Data Efficient Voice Cloning from Noisy Samples with Domain Adversarial Training. | Jian Cong, Shan Yang, Lei Xie, Guoqiao Yu, Guanglu Wan |
| 2006 | ICASSP | New Speech Encoding Algorithms for Ultra Low Bit Rate at 600/300 Bps. | Jian Cong, Suo Cong |