| 2025 | AAAI | Drop the Beat! Freestyler for Accompaniment Conditioned Rapping Voice Generation. | Ziqian Ning, Shuai Wang, Yuepeng Jiang, Jixun Yao, Lei He, Shifeng Pan, Jie Ding, Lei Xie |
| 2025 | ASRU | DiffRhythm+: Controllable and Flexible Full-Length Song Generation with Preference Optimization. | Huakang Chen, Yuepeng Jiang, Guobin Ma, Chunbo Hao, Shuai Wang, Jixun Yao, Ziqian Ning, Meng Meng, Jian Luan, Lei Xie |
| 2025 | ASRU | REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers. | Yuepeng Jiang, Ziqian Ning, Shuai Wang, Chengjia Wang, Mengxiao Bi, Pengcheng Zhu, Zhonghua Fu, Lei Xie |
| 2024 | ICASSP | Dualvc 2: Dynamic Masked Convolution for Unified Streaming and Non-Streaming Voice Conversion. | Ziqian Ning, Yuepeng Jiang, Pengcheng Zhu, Shuai Wang, Jixun Yao, Lei Xie, Mengxiao Bi |
| 2024 | Interspeech | Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling. | Yuepeng Jiang, Tao Li, Fengyu Yang, Lei Xie, Meng Meng, Yujun Wang |
| 2024 | Interspeech | WenetSpeech4TTS: A 12, 800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark. | Linhan Ma, Dake Guo, Kun Song, Yuepeng Jiang, Shuai Wang, Liumeng Xue, Weiming Xu, Huan Zhao, Binbin Zhang, Lei Xie |
| 2023 | ASRU | HIGNN-TTS: Hierarchical Prosody Modeling With Graph Neural Networks for Expressive Long-Form TTS. | Dake Guo, Xinfa Zhu, Liumeng Xue, Tao Li, Yuanjun Lv, Yuepeng Jiang, Lei Xie |
| 2023 | ASRU | Vits-Based Singing Voice Conversion Leveraging Whisper and Multi-Scale F0 Modeling. | Ziqian Ning, Yuepeng Jiang, Zhichao Wang, Bin Zhang, Lei Xie |
| 2023 | Interspeech | DualVC: Dual-mode Voice Conversion using Intra-model Knowledge Distillation and Hybrid Predictive Coding. | Ziqian Ning, Yuepeng Jiang, Pengcheng Zhu, Jixun Yao, Shuai Wang, Lei Xie, Mengxiao Bi |
| 2021 | ICCV | BEV-Net: Assessing Social Distancing Compliance by Joint People Localization and Geometric Reasoning. | Zhirui Dai, Yuepeng Jiang, Yi Li, Bo Liu, Antoni B. Chan, Nuno Vasconcelos |