| 2026 | AAAI | KALL-E: Autoregressive Speech Synthesis with Next-Distribution Prediction. | Kangxiang Xia, Xinfa Zhu, Jixun Yao, Wenjie Tian, Wenhao Li, Lei Xie |
| 2026 | ACL | S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation. | Yu Pan, Xiongfei Wu, Yuguang Yang, Jixun Yao, Maxime Cordy, Lei Ma, Jianjun Zhao |
| 2025 | AAAI | Drop the Beat! Freestyler for Accompaniment Conditioned Rapping Voice Generation. | Ziqian Ning, Shuai Wang, Yuepeng Jiang, Jixun Yao, Lei He, Shifeng Pan, Jie Ding, Lei Xie |
| 2025 | AAAI | StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching. | Jixun Yao, Yuguang Yang, Yu Pan, Ziqian Ning, Jianhao Ye, Hongbin Zhou, Lei Xie |
| 2025 | ACL | Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling. | Yuguang Yang, Yu Pan, Jixun Yao, Xiang Zhang, Jianhao Ye, Hongbin Zhou, Lei Xie, Lei Ma, Jianjun Zhao |
| 2025 | ASRU | DiffRhythm+: Controllable and Flexible Full-Length Song Generation with Preference Optimization. | Huakang Chen, Yuepeng Jiang, Guobin Ma, Chunbo Hao, Shuai Wang, Jixun Yao, Ziqian Ning, Meng Meng, Jian Luan, Lei Xie |
| 2025 | ICASSP | DiffAttack: Diffusion-based Timbre-reserved Adversarial Attack in Speaker Identification. | Qing Wang, Jixun Yao, Zhaokai Sun, Pengcheng Guo, Lei Xie, John H. L. Hansen |
| 2025 | ICLR | GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling. | Jixun Yao, Hexin Liu, Chen Chen, Yuchen Hu, Eng Siong Chng, Lei Xie |
| 2025 | Interspeech | ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech. | Yu Pan, Yanni Hu, Yuguang Yang, Jixun Yao, Jianhao Ye, Hongbin Zhou, Lei Ma, Jianjun Zhao |
| 2025 | Interspeech | EASY: Emotion-aware Speaker Anonymization via Factorized Distillation. | Jixun Yao, Hexin Liu, Eng Siong Chng, Lei Xie |
| 2024 | ICASSP | Dualvc 2: Dynamic Masked Convolution for Unified Streaming and Non-Streaming Voice Conversion. | Ziqian Ning, Yuepeng Jiang, Pengcheng Zhu, Shuai Wang, Jixun Yao, Lei Xie, Mengxiao Bi |
| 2024 | ICASSP | GEmo-CLAP: Gender-Attribute-Enhanced Contrastive Language-Audio Pretraining for Accurate Speech Emotion Recognition. | Yu Pan, Yanni Hu, Yuguang Yang, Wen Fei, Jixun Yao, Heng Lu, Lei Ma, Jianjun Zhao |
| 2024 | ICASSP | Promptvc: Flexible Stylistic Voice Conversion in Latent Space Driven by Natural Language Prompts. | Jixun Yao, Yuguang Yang, Yi Lei, Ziqian Ning, Yanni Hu, Yu Pan, Jingjing Yin, Hongbin Zhou, Heng Lu, Lei Xie |
| 2024 | Interspeech | DualVC 3: Leveraging Language Model Generated Pseudo Context for End-to-end Low Latency Streaming Voice Conversion. | Ziqian Ning, Shuai Wang, Pengcheng Zhu, Zhichao Wang, Jixun Yao, Lei Xie, Mengxiao Bi |
| 2023 | AAAI | UniSyn: An End-to-End Unified Model for Text-to-Speech and Singing Voice Synthesis. | Yi Lei, Shan Yang, Xinsheng Wang, Qicong Xie, Jixun Yao, Lei Xie, Dan Su |
| 2023 | ASRU | Salt: Distinguishable Speaker Anonymization Through Latent Space Transformation. | Yuanjun Lv, Jixun Yao, Peikun Chen, Hongbin Zhou, Heng Lu, Lei Xie |
| 2023 | ICASSP | Expressive-VC: Highly Expressive Voice Conversion with Attention Fusion of Bottleneck and Perturbation Features. | Ziqian Ning, Qicong Xie, Pengcheng Zhu, Zhichao Wang, Liumeng Xue, Jixun Yao, Lei Xie, Mengxiao Bi |
| 2023 | ICASSP | Preserving Background Sound in Noise-Robust Voice Conversion Via Multi-Task Learning. | Jixun Yao, Yi Lei, Qing Wang, Pengcheng Guo, Ziqian Ning, Lei Xie, Hai Li, Junhui Liu, Danming Xie |
| 2023 | ICASSP | Distinguishable Speaker Anonymization Based on Formant and Fundamental Frequency Scaling. | Jixun Yao, Qing Wang, Yi Lei, Pengcheng Guo, Lei Xie, Namin Wang, Jie Liu |
| 2023 | Interspeech | Pseudo-Siamese Network based Timbre-reserved Black-box Adversarial Attack in Speaker Identification. | Qing Wang, Jixun Yao, Ziqian Wang, Pengcheng Guo, Lei Xie |
| 2023 | Interspeech | DualVC: Dual-mode Voice Conversion using Intra-model Knowledge Distillation and Hybrid Predictive Coding. | Ziqian Ning, Yuepeng Jiang, Pengcheng Zhu, Jixun Yao, Shuai Wang, Lei Xie, Mengxiao Bi |