Ziyue Jiang
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
32
Venues
11
Active years
2020–2026
Best venue rank
A*
Where they publish
Papers
32 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | ACL | DiTReducio: A Training-Free Acceleration for DiT-Based TTS via Progressive Calibration. | Yanru Huo, Ziyue Jiang, Zuoli Tang, Qingyang Hong, Zhou Zhao |
| 2026 | ACL | Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios. | Changhao Pan, Rui Yang, Han Wang, Zhuan Zhou, Xuming He, Wenxiang Guo, Ziyue Jiang, Ruiqi Li, Yu Zhang, Chenyuhao Wen, Ke Lei, Xiang Yin, Jingyu Lu, Zhiyuan Zhu, Zhou Zhao |
| 2025 | AAAI | Speech Watermarking with Discrete Intermediate Representations. | Shengpeng Ji, Ziyue Jiang, Jialong Zuo, Minghui Fang, Yifu Chen, Tao Jin, Zhou Zhao |
| 2025 | ACL | Language-Codec: Bridging Discrete Codec Representations and Speech Language Models. | Shengpeng Ji, Minghui Fang, Jialong Zuo, Ziyue Jiang, Dingdong Wang, Hanting Wang, Hai Huang, Zhou Zhao |
| 2025 | ACL | ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control. | Shengpeng Ji, Qian Chen, Wen Wang, Jialong Zuo, Minghui Fang, Ziyue Jiang, Hai Huang, Zehan Wang, Xize Cheng, Siqi Zheng, Zhou Zhao |
| 2025 | ACL | TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis. | Yu Zhang, Wenxiang Guo, Changhao Pan, Dongyu Yao, Zhiyuan Zhu, Ziyue Jiang, Yuhan Wang, Tao Jin, Zhou Zhao |
| 2025 | ACL | Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching. | Jialong Zuo, Shengpeng Ji, Minghui Fang, Mingze Li, Ziyue Jiang, Xize Cheng, Xiaoda Yang, Feiyang Chen, Xinyu Duan, Zhou Zhao |
| 2025 | COLING | VoxpopuliTTS: a large-scale multilingual TTS corpus for zero-shot speech generation. | Wenrui Liu, Jionghao Bai, Xize Cheng, Jialong Zuo, Ziyue Jiang, Shengpeng Ji, Minghui Fang, Xiaoda Yang, Qian Yang, Zhou Zhao |
| 2025 | EMNLP | BrainLoc: Brain Signal-Based Object Detection with Multi-modal Alignment. | Jiaqi Duan, Xiaoda Yang, Kaixuan Luan, Hongshun Qiu, Weicai Yan, Xueyi Zhang, Youliang Zhang, Zhaoyang Li, Donglin Huang, Junyu Lu, Ziyue Jiang, Xifeng Yang |
| 2025 | EMNLP | Versatile Framework for Song Generation with Prompt-based Control. | Yu Zhang, Wenxiang Guo, Changhao Pan, Zhiyuan Zhu, Ruiqi Li, Jingyu Lu, Rongjie Huang, Ruiyuan Zhang, Zhiqing Hong, Ziyue Jiang, Zhou Zhao |
| 2025 | ICASSP | Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model. | Jialong Zuo, Shengpeng Ji, Minghui Fang, Ziyue Jiang, Xize Cheng, Qian Yang, Wenrui Liu, Guangyan Zhang, Zehai Tu, Yiwen Guo, Zhou Zhao |
| 2025 | ICLR | WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling. | Shengpeng Ji, Ziyue Jiang, Wen Wang, Yifu Chen, Minghui Fang, Jialong Zuo, Qian Yang, Xize Cheng, Zehan Wang, Ruiqi Li, Ziang Zhang, Xiaoda Yang, Rongjie Huang, Yidi Jiang, Qian Chen, Siqi Zheng, Zhou Zhao |
| 2025 | Interspeech | Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion. | Kaidi Wang, Wenhao Guan, Ziyue Jiang, Hukai Huang, Peijie Chen, Weijie Wu, Qingyang Hong, Lin Li |
| 2024 | ACL | Make-A-Voice: Revisiting Voice Large Language Models as Scalable Multilingual and Multitask Learners. | Rongjie Huang, Chunlei Zhang, Yongqi Wang, Dongchao Yang, Jinchuan Tian, Zhenhui Ye, Luping Liu, Zehan Wang, Ziyue Jiang, Xuankai Chang, Jiatong Shi, Chao Weng, Zhou Zhao, Dong Yu |
| 2024 | ACL | MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech. | Shengpeng Ji, Ziyue Jiang, Hanting Wang, Jialong Zuo, Zhou Zhao |
| 2024 | ACL | AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension. | Qian Yang, Jin Xu, Wenrui Liu, Yunfei Chu, Ziyue Jiang, Xiaohuan Zhou, Yichong Leng, Yuanjun Lv, Zhou Zhao, Chang Zhou, Jingren Zhou |
| 2024 | EMNLP | TCSinger: Zero-Shot Singing Voice Synthesis with Style Transfer and Multi-Level Style Control. | Yu Zhang, Ziyue Jiang, Ruiqi Li, Changhao Pan, Jinzheng He, Rongjie Huang, Chuxin Wang, Zhou Zhao |
| 2024 | ICASSP | TextrolSpeech: A Text Style Control Speech Corpus with Codec Language Text-to-Speech Models. | Shengpeng Ji, Jialong Zuo, Minghui Fang, Ziyue Jiang, Feiyang Chen, Xinyu Duan, Baoxing Huai, Zhou Zhao |
| 2024 | ICLR | Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis. | Ziyue Jiang, Jinglin Liu, Yi Ren, Jinzheng He, Zhenhui Ye, Shengpeng Ji, Qian Yang, Chen Zhang, Pengfei Wei, Chunfeng Wang, Xiang Yin, Zejun Ma, Zhou Zhao |
| 2024 | ICLR | Real3D-Portrait: One-shot Realistic 3D Talking Portrait Synthesis. | Zhenhui Ye, Tianyun Zhong, Yi Ren, Jiaqi Yang, Weichuang Li, Jiawei Huang, Ziyue Jiang, Jinzheng He, Rongjie Huang, Jinglin Liu, Chen Zhang, Xiang Yin, Zejun Ma, Zhou Zhao |
| 2024 | ICML | InstructSpeech: Following Speech Editing Instructions via Large Language Models. | Rongjie Huang, Ruofan Hu, Yongqi Wang, Zehan Wang, Xize Cheng, Ziyue Jiang, Zhenhui Ye, Dongchao Yang, Luping Liu, Peng Gao, Zhou Zhao |
| 2024 | Interspeech | FluentEditor: Text-based Speech Editing by Considering Acoustic and Prosody Consistency. | Rui Liu, Jiatian Xi, Ziyue Jiang, Haizhou Li |
| 2024 | Interspeech | MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis. | Qian Yang, Jialong Zuo, Zhe Su, Ziyue Jiang, Mingze Li, Zhou Zhao, Feiyang Chen, Zhefeng Wang, Baoxing Huai |
| 2024 | WWW | Zero-shot Explainable Mental Health Analysis on Social Media by Incorporating Mental Scales. | Wenyu Li, Yinuo Zhu, Xin Lin, Ming Li, Ziyue Jiang, Ziqian Zeng |
| 2023 | ACL | FastDiff 2: Revisiting and Incorporating GANs and Diffusion Models in High-Fidelity Speech Synthesis. | Rongjie Huang, Yi Ren, Ziyue Jiang, Chenye Cui, Jinglin Liu, Zhou Zhao |
| 2023 | ACL | FluentSpeech: Stutter-Oriented Automatic Speech Editing with Context-Aware Diffusion Models. | Ziyue Jiang, Qian Yang, Jialong Zuo, Zhenhui Ye, Rongjie Huang, Yi Ren, Zhou Zhao |
| 2023 | ACL | CLAPSpeech: Learning Prosody from Text Context with Contrastive Language-Audio Pre-Training. | Zhenhui Ye, Rongjie Huang, Yi Ren, Ziyue Jiang, Jinglin Liu, Jinzheng He, Xiang Yin, Zhou Zhao |
| 2023 | ICLR | GeneFace: Generalized and High-Fidelity Audio-Driven 3D Talking Face Synthesis. | Zhenhui Ye, Ziyue Jiang, Yi Ren, Jinglin Liu, Jinzheng He, Zhou Zhao |
| 2022 | SBAC-PAD | TCUDA: A QoS-based GPU Sharing Framework for Autonomous Navigation Systems. | Pangbo Sun, Hao Wu, Jiangming Jin, Ziyue Jiang, Yifan Gong |
| 2021 | IJCAI | FedSpeech: Federated Text-to-Speech with Continual Learning. | Ziyue Jiang, Yi Ren, Ming Lei, Zhou Zhao |
| 2020 | Interspeech | Self-Supervised Spoofing Audio Detection Scheme. | Ziyue Jiang, Hongcheng Zhu, Li Peng, Wenbing Ding, Yanzhen Ren |
| 2020 | SBAC-PAD | A Robotic Communication Middleware Combining High Performance and High Reliability. | Wei Liu, Hao Wu, Ziyue Jiang, Yifan Gong, Jiangming Jin |