Rongjie Huang
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
43
Venues
10
Active years
2021–2026
Best venue rank
A*
Where they publish
Papers
43 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | ACL | Masked Text-to-Audio Flow-Matching and Reward Feedback Optimization. | Rongjie Huang, Dongchao Yang, Wenxiang Guo, Huadai Liu, Xize Cheng, Zehan Wang, Zhou Zhao, Xixin Wu, Helen M. Meng |
| 2025 | AAAI | TechSinger: Technique Controllable Multilingual Singing Voice Synthesis via Flow Matching. | Wenxiang Guo, Yu Zhang, Changhao Pan, Rongjie Huang, Li Tang, Ruiqi Li, Zhiqing Hong, Yongqi Wang, Zhou Zhao |
| 2025 | ACL | Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization on Multi-party Conversation. | Luyao Cheng, Hui Wang, Chong Deng, Siqi Zheng, Yafeng Chen, Rongjie Huang, Qinglin Zhang, Qian Chen, Xihao Li, Wen Wang |
| 2025 | ACL | FlashAudio: Rectified Flow for Fast and High-Fidelity Text-to-Audio Generation. | Huadai Liu, Jialei Wang, Rongjie Huang, Yang Liu, Heng Lu, Zhou Zhao, Wei Xue |
| 2025 | EMNLP | Versatile Framework for Song Generation with Prompt-based Control. | Yu Zhang, Wenxiang Guo, Changhao Pan, Zhiyuan Zhu, Ruiqi Li, Jingyu Lu, Rongjie Huang, Ruiyuan Zhang, Zhiqing Hong, Ziyue Jiang, Zhou Zhao |
| 2025 | ICASSP | 3D-Speaker-Toolkit: An Open-Source Toolkit for Multimodal Speaker Verification and Diarization. | Yafeng Chen, Siqi Zheng, Hui Wang, Luyao Cheng, Tinglong Zhu, Rongjie Huang, Chong Deng, Qian Chen, Shiliang Zhang, Wen Wang, Xihao Li |
| 2025 | ICASSP | NAT3DSound: 3D Spatial Sound Field Synthesis with Multi-Modal Non-Autoregressive Transformer. | Fuming You, Rongjie Huang, Boyang Zhang, Yongqi Wang, Zhiqing Hong, Zhimeng Zhang, Zhou Zhao |
| 2025 | ICLR | OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces. | Zehan Wang, Ziang Zhang, Minjie Hong, Hang Zhang, Luping Liu, Rongjie Huang, Xize Cheng, Shengpeng Ji, Tao Jin, Hengshuang Zhao, Zhou Zhao |
| 2025 | ICLR | VoxDialogue: Can Spoken Dialogue Systems Understand Information Beyond Words? | Xize Cheng, Ruofan Hu, Xiaoda Yang, Jingyu Lu, Dongjie Fu, Zehan Wang, Shengpeng Ji, Rongjie Huang, Boyang Zhang, Tao Jin, Zhou Zhao |
| 2025 | ICLR | OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup. | Xize Cheng, Siqi Zheng, Zehan Wang, Minghui Fang, Ziang Zhang, Rongjie Huang, Shengpeng Ji, Jialong Zuo, Tao Jin, Zhou Zhao |
| 2025 | ICLR | Lumina-T2X: Scalable Flow-based Large Diffusion Transformer for Flexible Resolution Generation. | Peng Gao, Le Zhuo, Dongyang Liu, Ruoyi Du, Xu Luo, Longtian Qiu, Yuhang Zhang, Rongjie Huang, Shijie Geng, Renrui Zhang, Junlin Xie, Wenqi Shao, Zhengkai Jiang, Tianshuo Yang, Weicai Ye, Tong He, Jingwen He, Junjun He, Yu Qiao, Hongsheng Li |
| 2025 | ICLR | WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling. | Shengpeng Ji, Ziyue Jiang, Wen Wang, Yifu Chen, Minghui Fang, Jialong Zuo, Qian Yang, Xize Cheng, Zehan Wang, Ruiqi Li, Ziang Zhang, Xiaoda Yang, Rongjie Huang, Yidi Jiang, Qian Chen, Siqi Zheng, Zhou Zhao |
| 2025 | ICML | OmniAudio: Generating Spatial Audio from 360-Degree Video. | Huadai Liu, Tianyi Luo, Kaicheng Luo, Qikai Jiang, Peiwen Sun, Jialei Wang, Rongjie Huang, Qian Chen, Wen Wang, Xiangtai Li, Shiliang Zhang, Zhijie Yan, Zhou Zhao, Wei Xue |
| 2024 | AAAI | AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head. | Rongjie Huang, Mingze Li, Dongchao Yang, Jiatong Shi, Xuankai Chang, Zhenhui Ye, Yuning Wu, Zhiqing Hong, Jiawei Huang, Jinglin Liu, Yi Ren, Yuexian Zou, Zhou Zhao, Shinji Watanabe |
| 2024 | AAAI | StyleSinger: Style Transfer for Out-of-Domain Singing Voice Synthesis. | Yu Zhang, Rongjie Huang, Ruiqi Li, Jinzheng He, Yan Xia, Feiyang Chen, Xinyu Duan, Baoxing Huai, Zhou Zhao |
| 2024 | ACL | TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation. | Xize Cheng, Rongjie Huang, Linjun Li, Zehan Wang, Tao Jin, Aoxiong Yin, Feiyang Chen, Xinyu Duan, Baoxing Huai, Zhou Zhao |
| 2024 | ACL | Text-to-Song: Towards Controllable Music Generation Incorporating Vocal and Accompaniment. | Zhiqing Hong, Rongjie Huang, Xize Cheng, Yongqi Wang, Ruiqi Li, Fuming You, Zhou Zhao, Zhimeng Zhang |
| 2024 | ACL | Make-A-Voice: Revisiting Voice Large Language Models as Scalable Multilingual and Multitask Learners. | Rongjie Huang, Chunlei Zhang, Yongqi Wang, Dongchao Yang, Jinchuan Tian, Zhenhui Ye, Luping Liu, Zehan Wang, Ziyue Jiang, Xuankai Chang, Jiatong Shi, Chao Weng, Zhou Zhao, Dong Yu |
| 2024 | ACL | Robust Singing Voice Transcription Serves Synthesis. | Ruiqi Li, Yu Zhang, Yongqi Wang, Zhiqing Hong, Rongjie Huang, Zhou Zhao |
| 2024 | ACL | Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion. | Ruiqi Li, Rongjie Huang, Yongqi Wang, Zhiqing Hong, Zhou Zhao |
| 2024 | ACL | Wav2SQL: Direct Generalizable Speech-To-SQL Parsing. | Huadai Liu, Rongjie Huang, Jinzheng He, Gang Sun, Ran Shen, Xize Cheng, Zhou Zhao |
| 2024 | ACL | Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer. | Yongqi Wang, Jionghao Bai, Rongjie Huang, Ruiqi Li, Zhiqing Hong, Zhou Zhao |
| 2024 | EMNLP | TCSinger: Zero-Shot Singing Voice Synthesis with Style Transfer and Multi-Level Style Control. | Yu Zhang, Ziyue Jiang, Ruiqi Li, Changhao Pan, Jinzheng He, Rongjie Huang, Chuxin Wang, Zhou Zhao |
| 2024 | ICLR | Real3D-Portrait: One-shot Realistic 3D Talking Portrait Synthesis. | Zhenhui Ye, Tianyun Zhong, Yi Ren, Jiaqi Yang, Weichuang Li, Jiawei Huang, Ziyue Jiang, Jinzheng He, Rongjie Huang, Jinglin Liu, Chen Zhang, Xiang Yin, Zejun Ma, Zhou Zhao |
| 2024 | ICML | FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion. | Zehan Wang, Ziang Zhang, Xize Cheng, Rongjie Huang, Luping Liu, Zhenhui Ye, Haifeng Huang, Yang Zhao, Tao Jin, Peng Gao, Zhou Zhao |
| 2024 | ICML | InstructSpeech: Following Speech Editing Instructions via Large Language Models. | Rongjie Huang, Ruofan Hu, Yongqi Wang, Zehan Wang, Xize Cheng, Ziyue Jiang, Zhenhui Ye, Dongchao Yang, Luping Liu, Peng Gao, Zhou Zhao |
| 2024 | ICML | UniAudio: Towards Universal Audio Generation with Large Language Models. | Dongchao Yang, Jinchuan Tian, Xu Tan, Rongjie Huang, Songxiang Liu, Haohan Guo, Xuankai Chang, Jiatong Shi, Sheng Zhao, Jiang Bian, Zhou Zhao, Xixin Wu, Helen M. Meng |
| 2024 | NAACL | Prompt-Singer: Controllable Singing-Voice-Synthesis with Natural Language Prompt. | Yongqi Wang, Ruofan Hu, Rongjie Huang, Zhiqing Hong, Ruiqi Li, Wenrui Liu, Fuming You, Tao Jin, Zhou Zhao |
| 2023 | ACL | RMSSinger: Realistic-Music-Score based Singing Voice Synthesis. | Jinzheng He, Jinglin Liu, Zhenhui Ye, Rongjie Huang, Chenye Cui, Huadai Liu, Zhou Zhao |
| 2023 | ACL | FastDiff 2: Revisiting and Incorporating GANs and Diffusion Models in High-Fidelity Speech Synthesis. | Rongjie Huang, Yi Ren, Ziyue Jiang, Chenye Cui, Jinglin Liu, Zhou Zhao |
| 2023 | ACL | AV-TranSpeech: Audio-Visual Robust Speech-to-Speech Translation. | Rongjie Huang, Huadai Liu, Xize Cheng, Yi Ren, Linjun Li, Zhenhui Ye, Jinzheng He, Lichao Zhang, Jinglin Liu, Xiang Yin, Zhou Zhao |
| 2023 | ACL | Prosody-TTS: Improving Prosody with Masked Autoencoder and Conditional Diffusion Model For Expressive Text-to-Speech. | Rongjie Huang, Chunlei Zhang, Yi Ren, Zhou Zhao, Dong Yu |
| 2023 | ACL | FluentSpeech: Stutter-Oriented Automatic Speech Editing with Context-Aware Diffusion Models. | Ziyue Jiang, Qian Yang, Jialong Zuo, Zhenhui Ye, Rongjie Huang, Yi Ren, Zhou Zhao |
| 2023 | ACL | AlignSTS: Speech-to-Singing Conversion via Cross-Modal Alignment. | Ruiqi Li, Rongjie Huang, Lichao Zhang, Jinglin Liu, Zhou Zhao |
| 2023 | ACL | Contrastive Token-Wise Meta-Learning for Unseen Performer Visual Temporal-Aligned Translation. | Linjun Li, Tao Jin, Xize Cheng, Ye Wang, Wang Lin, Rongjie Huang, Zhou Zhao |
| 2023 | ACL | CLAPSpeech: Learning Prosody from Text Context with Contrastive Language-Audio Pre-Training. | Zhenhui Ye, Rongjie Huang, Yi Ren, Ziyue Jiang, Jinglin Liu, Jinzheng He, Xiang Yin, Zhou Zhao |
| 2023 | EMNLP | ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer. | Huadai Liu, Rongjie Huang, Xuan Lin, Wenqiang Xu, Maozong Zheng, Hong Chen, Jinzheng He, Zhou Zhao |
| 2023 | ICASSP | VarietySound: Timbre-Controllable Video to Sound Generation Via Unsupervised Information Disentanglement. | Chenye Cui, Zhou Zhao, Yi Ren, Jinglin Liu, Rongjie Huang, Feiyang Chen, Zhefeng Wang, Baoxing Huai, Fei Wu |
| 2023 | ICCV | MixSpeech: Cross-Modality Self-Learning with Audio-Visual Stream Mixup for Visual Speech Translation and Recognition. | Xize Cheng, Tao Jin, Rongjie Huang, Linjun Li, Wang Lin, Zehan Wang, Ye Wang, Huadai Liu, Aoxiong Yin, Zhou Zhao |
| 2023 | ICLR | TranSpeech: Speech-to-Speech Translation With Bilateral Perturbation. | Rongjie Huang, Jinglin Liu, Huadai Liu, Yi Ren, Lichao Zhang, Jinzheng He, Zhou Zhao |
| 2023 | ICML | Make-An-Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion Models. | Rongjie Huang, Jiawei Huang, Dongchao Yang, Yi Ren, Luping Liu, Mingze Li, Zhenhui Ye, Jinglin Liu, Xiang Yin, Zhou Zhao |
| 2022 | IJCAI | FastDiff: A Fast Conditional Diffusion Model for High-Quality Speech Synthesis. | Rongjie Huang, Max W. Y. Lam, Jun Wang, Dan Su, Dong Yu, Yi Ren, Zhou Zhao |
| 2021 | Interspeech | EMOVIE: A Mandarin Emotion Speech Dataset with a Simple Emotional Text-to-Speech Model. | Chenye Cui, Yi Ren, Jinglin Liu, Feiyang Chen, Rongjie Huang, Ming Lei, Zhou Zhao |