Dongchao Yang
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
33
Venues
7
Active years
2021–2026
Best venue rank
A*
Where they publish
Papers
33 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | AAAI | DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models. | Yuanyuan Wang, Dongchao Yang, Yiwen Shao, Hangting Chen, Jiankun Zhao, Zhiyong Wu, Helen Meng, Xixin Wu |
| 2026 | ACL | Masked Text-to-Audio Flow-Matching and Reward Feedback Optimization. | Rongjie Huang, Dongchao Yang, Wenxiang Guo, Huadai Liu, Xize Cheng, Zehan Wang, Zhou Zhao, Xixin Wu, Helen M. Meng |
| 2026 | ACL | UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment. | Yuanyuan Wang, Dongchao Yang, Yayue Deng, Zhiyong Wu, Steven Y. Guo, Helen M. Meng, Xixin Wu |
| 2025 | ACL | InSerter: Speech Instruction Following with Unsupervised Interleaved Pre-training. | Dingdong Wang, Jin Xu, Ruihang Chu, Zhifang Guo, Xiong Wang, Jincenzi Wu, Dongchao Yang, Shengpeng Ji, Junyang Lin |
| 2025 | ACL | ATRI: Mitigating Multilingual Audio Text Retrieval Inconsistencies by Reducing Data Distribution Errors. | Yuguo Yin, Yuxin Xie, Wenyuan Yang, Dongchao Yang, Jinghan Ru, Xianwei Zhuang, Liming Liang, Yuexian Zou |
| 2025 | EMNLP | Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs. | Dingdong Wang, Junan Li, Mingyu Cui, Dongchao Yang, Xueyuan Chen, Helen M. Meng |
| 2025 | ICASSP | Speaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation. | Haohan Guo, Fenglong Xie, Dongchao Yang, Xixin Wu, Helen Meng |
| 2025 | ICASSP | AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions. | Yuanyuan Wang, Hangting Chen, Dongchao Yang, Zhiyong Wu, Xixin Wu |
| 2025 | ICML | ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling. | Dongchao Yang, Songxiang Liu, Haohan Guo, Jiankun Zhao, Yuanyuan Wang, Helin Wang, Zeqian Ju, Xubo Liu, Xueyuan Chen, Xu Tan, Xixin Wu, Helen M. Meng |
| 2025 | Interspeech | DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model. | Xueyuan Chen, Dongchao Yang, Wenxuan Wu, Minglin Wu, Jing Xu, Xixin Wu, Zhiyong Wu, Helen Meng |
| 2025 | Interspeech | SpeechSEC: A Unified Multi-Task Framework for Speech Synthesis, Editing, and Continuation. | Liming Liang, Dongchao Yang, Xianwei Zhuang, Yuxin Xie, Luo Chen, Yuehan Jin, Yuexian Zou |
| 2024 | AAAI | AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head. | Rongjie Huang, Mingze Li, Dongchao Yang, Jiatong Shi, Xuankai Chang, Zhenhui Ye, Yuning Wu, Zhiqing Hong, Jiawei Huang, Jinglin Liu, Yi Ren, Yuexian Zou, Zhou Zhao, Shinji Watanabe |
| 2024 | ACL | Make-A-Voice: Revisiting Voice Large Language Models as Scalable Multilingual and Multitask Learners. | Rongjie Huang, Chunlei Zhang, Yongqi Wang, Dongchao Yang, Jinchuan Tian, Zhenhui Ye, Luping Liu, Zehan Wang, Ziyue Jiang, Xuankai Chang, Jiatong Shi, Chao Weng, Zhou Zhao, Dong Yu |
| 2024 | ICASSP | DPM-TSE: A Diffusion Probabilistic Model for Target Sound Extraction. | Jiarui Hai, Helin Wang, Dongchao Yang, Karan Thakkar, Najim Dehak, Mounya Elhilali |
| 2024 | ICASSP | Consistent and Relevant: Rethink the Query Embedding in General Sound Separation. | Yuanyuan Wang, Hangting Chen, Dongchao Yang, Jianwei Yu, Chao Weng, Zhiyong Wu, Helen Meng |
| 2024 | ICLR | PromptTTS 2: Describing and Generating Voices with Text Prompt. | Yichong Leng, Zhifang Guo, Kai Shen, Zeqian Ju, Xu Tan, Eric Liu, Yufei Liu, Dongchao Yang, Leying Zhang, Kaitao Song, Lei He, Xiangyang Li, Sheng Zhao, Tao Qin, Jiang Bian |
| 2024 | ICML | InstructSpeech: Following Speech Editing Instructions via Large Language Models. | Rongjie Huang, Ruofan Hu, Yongqi Wang, Zehan Wang, Xize Cheng, Ziyue Jiang, Zhenhui Ye, Dongchao Yang, Luping Liu, Peng Gao, Zhou Zhao |
| 2024 | ICML | NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models. | Zeqian Ju, Yuancheng Wang, Kai Shen, Xu Tan, Detai Xin, Dongchao Yang, Eric Liu, Yichong Leng, Kaitao Song, Siliang Tang, Zhizheng Wu, Tao Qin, Xiangyang Li, Wei Ye, Shikun Zhang, Jiang Bian, Lei He, Jinyu Li, Sheng Zhao |
| 2024 | ICML | UniAudio: Towards Universal Audio Generation with Large Language Models. | Dongchao Yang, Jinchuan Tian, Xu Tan, Rongjie Huang, Songxiang Liu, Haohan Guo, Xuankai Chang, Jiatong Shi, Sheng Zhao, Jiang Bian, Zhou Zhao, Xixin Wu, Helen M. Meng |
| 2024 | Interspeech | CoLM-DSR: Leveraging Neural Codec Language Modeling for Multi-Modal Dysarthric Speech Reconstruction. | Xueyuan Chen, Dongchao Yang, Dingdong Wang, Xixin Wu, Zhiyong Wu, Helen Meng |
| 2024 | Interspeech | SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models. | Dongchao Yang, Dingdong Wang, Haohan Guo, Xueyuan Chen, Xixin Wu, Helen Meng |
| 2023 | ICASSP | Improving Weakly Supervised Sound Event Detection with Causal Intervention. | Yifei Xin, Dongchao Yang, Fan Cui, Yujun Wang, Yuexian Zou |
| 2023 | ICASSP | Improving Text-Audio Retrieval by Text-Aware Attention Pooling and Prior Matrix Revised Loss. | Yifei Xin, Dongchao Yang, Yuexian Zou |
| 2023 | ICML | Make-An-Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion Models. | Rongjie Huang, Jiawei Huang, Dongchao Yang, Yi Ren, Luping Liu, Mingze Li, Zhenhui Ye, Jinglin Liu, Xiang Yin, Zhou Zhao |
| 2023 | Interspeech | Background-aware Modeling for Weakly Supervised Sound Event Detection. | Yifei Xin, Dongchao Yang, Yuexian Zou |
| 2023 | Interspeech | NoreSpeech: Knowledge Distillation based Conditional Diffusion Model for Noise-robust Expressive TTS. | Dongchao Yang, Songxiang Liu, Helin Wang, Jianwei Yu, Chao Weng, Yuexian Zou |
| 2022 | ICASSP | A Mutual Learning Framework for Few-Shot Sound Event Detection. | Dongchao Yang, Helin Wang, Yuexian Zou, Zhongjie Ye, Wenwu Wang |
| 2022 | Interspeech | Improving Target Sound Extraction with Timestamp Information. | Helin Wang, Dongchao Yang, Chao Weng, Jianwei Yu, Yuexian Zou |
| 2022 | Interspeech | Audio Pyramid Transformer with Domain Adaption for Weakly Supervised Sound Event Detection and Audio Classification. | Yifei Xin, Dongchao Yang, Yuexian Zou |
| 2022 | Interspeech | RaDur: A Reference-aware and Duration-robust Network for Target Sound Detection. | Dongchao Yang, Helin Wang, Zhongjie Ye, Yuexian Zou, Wenwu Wang |
| 2022 | Interspeech | Speaker-Aware Mixture of Mixtures Training for Weakly Supervised Speaker Extraction. | Zifeng Zhao, Rongzhi Gu, Dongchao Yang, Jinchuan Tian, Yuexian Zou |
| 2022 | Interspeech | Target Confusion in End-to-end Speaker Extraction: Analysis and Approaches. | Zifeng Zhao, Dongchao Yang, Rongzhi Gu, Haoran Zhang, Yuexian Zou |
| 2021 | Interspeech | Unsupervised Multi-Target Domain Adaptation for Acoustic Scene Classification. | Dongchao Yang, Helin Wang, Yuexian Zou |