Skip to content

Dongchao Yang

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

33

Venues

7

Active years

2021–2026

Best venue rank

A*

Where they publish

Papers

33 indexed papers, newest first.

YearVenueTitleAuthors
2026AAAIDualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models.Yuanyuan Wang, Dongchao Yang, Yiwen Shao, Hangting Chen, Jiankun Zhao, Zhiyong Wu, Helen Meng, Xixin Wu
2026ACLMasked Text-to-Audio Flow-Matching and Reward Feedback Optimization.Rongjie Huang, Dongchao Yang, Wenxiang Guo, Huadai Liu, Xize Cheng, Zehan Wang, Zhou Zhao, Xixin Wu, Helen M. Meng
2026ACLUniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment.Yuanyuan Wang, Dongchao Yang, Yayue Deng, Zhiyong Wu, Steven Y. Guo, Helen M. Meng, Xixin Wu
2025ACLInSerter: Speech Instruction Following with Unsupervised Interleaved Pre-training.Dingdong Wang, Jin Xu, Ruihang Chu, Zhifang Guo, Xiong Wang, Jincenzi Wu, Dongchao Yang, Shengpeng Ji, Junyang Lin
2025ACLATRI: Mitigating Multilingual Audio Text Retrieval Inconsistencies by Reducing Data Distribution Errors.Yuguo Yin, Yuxin Xie, Wenyuan Yang, Dongchao Yang, Jinghan Ru, Xianwei Zhuang, Liming Liang, Yuexian Zou
2025EMNLPSpeech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs.Dingdong Wang, Junan Li, Mingyu Cui, Dongchao Yang, Xueyuan Chen, Helen M. Meng
2025ICASSPSpeaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation.Haohan Guo, Fenglong Xie, Dongchao Yang, Xixin Wu, Helen Meng
2025ICASSPAudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions.Yuanyuan Wang, Hangting Chen, Dongchao Yang, Zhiyong Wu, Xixin Wu
2025ICMLALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling.Dongchao Yang, Songxiang Liu, Haohan Guo, Jiankun Zhao, Yuanyuan Wang, Helin Wang, Zeqian Ju, Xubo Liu, Xueyuan Chen, Xu Tan, Xixin Wu, Helen M. Meng
2025InterspeechDiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model.Xueyuan Chen, Dongchao Yang, Wenxuan Wu, Minglin Wu, Jing Xu, Xixin Wu, Zhiyong Wu, Helen Meng
2025InterspeechSpeechSEC: A Unified Multi-Task Framework for Speech Synthesis, Editing, and Continuation.Liming Liang, Dongchao Yang, Xianwei Zhuang, Yuxin Xie, Luo Chen, Yuehan Jin, Yuexian Zou
2024AAAIAudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head.Rongjie Huang, Mingze Li, Dongchao Yang, Jiatong Shi, Xuankai Chang, Zhenhui Ye, Yuning Wu, Zhiqing Hong, Jiawei Huang, Jinglin Liu, Yi Ren, Yuexian Zou, Zhou Zhao, Shinji Watanabe
2024ACLMake-A-Voice: Revisiting Voice Large Language Models as Scalable Multilingual and Multitask Learners.Rongjie Huang, Chunlei Zhang, Yongqi Wang, Dongchao Yang, Jinchuan Tian, Zhenhui Ye, Luping Liu, Zehan Wang, Ziyue Jiang, Xuankai Chang, Jiatong Shi, Chao Weng, Zhou Zhao, Dong Yu
2024ICASSPDPM-TSE: A Diffusion Probabilistic Model for Target Sound Extraction.Jiarui Hai, Helin Wang, Dongchao Yang, Karan Thakkar, Najim Dehak, Mounya Elhilali
2024ICASSPConsistent and Relevant: Rethink the Query Embedding in General Sound Separation.Yuanyuan Wang, Hangting Chen, Dongchao Yang, Jianwei Yu, Chao Weng, Zhiyong Wu, Helen Meng
2024ICLRPromptTTS 2: Describing and Generating Voices with Text Prompt.Yichong Leng, Zhifang Guo, Kai Shen, Zeqian Ju, Xu Tan, Eric Liu, Yufei Liu, Dongchao Yang, Leying Zhang, Kaitao Song, Lei He, Xiangyang Li, Sheng Zhao, Tao Qin, Jiang Bian
2024ICMLInstructSpeech: Following Speech Editing Instructions via Large Language Models.Rongjie Huang, Ruofan Hu, Yongqi Wang, Zehan Wang, Xize Cheng, Ziyue Jiang, Zhenhui Ye, Dongchao Yang, Luping Liu, Peng Gao, Zhou Zhao
2024ICMLNaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models.Zeqian Ju, Yuancheng Wang, Kai Shen, Xu Tan, Detai Xin, Dongchao Yang, Eric Liu, Yichong Leng, Kaitao Song, Siliang Tang, Zhizheng Wu, Tao Qin, Xiangyang Li, Wei Ye, Shikun Zhang, Jiang Bian, Lei He, Jinyu Li, Sheng Zhao
2024ICMLUniAudio: Towards Universal Audio Generation with Large Language Models.Dongchao Yang, Jinchuan Tian, Xu Tan, Rongjie Huang, Songxiang Liu, Haohan Guo, Xuankai Chang, Jiatong Shi, Sheng Zhao, Jiang Bian, Zhou Zhao, Xixin Wu, Helen M. Meng
2024InterspeechCoLM-DSR: Leveraging Neural Codec Language Modeling for Multi-Modal Dysarthric Speech Reconstruction.Xueyuan Chen, Dongchao Yang, Dingdong Wang, Xixin Wu, Zhiyong Wu, Helen Meng
2024InterspeechSimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models.Dongchao Yang, Dingdong Wang, Haohan Guo, Xueyuan Chen, Xixin Wu, Helen Meng
2023ICASSPImproving Weakly Supervised Sound Event Detection with Causal Intervention.Yifei Xin, Dongchao Yang, Fan Cui, Yujun Wang, Yuexian Zou
2023ICASSPImproving Text-Audio Retrieval by Text-Aware Attention Pooling and Prior Matrix Revised Loss.Yifei Xin, Dongchao Yang, Yuexian Zou
2023ICMLMake-An-Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion Models.Rongjie Huang, Jiawei Huang, Dongchao Yang, Yi Ren, Luping Liu, Mingze Li, Zhenhui Ye, Jinglin Liu, Xiang Yin, Zhou Zhao
2023InterspeechBackground-aware Modeling for Weakly Supervised Sound Event Detection.Yifei Xin, Dongchao Yang, Yuexian Zou
2023InterspeechNoreSpeech: Knowledge Distillation based Conditional Diffusion Model for Noise-robust Expressive TTS.Dongchao Yang, Songxiang Liu, Helin Wang, Jianwei Yu, Chao Weng, Yuexian Zou
2022ICASSPA Mutual Learning Framework for Few-Shot Sound Event Detection.Dongchao Yang, Helin Wang, Yuexian Zou, Zhongjie Ye, Wenwu Wang
2022InterspeechImproving Target Sound Extraction with Timestamp Information.Helin Wang, Dongchao Yang, Chao Weng, Jianwei Yu, Yuexian Zou
2022InterspeechAudio Pyramid Transformer with Domain Adaption for Weakly Supervised Sound Event Detection and Audio Classification.Yifei Xin, Dongchao Yang, Yuexian Zou
2022InterspeechRaDur: A Reference-aware and Duration-robust Network for Target Sound Detection.Dongchao Yang, Helin Wang, Zhongjie Ye, Yuexian Zou, Wenwu Wang
2022InterspeechSpeaker-Aware Mixture of Mixtures Training for Weakly Supervised Speaker Extraction.Zifeng Zhao, Rongzhi Gu, Dongchao Yang, Jinchuan Tian, Yuexian Zou
2022InterspeechTarget Confusion in End-to-end Speaker Extraction: Analysis and Approaches.Zifeng Zhao, Dongchao Yang, Rongzhi Gu, Haoran Zhang, Yuexian Zou
2021InterspeechUnsupervised Multi-Target Domain Adaptation for Acoustic Scene Classification.Dongchao Yang, Helin Wang, Yuexian Zou