| 2025 | ACL | LLaSE-G1: Incentivizing Generalization Capability for LLaMA-based Speech Enhancement. | Boyi Kang, Xinfa Zhu, Zihan Zhang, Zhen Ye, Mingshuai Liu, Ziqian Wang, Yike Zhu, Guobin Ma, Jun Chen, Longshuai Xiao, Chao Weng, Wei Xue, Lei Xie |
| 2025 | Interspeech | Robust Personal Voice Activity Detection for Mitigating Domain Mismatch and False Acceptance Scenarios. | Yuke Lin, Jun Chen, Wenjie Li, Longshuai Xiao, Chao Weng |
| 2025 | Interspeech | FlowSE: Efficient and High-Quality Speech Enhancement via Flow Matching. | Ziqian Wang, Zikai Liu, Xinfa Zhu, Yike Zhu, Mingshuai Liu, Jun Chen, Longshuai Xiao, Chao Weng, Lei Xie |
| 2024 | ACL | Make-A-Voice: Revisiting Voice Large Language Models as Scalable Multilingual and Multitask Learners. | Rongjie Huang, Chunlei Zhang, Yongqi Wang, Dongchao Yang, Jinchuan Tian, Zhenhui Ye, Luping Liu, Zehan Wang, Ziyue Jiang, Xuankai Chang, Jiatong Shi, Chao Weng, Zhou Zhao, Dong Yu |
| 2024 | CVPR | VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models. | Haoxin Chen, Yong Zhang, Xiaodong Cun, Menghan Xia, Xintao Wang, Chao Weng, Ying Shan |
| 2024 | ECCV | Storytelling Video Generation with Retrieval Augmentation and Character Consistency. | Yingqing He, Menghan Xia, Haoxin Chen, Xiaodong Cun, Yuan Gong, Jinbo Xing, Yong Zhang, Xintao Wang, Chao Weng, Ying Shan, Qifeng Chen |
| 2024 | ICASSP | Complexity Scaling for Speech Denoising. | Hangting Chen, Jianwei Yu, Chao Weng |
| 2024 | ICASSP | Sifisinger: A High-Fidelity End-to-End Singing Voice Synthesizer Based on Source-Filter Model. | Jianwei Cui, Yu Gu, Chao Weng, Jie Zhang, Liping Chen, Lirong Dai |
| 2024 | ICASSP | DurIAN-E 2: Duration Informed Attention Network with Adaptive Variational Autoencoder and Adversarial Learning for Expressive Text-to-Speech Synthesis. | Yu Gu, Qiushi Zhu, Guangzhi Lei, Chao Weng, Dan Su |
| 2024 | ICASSP | Opine: Leveraging a Optimization-Inspired Deep Unfolding Method for Multi-Channel Speech Enhancement. | Andong Li, Rilin Chen, Yu Gu, Chao Weng, Dan Su |
| 2024 | ICASSP | Consistent and Relevant: Rethink the Query Embedding in General Sound Separation. | Yuanyuan Wang, Hangting Chen, Dongchao Yang, Jianwei Yu, Chao Weng, Zhiyong Wu, Helen Meng |
| 2023 | ICASSP | TSpeech-AI System Description to the 5th Deep Noise Suppression (DNS) Challenge. | Jianwei Yu, Hangting Chen, Yi Luo, Rongzhi Gu, Weihua Li, Chao Weng |
| 2023 | ICLR | Bayes Risk CTC: Controllable CTC Alignment in Sequence-to-Sequence Tasks. | Jinchuan Tian, Brian Yan, Jianwei Yu, Chao Weng, Dong Yu, Shinji Watanabe |
| 2023 | Interspeech | Diverse and Expressive Speech Prosody Prediction with Denoising Diffusion Probabilistic Model. | Xiang Li, Songxiang Liu, Max W. Y. Lam, Zhiyong Wu, Chao Weng, Helen Meng |
| 2023 | Interspeech | Ultra Dual-Path Compression For Joint Echo Cancellation And Noise Suppression. | Hangting Chen, Jianwei Yu, Yi Luo, Rongzhi Gu, Weihua Li, Zhuocheng Lu, Chao Weng |
| 2023 | Interspeech | Bayes Risk Transducer: Transducer with Controllable Alignment Prediction. | Jinchuan Tian, Jianwei Yu, Hangting Chen, Brian Yan, Chao Weng, Dong Yu, Shinji Watanabe |
| 2023 | Interspeech | NoreSpeech: Knowledge Distillation based Conditional Diffusion Model for Noise-robust Expressive TTS. | Dongchao Yang, Songxiang Liu, Helin Wang, Jianwei Yu, Chao Weng, Yuexian Zou |
| 2023 | Interspeech | High Fidelity Speech Enhancement with Band-split RNN. | Jianwei Yu, Hangting Chen, Yi Luo, Rongzhi Gu, Chao Weng |
| 2022 | ICASSP | Enhancing Speaking Styles in Conversational Text-to-Speech Synthesis with Graph-Based Multi-Modal Context Modeling. | Jingbei Li, Yi Meng, Chenyi Li, Zhiyong Wu, Helen Meng, Chao Weng, Dan Su |
| 2022 | ICASSP | Simple Attention Module Based Speaker Verification with Iterative Noisy Label Detection. | Xiaoyi Qin, Na Li, Chao Weng, Dan Su, Ming Li |
| 2022 | ICASSP | Consistent Training and Decoding for End-to-End Speech Recognition Using Lattice-Free MMI. | Jinchuan Tian, Jianwei Yu, Chao Weng, Shi-Xiong Zhang, Dan Su, Dong Yu, Yuexian Zou |
| 2022 | ICASSP | Joint Modeling of Code-Switched and Monolingual ASR via Conditional Factorization. | Brian Yan, Chunlei Zhang, Meng Yu, Shi-Xiong Zhang, Siddharth Dalmia, Dan Berrebbi, Chao Weng, Shinji Watanabe, Dong Yu |
| 2022 | ICASSP | Towards end-to-end Speaker Diarization with Generalized Neural Speaker Clustering. | Chunlei Zhang, Jiatong Shi, Chao Weng, Meng Yu, Dong Yu |
| 2022 | ICASSP | The CUHK-Tencent Speaker Diarization System for the ICASSP 2022 Multi-Channel Multi-Party Meeting Transcription Challenge. | Naijun Zheng, Na Li, Xixin Wu, Lingwei Meng, Jiawen Kang, Haibin Wu, Chao Weng, Dan Su, Helen Meng |
| 2022 | ICASSP | Multi-Channel Speaker Diarization Using Spatial Features for Meetings. | Naijun Zheng, Na Li, Jianwei Yu, Chao Weng, Dan Su, Xunying Liu, Helen Meng |
| 2022 | Interspeech | Cross-Age Speaker Verification: Learning Age-Invariant Speaker Embeddings. | Xiaoyi Qin, Na Li, Chao Weng, Dan Su, Ming Li |
| 2022 | Interspeech | Improving Target Sound Extraction with Timestamp Information. | Helin Wang, Dongchao Yang, Chao Weng, Jianwei Yu, Yuexian Zou |
| 2021 | ICASSP | Replay and Synthetic Speech Detection with Res2Net Architecture. | Xu Li, Na Li, Chao Weng, Xunying Liu, Dan Su, Dong Yu, Helen Meng |
| 2021 | ICASSP | Improving RNN Transducer with Target Speaker Extraction and Neural Uncertainty Estimation. | Jiatong Shi, Chunlei Zhang, Chao Weng, Shinji Watanabe, Meng Yu, Dong Yu |
| 2021 | ICASSP | Non-Autoregressive Transformer ASR with CTC-Enhanced Decoder Input. | Xingchen Song, Zhiyong Wu, Yiheng Huang, Chao Weng, Dan Su, Helen M. Meng |
| 2021 | ICASSP | Directional ASR: A New Paradigm for E2E Multi-Speaker Speech Recognition with Source Localization. | Aswin Shanmugam Subramanian, Chao Weng, Shinji Watanabe, Meng Yu, Yong Xu, Shi-Xiong Zhang, Dong Yu |
| 2021 | ICASSP | Self-Supervised Text-Independent Speaker Verification Using Prototypical Momentum Contrastive Learning. | Wei Xia, Chunlei Zhang, Chao Weng, Meng Yu, Dong Yu |
| 2021 | ICASSP | Towards Robust Speaker Verification with Target Speaker Enhancement. | Chunlei Zhang, Meng Yu, Chao Weng, Dong Yu |
| 2021 | ICASSP | A Joint Training Framework of Multi-Look Separator and Speaker Embedding Extractor for Overlapped Speech. | Naijun Zheng, Na Li, Bo Wu, Meng Yu, Jianwei Yu, Chao Weng, Dan Su, Xunying Liu, Helen Meng |
| 2021 | Interspeech | GigaSpeech: An Evolving, Multi-Domain ASR Corpus with 10, 000 Hours of Transcribed Audio. | Guoguo Chen, Shuzhou Chai, Guan-Bo Wang, Jiayu Du, Wei-Qiang Zhang, Chao Weng, Dan Su, Daniel Povey, Jan Trmal, Junbo Zhang, Mingjie Jin, Sanjeev Khudanpur, Shinji Watanabe, Shuaijiang Zhao, Wei Zou, Xiangang Li, Xuchen Yao, Yongqing Wang, Zhao You, Zhiyong Yan |
| 2021 | Interspeech | Raw Waveform Encoder with Multi-Scale Globally Attentive Locally Recurrent Networks for End-to-End Speech Recognition. | Max W. Y. Lam, Jun Wang, Chao Weng, Dan Su, Dong Yu |
| 2021 | Interspeech | TeCANet: Temporal-Contextual Attention Network for Environment-Aware Speech Dereverberation. | Helin Wang, Bo Wu, Lianwu Chen, Meng Yu, Jianwei Yu, Yong Xu, Shi-Xiong Zhang, Chao Weng, Dan Su, Dong Yu |
| 2020 | ICASSP | Pitchnet: Unsupervised Singing Voice Conversion with Pitch Adversarial Network. | Chengqi Deng, Chengzhu Yu, Heng Lu, Chao Weng, Dong Yu |
| 2020 | ICASSP | Far-Field Location Guided Target Speech Extraction Using End-to-End Speech Recognition Objectives. | Aswin Shanmugam Subramanian, Chao Weng, Meng Yu, Shi-Xiong Zhang, Yong Xu, Shinji Watanabe, Dong Yu |
| 2020 | ICASSP | Dfsmn-San with Persistent Memory Model for Automatic Speech Recognition. | Zhao You, Dan Su, Jie Chen, Chao Weng, Dong Yu |
| 2020 | Interspeech | Minimum Bayes Risk Training of RNN-Transducer for End-to-End Speech Recognition. | Chao Weng, Chengzhu Yu, Jia Cui, Chunlei Zhang, Dong Yu |
| 2020 | Interspeech | Peking Opera Synthesis via Duration Informed Attention Network. | Yusong Wu, Shengchen Li, Chengzhu Yu, Heng Lu, Chao Weng, Liqiang Zhang, Dong Yu |
| 2020 | Interspeech | Neural Spatio-Temporal Beamformer for Target Speech Separation. | Yong Xu, Meng Yu, Shi-Xiong Zhang, Lianwu Chen, Chao Weng, Jianming Liu, Dong Yu |
| 2020 | Interspeech | DurIAN: Duration Informed Attention Network for Speech Synthesis. | Chengzhu Yu, Heng Lu, Na Hu, Meng Yu, Chao Weng, Kun Xu, Peng Liu, Deyi Tuo, Shiyin Kang, Guangzhi Lei, Dan Su, Dong Yu |
| 2020 | Interspeech | DurIAN-SC: Duration Informed Attention Network Based Singing Voice Conversion System. | Liqiang Zhang, Chengzhu Yu, Heng Lu, Chao Weng, Chunlei Zhang, Yusong Wu, Xiang Xie, Zijin Li, Dong Yu |
| 2019 | ICASSP | Parametric Cepstral Mean Normalization for Robust Speech Recognition. | Ozlem Kalinli, Gautam Bhattacharya, Chao Weng |
| 2019 | ICASSP | Component Fusion: Learning Replaceable Language Model Component for End-to-end Speech Recognition System. | Changhao Shan, Chao Weng, Guangsen Wang, Dan Su, Min Luo, Dong Yu, Lei Xie |
| 2019 | ICASSP | Investigating End-to-end Speech Recognition for Mandarin-english Code-switching. | Changhao Shan, Chao Weng, Guangsen Wang, Dan Su, Min Luo, Dong Yu, Lei Xie |
| 2019 | ICASSP | Token-wise Training for Attention Based End-to-end Speech Recognition. | Peidong Wang, Jia Cui, Chao Weng, Dong Yu |
| 2019 | ICASSP | A Comparison of Lattice-free Discriminative Training Criteria for Purely Sequence-trained Neural Network Acoustic Models. | Chao Weng, Dong Yu |
| 2019 | ICASSP | Joint Training of Complex Ratio Mask Based Beamformer and Acoustic Model for Noise Robust Asr. | Yong Xu, Chao Weng, Like Hui, Jianming Liu, Meng Yu, Dan Su, Dong Yu |
| 2019 | Interspeech | Large Margin Training for Attention Based End-to-End Speech Recognition. | Peidong Wang, Jia Cui, Chao Weng, Dong Yu |
| 2018 | Interspeech | Improving Attention Based Sequence-to-Sequence Models for End-to-End English Conversational Speech Recognition. | Chao Weng, Jia Cui, Guangsen Wang, Jun Wang, Chengzhu Yu, Dan Su, Dong Yu |
| 2018 | Interspeech | A Multistage Training Framework for Acoustic-to-Word Model. | Chengzhu Yu, Chunlei Zhang, Chao Weng, Jia Cui, Dong Yu |
| 2014 | ICASSP | Deep learning vector quantization for acoustic information retrieval. | Zhen Huang, Chao Weng, Kehuang Li, You-Chi Cheng, Chin-Hui Lee |
| 2014 | ICASSP | Single-channel mixed speech recognition using deep neural networks. | Chao Weng, Dong Yu, Michael L. Seltzer, Jasha Droppo |
| 2014 | ICASSP | Recurrent deep neural networks for robust speech recognition. | Chao Weng, Dong Yu, Shinji Watanabe, Biing-Hwang Fred Juang |
| 2014 | Interspeech | Feature space maximum a posteriori linear regression for adaptation of deep neural networks. | Zhen Huang, Jinyu Li, Sabato Marco Siniscalchi, I-Fan Chen, Chao Weng, Chin-Hui Lee |
| 2014 | Interspeech | Beyond cross-entropy: towards better frame-level objective functions for deep neural network training in automatic speech recognition. | Zhen Huang, Jinyu Li, Chao Weng, Chin-Hui Lee |
| 2013 | ICASSP | Adaptive boosted non-uniform mce for keyword spotting on spontaneous speech. | Chao Weng, Biing-Hwang Juang |
| 2013 | ICASSP | Latent semantic rational kernels for topic spotting on spontaneous conversational speech. | Chao Weng, Biing-Hwang Juang |
| 2012 | ICASSP | A comparative study of discriminative training using non-uniform criteria for cross-layer acoustic modeling. | Chao Weng, Biing-Hwang Juang |
| 2012 | Interspeech | Discriminative Training Using Non-uniform Criteria for Keyword Spotting on Spontaneous Speech. | Chao Weng, Biing-Hwang Juang, Daniel Povey |
| 2011 | ICASSP | Recent development of discriminative training using non-uniform criteria for cross-level acoustic modeling. | Chao Weng, Biing-Hwang Juang |