Skip to content

Wangyou Zhang

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

42

Venues

5

Active years

2019–2025

Best venue rank

A*

Where they publish

Papers

42 indexed papers, newest first.

YearVenueTitleAuthors
2025ASRULess is More: Data Curation Matters in Scaling Speech Enhancement.Chenda Li, Wangyou Zhang, Wei Wang, Robin Scheibler, Kohei Saijo, Samuele Cornell, Yihui Fu, Marvin Sach, Zhaoheng Ni, Anurag Kumar, Tim Fingscheidt, Shinji Watanabe, Yanmin Qian
2025ASRUVERSA-v2: A Modular and Scalable Toolkit for Speech and Audio Evaluation with Expanded Metrics, Visualization, and LLM Integration.Jiatong Shi, Bo-Hao Su, Shikhar Bharadwaj, Yiwen Zhao, Shih-Heng Wang, Jionghao Hang, Haoran Wang, Wei Wang, Wenhao Feng, Yuxun Tang, Nezih Topaloglu, Siddhant Arora, Jinchuan Tian, William Chen, Hye-jin Shim, Wangyou Zhang, Wen-Chin Huang, Shinji Watanabe
2025ASRUPURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning.Jiatong Shi, Haoran Wang, William Chen, Chenda Li, Wangyou Zhang, Jinchuan Tian, Shinji Watanabe
2025ASRUURGENT-PK: Perceptually-Aligned Ranking Model Designed for Speech Enhancement Competition.Jiahe Wang, Chenda Li, Wei Wang, Wangyou Zhang, Samuele Cornell, Marvin Sach, Robin Scheibler, Kohei Saijo, Yihui Fu, Zhaoheng Ni, Anurag Kumar, Tim Fingscheidt, Shinji Watanabe, Yanmin Qian
2025ASRUImproving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment.Wei Wang, Wangyou Zhang, Chenda Li, Jaitong Shi, Shinji Watanabe, Yanmin Qian
2025ICASSPAdvanced Zero-Shot Text-to-Speech for Background Removal and Preservation with Controllable Masked Speech Prediction.Leying Zhang, Wangyou Zhang, Zhengyang Chen, Yanmin Qian
2025InterspeechBR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual Biasing ASR in Speech LLM.Xun Gong, Anqi Lv, Wangyou Zhang, Zhiming Wang, Huijia Zhu, Yanmin Qian
2025InterspeechRanking and Selection of Bias Words for Contextual Bias Speech Recognition.Haoxiang Hou, Xun Gong, Wangyou Zhang, Wei Wang, Yanmin Qian
2025InterspeechThe Text-to-speech in the Wild (TITW) Database.Jee-weon Jung, Wangyou Zhang, Soumi Maiti, Yihan Wu, Xin Wang, Ji-Hoon Kim, Yuta Matsunaga, Seyun Um, Jinchuan Tian, Hye-jin Shim, Nicholas W. D. Evans, Joon Son Chung, Shinnosuke Takamichi, Shinji Watanabe
2025InterspeechInterspeech 2025 URGENT Speech Enhancement Challenge.Kohei Saijo, Wangyou Zhang, Samuele Cornell, Robin Scheibler, Chenda Li, Zhaoheng Ni, Anurag Kumar, Marvin Sach, Yihui Fu, Wei Wang, Tim Fingscheidt, Shinji Watanabe
2025InterspeechLessons Learned from the URGENT 2024 Speech Enhancement Challenge.Wangyou Zhang, Kohei Saijo, Samuele Cornell, Robin Scheibler, Chenda Li, Zhaoheng Ni, Anurag Kumar, Marvin Sach, Wei Wang, Yihui Fu, Shinji Watanabe, Tim Fingscheidt, Yanmin Qian
2025NAACLVERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music.Jiatong Shi, Hye-jin Shim, Jinchuan Tian, Siddhant Arora, Haibin Wu, Darius Petermann, Jia Qi Yip, You Zhang, Yuxun Tang, Wangyou Zhang, Dareen Alharthi, Yichen Huang, Koichi Saito, Jionghao Han, Yiwen Zhao, Chris Donahue, Shinji Watanabe
2024EMNLPTowards Robust Speech Representation Learning for Thousands of Languages.William Chen, Wangyou Zhang, Yifan Peng, Xinjian Li, Jinchuan Tian, Jiatong Shi, Xuankai Chang, Soumi Maiti, Karen Livescu, Shinji Watanabe
2024ICASSPGeneration-Based Target Speech Extraction with Speech Discretization and Vocoder.Linfeng Yu, Wangyou Zhang, Chenpeng Du, Leying Zhang, Zheng Liang, Yanmin Qian
2024ICASSPImproving Design of Input Condition Invariant Speech Enhancement.Wangyou Zhang, Jee-weon Jung, Yanmin Qian
2024InterspeechESPnet-SPK: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models.Jee-weon Jung, Wangyou Zhang, Jiatong Shi, Zakaria Aldeneh, Takuya Higuchi, Alex Gichamba, Barry-John Theobald, Ahmed Hussen Abdelaziz, Shinji Watanabe
2024InterspeechBeyond Performance Plateaus: A Comprehensive Study on Scalability in Speech Enhancement.Wangyou Zhang, Kohei Saijo, Jee-weon Jung, Chenda Li, Shinji Watanabe, Yanmin Qian
2024InterspeechURGENT Challenge: Universality, Robustness, and Generalizability For Speech Enhancement.Wangyou Zhang, Robin Scheibler, Kohei Saijo, Samuele Cornell, Chenda Li, Zhaoheng Ni, Jan Pirklbauer, Marvin Sach, Shinji Watanabe, Tim Fingscheidt, Yanmin Qian
2023ASRUJoint Prediction and Denoising for Large-Scale Multilingual Self-Supervised Learning.William Chen, Jiatong Shi, Brian Yan, Dan Berrebbi, Wangyou Zhang, Yifan Peng, Xuankai Chang, Soumi Maiti, Shinji Watanabe
2023ASRUReproducing Whisper-Style Training Using An Open-Source Toolkit And Publicly Available Data.Yifan Peng, Jinchuan Tian, Brian Yan, Dan Berrebbi, Xuankai Chang, Xinjian Li, Jiatong Shi, Siddhant Arora, William Chen, Roshan S. Sharma, Wangyou Zhang, Yui Sudo, Muhammad Shakeel, Jee-Weon Jung, Soumi Maiti, Shinji Watanabe
2023ASRUA Single Speech Enhancement Model Unifying Dereverberation, Denoising, Speaker Counting, Separation, And Extraction.Kohei Saijo, Wangyou Zhang, Zhong-Qiu Wang, Shinji Watanabe, Tetsunori Kobayashi, Tetsuji Ogawa
2023ASRUToward Universal Speech Enhancement For Diverse Input Conditions.Wangyou Zhang, Kohei Saijo, Zhong-Qiu Wang, Shinji Watanabe, Yanmin Qian
2023ASRUExploring Time-Frequency Domain Target Speaker Extraction For Causal and Non-Causal Processing.Wangyou Zhang, Lei Yang, Yanmin Qian
2023InterspeechOverlap Aware Continuous Speech Separation without Permutation Invariant Training.Linfeng Yu, Wangyou Zhang, Chenda Li, Yanmin Qian
2023InterspeechWeakly-Supervised Speech Pre-training: A Case Study on Target Speech Recognition.Wangyou Zhang, Yanmin Qian
2022ICASSPTowards Low-Distortion Multi-Channel Speech Enhancement: The ESPNET-Se Submission to the L3DAS22 Challenge.Yen-Ju Lu, Samuele Cornell, Xuankai Chang, Wangyou Zhang, Chenda Li, Zhaoheng Ni, Zhong-Qiu Wang, Shinji Watanabe
2022ICASSPThe Sjtu System For Multimodal Information Based Speech Processing Challenge 2021.Wei Wang, Xun Gong, Yifei Wu, Zhikai Zhou, Chenda Li, Wangyou Zhang, Bing Han, Yanmin Qian
2022ICASSPText Adaptive Detection for Customizable Keyword Spotting.Yu Xi, Tian Tan, Wangyou Zhang, Baochen Yang, Kai Yu
2022ICASSPExploring Effective Data Utilization for Low-Resource Speech Recognition.Zhikai Zhou, Wei Wang, Wangyou Zhang, Yanmin Qian
2022InterspeechESPnet-SE++: Speech Enhancement for Robust Speech Recognition, Translation, and Understanding.Yen-Ju Lu, Xuankai Chang, Chenda Li, Wangyou Zhang, Samuele Cornell, Zhaoheng Ni, Yoshiki Masuyama, Brian Yan, Robin Scheibler, Zhong-Qiu Wang, Yu Tsao, Yanmin Qian, Shinji Watanabe
2022InterspeechSeparating Long-Form Speech with Group-wise Permutation Invariant Training.Wangyou Zhang, Zhuo Chen, Naoyuki Kanda, Shujie Liu, Jinyu Li, Sefik Emre Eskimez, Takuya Yoshioka, Xiong Xiao, Zhong Meng, Yanmin Qian, Furu Wei
2021ICASSPConvolutive Transfer Function Invariant SDR Training Criteria for Multi-Channel Reverberant Speech Separation.Christoph Bddeker, Wangyou Zhang, Tomohiro Nakatani, Keisuke Kinoshita, Tsubasa Ochiai, Marc Delcroix, Naoyuki Kamo, Yanmin Qian, Reinhold Haeb-Umbach
2021ICASSPRecent Developments on Espnet Toolkit Boosted By Conformer.Pengcheng Guo, Florian Boyer, Xuankai Chang, Tomoki Hayashi, Yosuke Higuchi, Hirofumi Inaguma, Naoyuki Kamo, Chenda Li, Daniel Garcia-Romero, Jiatong Shi, Jing Shi, Shinji Watanabe, Kun Wei, Wangyou Zhang, Yuekai Zhang
2021ICASSPEnd-to-End Dereverberation, Beamforming, and Speech Recognition with Improved Numerical Stability and Advanced Frontend.Wangyou Zhang, Christoph Bddeker, Shinji Watanabe, Tomohiro Nakatani, Marc Delcroix, Keisuke Kinoshita, Tsubasa Ochiai, Naoyuki Kamo, Reinhold Haeb-Umbach, Yanmin Qian
2020ICASSPEnd-To-End Multi-Speaker Speech Recognition With Transformer.Xuankai Chang, Wangyou Zhang, Yanmin Qian, Jonathan Le Roux, Shinji Watanabe
2020InterspeechLearning Contextual Language Embeddings for Monaural Multi-Talker Speech Recognition.Wangyou Zhang, Yanmin Qian
2020InterspeechEnd-to-End Far-Field Speech Recognition with Unified Dereverberation and Beamforming.Wangyou Zhang, Aswin Shanmugam Subramanian, Xuankai Chang, Shinji Watanabe, Yanmin Qian
2019ASRUMIMO-Speech: End-to-End Multi-Channel Multi-Speaker Speech Recognition.Xuankai Chang, Wangyou Zhang, Yanmin Qian, Jonathan Le Roux, Shinji Watanabe
2019ASRUA Comparative Study on Transformer vs RNN in Speech Applications.Shigeki Karita, Xiaofei Wang, Shinji Watanabe, Takenori Yoshimura, Wangyou Zhang, Nanxin Chen, Tomoki Hayashi, Takaaki Hori, Hirofumi Inaguma, Ziyan Jiang, Masao Someki, Nelson Enrique Yalta Soplin, Ryuichi Yamamoto
2019ASRUEnd-to-End Overlapped Speech Detection and Speaker Counting with Raw Waveform.Wangyou Zhang, Man Sun, Lan Wang, Yanmin Qian
2019InterspeechKnowledge Distillation for End-to-End Monaural Multi-Talker ASR System.Wangyou Zhang, Xuankai Chang, Yanmin Qian
2019InterspeechRobust DOA Estimation Based on Convolutional Neural Network and Time-Frequency Masking.Wangyou Zhang, Ying Zhou, Yanmin Qian