Wangyou Zhang
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
42
Venues
5
Active years
2019–2025
Best venue rank
A*
Where they publish
Papers
42 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2025 | ASRU | Less is More: Data Curation Matters in Scaling Speech Enhancement. | Chenda Li, Wangyou Zhang, Wei Wang, Robin Scheibler, Kohei Saijo, Samuele Cornell, Yihui Fu, Marvin Sach, Zhaoheng Ni, Anurag Kumar, Tim Fingscheidt, Shinji Watanabe, Yanmin Qian |
| 2025 | ASRU | VERSA-v2: A Modular and Scalable Toolkit for Speech and Audio Evaluation with Expanded Metrics, Visualization, and LLM Integration. | Jiatong Shi, Bo-Hao Su, Shikhar Bharadwaj, Yiwen Zhao, Shih-Heng Wang, Jionghao Hang, Haoran Wang, Wei Wang, Wenhao Feng, Yuxun Tang, Nezih Topaloglu, Siddhant Arora, Jinchuan Tian, William Chen, Hye-jin Shim, Wangyou Zhang, Wen-Chin Huang, Shinji Watanabe |
| 2025 | ASRU | PURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning. | Jiatong Shi, Haoran Wang, William Chen, Chenda Li, Wangyou Zhang, Jinchuan Tian, Shinji Watanabe |
| 2025 | ASRU | URGENT-PK: Perceptually-Aligned Ranking Model Designed for Speech Enhancement Competition. | Jiahe Wang, Chenda Li, Wei Wang, Wangyou Zhang, Samuele Cornell, Marvin Sach, Robin Scheibler, Kohei Saijo, Yihui Fu, Zhaoheng Ni, Anurag Kumar, Tim Fingscheidt, Shinji Watanabe, Yanmin Qian |
| 2025 | ASRU | Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment. | Wei Wang, Wangyou Zhang, Chenda Li, Jaitong Shi, Shinji Watanabe, Yanmin Qian |
| 2025 | ICASSP | Advanced Zero-Shot Text-to-Speech for Background Removal and Preservation with Controllable Masked Speech Prediction. | Leying Zhang, Wangyou Zhang, Zhengyang Chen, Yanmin Qian |
| 2025 | Interspeech | BR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual Biasing ASR in Speech LLM. | Xun Gong, Anqi Lv, Wangyou Zhang, Zhiming Wang, Huijia Zhu, Yanmin Qian |
| 2025 | Interspeech | Ranking and Selection of Bias Words for Contextual Bias Speech Recognition. | Haoxiang Hou, Xun Gong, Wangyou Zhang, Wei Wang, Yanmin Qian |
| 2025 | Interspeech | The Text-to-speech in the Wild (TITW) Database. | Jee-weon Jung, Wangyou Zhang, Soumi Maiti, Yihan Wu, Xin Wang, Ji-Hoon Kim, Yuta Matsunaga, Seyun Um, Jinchuan Tian, Hye-jin Shim, Nicholas W. D. Evans, Joon Son Chung, Shinnosuke Takamichi, Shinji Watanabe |
| 2025 | Interspeech | Interspeech 2025 URGENT Speech Enhancement Challenge. | Kohei Saijo, Wangyou Zhang, Samuele Cornell, Robin Scheibler, Chenda Li, Zhaoheng Ni, Anurag Kumar, Marvin Sach, Yihui Fu, Wei Wang, Tim Fingscheidt, Shinji Watanabe |
| 2025 | Interspeech | Lessons Learned from the URGENT 2024 Speech Enhancement Challenge. | Wangyou Zhang, Kohei Saijo, Samuele Cornell, Robin Scheibler, Chenda Li, Zhaoheng Ni, Anurag Kumar, Marvin Sach, Wei Wang, Yihui Fu, Shinji Watanabe, Tim Fingscheidt, Yanmin Qian |
| 2025 | NAACL | VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music. | Jiatong Shi, Hye-jin Shim, Jinchuan Tian, Siddhant Arora, Haibin Wu, Darius Petermann, Jia Qi Yip, You Zhang, Yuxun Tang, Wangyou Zhang, Dareen Alharthi, Yichen Huang, Koichi Saito, Jionghao Han, Yiwen Zhao, Chris Donahue, Shinji Watanabe |
| 2024 | EMNLP | Towards Robust Speech Representation Learning for Thousands of Languages. | William Chen, Wangyou Zhang, Yifan Peng, Xinjian Li, Jinchuan Tian, Jiatong Shi, Xuankai Chang, Soumi Maiti, Karen Livescu, Shinji Watanabe |
| 2024 | ICASSP | Generation-Based Target Speech Extraction with Speech Discretization and Vocoder. | Linfeng Yu, Wangyou Zhang, Chenpeng Du, Leying Zhang, Zheng Liang, Yanmin Qian |
| 2024 | ICASSP | Improving Design of Input Condition Invariant Speech Enhancement. | Wangyou Zhang, Jee-weon Jung, Yanmin Qian |
| 2024 | Interspeech | ESPnet-SPK: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models. | Jee-weon Jung, Wangyou Zhang, Jiatong Shi, Zakaria Aldeneh, Takuya Higuchi, Alex Gichamba, Barry-John Theobald, Ahmed Hussen Abdelaziz, Shinji Watanabe |
| 2024 | Interspeech | Beyond Performance Plateaus: A Comprehensive Study on Scalability in Speech Enhancement. | Wangyou Zhang, Kohei Saijo, Jee-weon Jung, Chenda Li, Shinji Watanabe, Yanmin Qian |
| 2024 | Interspeech | URGENT Challenge: Universality, Robustness, and Generalizability For Speech Enhancement. | Wangyou Zhang, Robin Scheibler, Kohei Saijo, Samuele Cornell, Chenda Li, Zhaoheng Ni, Jan Pirklbauer, Marvin Sach, Shinji Watanabe, Tim Fingscheidt, Yanmin Qian |
| 2023 | ASRU | Joint Prediction and Denoising for Large-Scale Multilingual Self-Supervised Learning. | William Chen, Jiatong Shi, Brian Yan, Dan Berrebbi, Wangyou Zhang, Yifan Peng, Xuankai Chang, Soumi Maiti, Shinji Watanabe |
| 2023 | ASRU | Reproducing Whisper-Style Training Using An Open-Source Toolkit And Publicly Available Data. | Yifan Peng, Jinchuan Tian, Brian Yan, Dan Berrebbi, Xuankai Chang, Xinjian Li, Jiatong Shi, Siddhant Arora, William Chen, Roshan S. Sharma, Wangyou Zhang, Yui Sudo, Muhammad Shakeel, Jee-Weon Jung, Soumi Maiti, Shinji Watanabe |
| 2023 | ASRU | A Single Speech Enhancement Model Unifying Dereverberation, Denoising, Speaker Counting, Separation, And Extraction. | Kohei Saijo, Wangyou Zhang, Zhong-Qiu Wang, Shinji Watanabe, Tetsunori Kobayashi, Tetsuji Ogawa |
| 2023 | ASRU | Toward Universal Speech Enhancement For Diverse Input Conditions. | Wangyou Zhang, Kohei Saijo, Zhong-Qiu Wang, Shinji Watanabe, Yanmin Qian |
| 2023 | ASRU | Exploring Time-Frequency Domain Target Speaker Extraction For Causal and Non-Causal Processing. | Wangyou Zhang, Lei Yang, Yanmin Qian |
| 2023 | Interspeech | Overlap Aware Continuous Speech Separation without Permutation Invariant Training. | Linfeng Yu, Wangyou Zhang, Chenda Li, Yanmin Qian |
| 2023 | Interspeech | Weakly-Supervised Speech Pre-training: A Case Study on Target Speech Recognition. | Wangyou Zhang, Yanmin Qian |
| 2022 | ICASSP | Towards Low-Distortion Multi-Channel Speech Enhancement: The ESPNET-Se Submission to the L3DAS22 Challenge. | Yen-Ju Lu, Samuele Cornell, Xuankai Chang, Wangyou Zhang, Chenda Li, Zhaoheng Ni, Zhong-Qiu Wang, Shinji Watanabe |
| 2022 | ICASSP | The Sjtu System For Multimodal Information Based Speech Processing Challenge 2021. | Wei Wang, Xun Gong, Yifei Wu, Zhikai Zhou, Chenda Li, Wangyou Zhang, Bing Han, Yanmin Qian |
| 2022 | ICASSP | Text Adaptive Detection for Customizable Keyword Spotting. | Yu Xi, Tian Tan, Wangyou Zhang, Baochen Yang, Kai Yu |
| 2022 | ICASSP | Exploring Effective Data Utilization for Low-Resource Speech Recognition. | Zhikai Zhou, Wei Wang, Wangyou Zhang, Yanmin Qian |
| 2022 | Interspeech | ESPnet-SE++: Speech Enhancement for Robust Speech Recognition, Translation, and Understanding. | Yen-Ju Lu, Xuankai Chang, Chenda Li, Wangyou Zhang, Samuele Cornell, Zhaoheng Ni, Yoshiki Masuyama, Brian Yan, Robin Scheibler, Zhong-Qiu Wang, Yu Tsao, Yanmin Qian, Shinji Watanabe |
| 2022 | Interspeech | Separating Long-Form Speech with Group-wise Permutation Invariant Training. | Wangyou Zhang, Zhuo Chen, Naoyuki Kanda, Shujie Liu, Jinyu Li, Sefik Emre Eskimez, Takuya Yoshioka, Xiong Xiao, Zhong Meng, Yanmin Qian, Furu Wei |
| 2021 | ICASSP | Convolutive Transfer Function Invariant SDR Training Criteria for Multi-Channel Reverberant Speech Separation. | Christoph Bddeker, Wangyou Zhang, Tomohiro Nakatani, Keisuke Kinoshita, Tsubasa Ochiai, Marc Delcroix, Naoyuki Kamo, Yanmin Qian, Reinhold Haeb-Umbach |
| 2021 | ICASSP | Recent Developments on Espnet Toolkit Boosted By Conformer. | Pengcheng Guo, Florian Boyer, Xuankai Chang, Tomoki Hayashi, Yosuke Higuchi, Hirofumi Inaguma, Naoyuki Kamo, Chenda Li, Daniel Garcia-Romero, Jiatong Shi, Jing Shi, Shinji Watanabe, Kun Wei, Wangyou Zhang, Yuekai Zhang |
| 2021 | ICASSP | End-to-End Dereverberation, Beamforming, and Speech Recognition with Improved Numerical Stability and Advanced Frontend. | Wangyou Zhang, Christoph Bddeker, Shinji Watanabe, Tomohiro Nakatani, Marc Delcroix, Keisuke Kinoshita, Tsubasa Ochiai, Naoyuki Kamo, Reinhold Haeb-Umbach, Yanmin Qian |
| 2020 | ICASSP | End-To-End Multi-Speaker Speech Recognition With Transformer. | Xuankai Chang, Wangyou Zhang, Yanmin Qian, Jonathan Le Roux, Shinji Watanabe |
| 2020 | Interspeech | Learning Contextual Language Embeddings for Monaural Multi-Talker Speech Recognition. | Wangyou Zhang, Yanmin Qian |
| 2020 | Interspeech | End-to-End Far-Field Speech Recognition with Unified Dereverberation and Beamforming. | Wangyou Zhang, Aswin Shanmugam Subramanian, Xuankai Chang, Shinji Watanabe, Yanmin Qian |
| 2019 | ASRU | MIMO-Speech: End-to-End Multi-Channel Multi-Speaker Speech Recognition. | Xuankai Chang, Wangyou Zhang, Yanmin Qian, Jonathan Le Roux, Shinji Watanabe |
| 2019 | ASRU | A Comparative Study on Transformer vs RNN in Speech Applications. | Shigeki Karita, Xiaofei Wang, Shinji Watanabe, Takenori Yoshimura, Wangyou Zhang, Nanxin Chen, Tomoki Hayashi, Takaaki Hori, Hirofumi Inaguma, Ziyan Jiang, Masao Someki, Nelson Enrique Yalta Soplin, Ryuichi Yamamoto |
| 2019 | ASRU | End-to-End Overlapped Speech Detection and Speaker Counting with Raw Waveform. | Wangyou Zhang, Man Sun, Lan Wang, Yanmin Qian |
| 2019 | Interspeech | Knowledge Distillation for End-to-End Monaural Multi-Talker ASR System. | Wangyou Zhang, Xuankai Chang, Yanmin Qian |
| 2019 | Interspeech | Robust DOA Estimation Based on Convolutional Neural Network and Time-Frequency Masking. | Wangyou Zhang, Ying Zhou, Yanmin Qian |