| 2026 | AAAI | DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models. | Yuanyuan Wang, Dongchao Yang, Yiwen Shao, Hangting Chen, Jiankun Zhao, Zhiyong Wu, Helen Meng, Xixin Wu |
| 2026 | ACL | TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding. | Mingyue Huo, Yiwen Shao, Yuheng Zhang |
| 2026 | ACL | Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation. | Wei-Cheng Tseng, Xuanru Zhou, Mingyue Huo, Yiwen Shao, Hao Zhang, Dong Yu |
| 2025 | ASRU | Efficient Scaling for LLM-based ASR. | Bingshen Mu, Yiwen Shao, Kun Wei, Dong Yu, Lei Xie |
| 2025 | Interspeech | Efficient Multilingual ASR Finetuning via LoRA Language Experts. | Jiahong Li, Yiwen Shao, Jianheng Zhuo, Chenda Li, Liliang Tang, Dong Yu, Yanmin Qian |
| 2025 | Interspeech | VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining. | Jianheng Zhuo, Yifan Yang, Yiwen Shao, Yong Xu, Dong Yu, Kai Yu, Xie Chen |
| 2024 | ICASSP | UniX-Encoder: A Universal X-Channel Speech Encoder for AD-HOC Microphone Array Speech Processing. | Zili Huang, Yiwen Shao, Shi-Xiong Zhang, Dong Yu |
| 2024 | Interspeech | RIR-SF: Room Impulse Response Based Spatial Feature for Target Speech Recognition in Multi-Channel Multi-Speaker Scenarios. | Yiwen Shao, Shi-Xiong Zhang, Dong Yu |
| 2024 | Interspeech | Multi-Channel Multi-Speaker ASR Using Target Speaker's Solo Segment. | Yiwen Shao, Shi-Xiong Zhang, Yong Xu, Meng Yu, Dong Yu, Daniel Povey, Sanjeev Khudanpur |
| 2022 | ICASSP | Multi-Channel Multi-Speaker ASR Using 3D Spatial Feature. | Yiwen Shao, Shi-Xiong Zhang, Dong Yu |
| 2022 | Interspeech | Defense against Adversarial Attacks on Hybrid Speech Recognition System using Adversarial Fine-tuning with Denoiser. | Sonal Joshi, Saurabh Kataria, Yiwen Shao, Piotr Zelasko, Jess Villalba, Sanjeev Khudanpur, Najim Dehak |
| 2022 | Interspeech | Chunking Defense for Adversarial Attacks on ASR. | Yiwen Shao, Jess Villalba, Sonal Joshi, Saurabh Kataria, Sanjeev Khudanpur, Najim Dehak |
| 2020 | ICASSP | Speaker Diarization with Region Proposal Network. | Zili Huang, Shinji Watanabe, Yusuke Fujita, Paola Garca, Yiwen Shao, Daniel Povey, Sanjeev Khudanpur |
| 2020 | Interspeech | PyChain: A Fully Parallelized PyTorch Implementation of LF-MMI for End-to-End ASR. | Yiwen Shao, Yiming Wang, Daniel Povey, Sanjeev Khudanpur |
| 2019 | ASRU | Espresso: A Fast End-to-End Neural Speech Recognition Toolkit. | Yiming Wang, Sanjeev Khudanpur, Tongfei Chen, Hainan Xu, Shuoyang Ding, Hang Lv, Yiwen Shao, Nanyun Peng, Lei Xie, Shinji Watanabe |
| 2019 | ICDAR | Using ASR Methods for OCR. | Ashish Arora, Paola Garca, Shinji Watanabe, Vimal Manohar, Yiwen Shao, Sanjeev Khudanpur, Chun-Chieh Chang, Babak Rekabdar, Bagher BabaAli, Daniel Povey, David Etter, Desh Raj, Hossein Hadian, Jan Trmal |
| 2018 | ICASSP | Use of Pitch Continuity for Robust Speech Activity Detection. | Yiwen Shao, Qiguang Lin |
| 2018 | Interspeech | A Novel Normalization Method for Autocorrelation Function for Pitch Detection and for Speech Activity Detection. | Qiguang Lin, Yiwen Shao |