| 2025 | ASRU | Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models. | Tomoya Mizumoto, Yusuke Fujita, Hao Shi, Lianbo Liu, Atsushi Kojima, Yui Sudo |
| 2025 | ASRU | Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder. | Muhammad Shakeel, Yui Sudo, Yifan Peng, Chyi-Jiunn Lin, Shinji Watanabe |
| 2025 | ASRU | Serialized Output Prompting for Large Language Model-based Multi-Talker Speech Recognition. | Hao Shi, Yusuke Fujita, Tomoya Mizumoto, Lianbo Liu, Atsushi Kojima, Yui Sudo |
| 2025 | Interspeech | OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning. | Yifan Peng, Muhammad Shakeel, Yui Sudo, William Chen, Jinchuan Tian, Chyi-Jiunn Lin, Shinji Watanabe |
| 2025 | Interspeech | AC/DC: LLM-based Audio Comprehension via Dialogue Continuation. | Yusuke Fujita, Tomoya Mizumoto, Atsushi Kojima, Lianbo Liu, Yui Sudo |
| 2025 | Interspeech | Joint Target-Speaker ASR and Activity Detection. | Chikara Maeda, Muhammad Shakeel, Yui Sudo |
| 2025 | Interspeech | Is Synthetic Data Truly Effective for Training Speech Language Models? | Tomoya Mizumoto, Atsushi Kojima, Yusuke Fujita, Lianbo Liu, Yui Sudo |
| 2025 | Interspeech | DYNAC: Dynamic Vocabulary-based Non-Autoregressive Contextualization for Speech Recognition. | Yui Sudo, Yosuke Fukumoto, Muhammad Shakeel, Yifan Peng, Chyi-Jiunn Lin, Shinji Watanabe |
| 2025 | Interspeech | OWSM-Biasing: Contextualizing Open Whisper-Style Speech Models for Automatic Speech Recognition with Dynamic Vocabulary. | Yui Sudo, Yusuke Fujita, Atsushi Kojima, Tomoya Mizumoto, Lianbo Liu |
| 2024 | ACL | OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification. | Yifan Peng, Yui Sudo, Muhammad Shakeel, Shinji Watanabe |
| 2024 | ICASSP | Joint Optimization of Streaming and Non-Streaming Automatic Speech Recognition with Multi-Decoder and Knowledge Distillation. | Muhammad Shakeel, Yui Sudo, Yifan Peng, Shinji Watanabe |
| 2024 | ICASSP | Contextualized Automatic Speech Recognition With Attention-Based Bias Phrase Boosted Beam Search. | Yui Sudo, Muhammad Shakeel, Yosuke Fukumoto, Yifan Peng, Shinji Watanabe |
| 2024 | Interspeech | Contextualized End-to-end Automatic Speech Recognition with Intermediate Biasing Loss. | Muhammad Shakeel, Yui Sudo, Yifan Peng, Shinji Watanabe |
| 2024 | Interspeech | OWSM v3.1: Better and Faster Open Whisper-Style Speech Models based on E-Branchformer. | Yifan Peng, Jinchuan Tian, William Chen, Siddhant Arora, Brian Yan, Yui Sudo, Muhammad Shakeel, Kwanghee Choi, Jiatong Shi, Xuankai Chang, Jee-weon Jung, Shinji Watanabe |
| 2023 | ASRU | Reproducing Whisper-Style Training Using An Open-Source Toolkit And Publicly Available Data. | Yifan Peng, Jinchuan Tian, Brian Yan, Dan Berrebbi, Xuankai Chang, Xinjian Li, Jiatong Shi, Siddhant Arora, William Chen, Roshan S. Sharma, Wangyou Zhang, Yui Sudo, Muhammad Shakeel, Jee-Weon Jung, Soumi Maiti, Shinji Watanabe |
| 2023 | Interspeech | DPHuBERT: Joint Distillation and Pruning of Self-Supervised Speech Models. | Yifan Peng, Yui Sudo, Muhammad Shakeel, Shinji Watanabe |
| 2023 | Interspeech | Time-synchronous one-pass Beam Search for Parallel Online and Offline Transducers with Dynamic Block Training. | Yui Sudo, Muhammad Shakeel, Yifan Peng, Shinji Watanabe |
| 2023 | Interspeech | 4D ASR: Joint modeling of CTC, Attention, Transducer, and Mask-Predict decoders. | Yui Sudo, Muhammad Shakeel, Brian Yan, Jiatong Shi, Shinji Watanabe |
| 2023 | Interspeech | Retraining-free Customized ASR for Enharmonic Words Based on a Named-Entity-Aware Model and Phoneme Similarity Estimation. | Yui Sudo, Kazuya Hata, Kazuhiro Nakadai |
| 2023 | RO-MAN | Online Adaptation of Fourier Series Based Acoustic Transfer Function Model to Improve Sound Source Localization and Separation. | Yui Sudo, Masayuki Takigahira, Hideo Tsuru, Kazuhiro Nakadai, Hirofumi Nakajima |
| 2022 | Interspeech | Streaming Automatic Speech Recognition with Re-blocking Processing Based on Integrated Voice Activity Detection. | Yui Sudo, Muhammad Shakeel, Kazuhiro Nakadai, Jiatong Shi, Shinji Watanabe |
| 2022 | Interspeech | Empirical Sampling from Latent Utterance-wise Evidence Model for Missing Data ASR based on Neural Encoder-Decoder Model. | Ryu Takeda, Yui Sudo, Kazuhiro Nakadai, Kazunori Komatani |
| 2019 | IROS | Environmental sound segmentation utilizing Mask U-Net. | Yui Sudo, Katsutoshi Itoyama, Kenji Nishida, Kazuhiro Nakadai |