| 2025 | ASRU | All-in-One ASR: Unifying Encoder-Decoder Models of CTC, Attention, and Transducer in Dual-Mode ASR. | Takafumi Moriya, Masato Mimura, Tomohiro Tanaka, Hiroshi Sato, Ryo Masumura, Atsunori Ogawa |
| 2025 | ICASSP | Leveraging IPA and Articulatory Features as Effective Inductive Biases for Multilingual ASR Training. | Jaeyoung Lee, Masato Mimura, Tatsuya Kawahara |
| 2025 | ICASSP | Advancing Streaming ASR with Chunk-wise Attention and Trans-chunk Selective State Spaces. | Masato Mimura, Takafumi Moriya, Kohei Matsuura |
| 2025 | ICASSP | Alignment-Free Training for Transducer-based Multi-Talker ASR. | Takafumi Moriya, Shota Horiguchi, Marc Delcroix, Ryo Masumura, Takanori Ashihara, Hiroshi Sato, Kohei Matsuura, Masato Mimura |
| 2025 | Interspeech | Switch Conformer with Universal Phonetic Experts for Multilingual ASR. | Masato Mimura, Jaeyoung Lee, Tatsuya Kawahara |
| 2025 | Interspeech | Attention-Free Dual-Mode ASR with Latency-Controlled Selective State Spaces. | Takafumi Moriya, Masato Mimura, Kiyoaki Matsui, Hiroshi Sato, Kohei Matsuura |
| 2024 | Interspeech | Sentence-wise Speech Summarization: Task, Datasets, and End-to-End Modeling with LM Knowledge Distillation. | Kohei Matsuura, Takanori Ashihara, Takafumi Moriya, Masato Mimura, Takatomo Kano, Atsunori Ogawa, Marc Delcroix |
| 2024 | Interspeech | Boosting Hybrid Autoregressive Transducer-based ASR with Internal Acoustic Model Training and Dual Blank Thresholding. | Takafumi Moriya, Takanori Ashihara, Masato Mimura, Hiroshi Sato, Kohei Matsuura, Ryo Masumura, Taichi Asami |
| 2024 | Interspeech | SpeakerBeam-SS: Real-time Target Speaker Extraction with Lightweight Conv-TasNet and State Space Modeling. | Hiroshi Sato, Takafumi Moriya, Masato Mimura, Shota Horiguchi, Tsubasa Ochiai, Takanori Ashihara, Atsushi Ando, Kentaro Shinayama, Marc Delcroix |
| 2023 | ICASSP | Time-Domain Speech Enhancement Assisted by Multi-Resolution Frequency Encoder and Decoder. | Hao Shi, Masato Mimura, Longbiao Wang, Jianwu Dang, Tatsuya Kawahara |
| 2023 | Interspeech | Embedding Articulatory Constraints for Low-resource Speech Recognition Based on Large Pre-trained Model. | Jaeyoung Lee, Masato Mimura, Tatsuya Kawahara |
| 2022 | ICASSP | Selective Multi-Task Learning For Speech Emotion Recognition Using Corpora Of Different Styles. | Heran Zhang, Masato Mimura, Tatsuya Kawahara, Kenkichi Ishizuka |
| 2022 | Interspeech | Non-autoregressive Error Correction for CTC-based ASR with Phone-conditioned Masked LM. | Hayato Futami, Hirofumi Inaguma, Sei Ueno, Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara |
| 2022 | Interspeech | Leveraging Simultaneous Translation for Enhancing Transcription of Low-resource Language via Cross Attention Mechanism. | Soky Kak, Sheng Li, Masato Mimura, Chenhui Chu, Tatsuya Kawahara |
| 2021 | ASRU | ASR Rescoring and Confidence Estimation with Electra. | Hayato Futami, Hirofumi Inaguma, Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara |
| 2021 | ASRU | Data Augmentation for ASR Using TTS Via a Discrete Representation. | Sei Ueno, Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara |
| 2020 | Interspeech | Distilling the Knowledge of BERT for Sequence-to-Sequence ASR. | Hayato Futami, Hirofumi Inaguma, Sei Ueno, Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara |
| 2020 | Interspeech | CTC-Synchronous Training for Monotonic Attention Model. | Hirofumi Inaguma, Masato Mimura, Tatsuya Kawahara |
| 2020 | Interspeech | Enhancing Monotonic Multihead Attention for Streaming ASR. | Hirofumi Inaguma, Masato Mimura, Tatsuya Kawahara |
| 2020 | Interspeech | Generative Adversarial Training Data Adaptation for Very Low-Resource Automatic Speech Recognition. | Kohei Matsuura, Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara |
| 2020 | LREC | Speech Corpus of Ainu Folklore and End-to-end Speech Recognition for Ainu Language. | Kohei Matsuura, Sei Ueno, Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara |
| 2019 | ICASSP | Multi-speaker Sequence-to-sequence Speech Synthesis for Data Augmentation in Acoustic-to-word Speech Recognition. | Sei Ueno, Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara |
| 2018 | ICASSP | Statistical Speech Enhancement Based on Probabilistic Integration of Variational Autoencoder and Non-Negative Matrix Factorization. | Yoshiaki Bando, Masato Mimura, Katsutoshi Itoyama, Kazuyoshi Yoshii, Tatsuya Kawahara |
| 2018 | ICASSP | An End-to-End Approach to Joint Social Signal Detection and Automatic Speech Recognition. | Hirofumi Inaguma, Masato Mimura, Koji Inoue, Kazuyoshi Yoshii, Tatsuya Kawahara |
| 2018 | ICASSP | Unsupervised Beamforming Based on Multichannel Nonnegative Matrix Factorization for Noisy Speech Recognition. | Kazuki Shimada, Yoshiaki Bando, Masato Mimura, Katsutoshi Itoyama, Kazuyoshi Yoshii, Tatsuya Kawahara |
| 2018 | ICASSP | Acoustic-to-Word Attention-Based Model Complemented with Character-Level CTC-Based Model. | Sei Ueno, Hirofumi Inaguma, Masato Mimura, Tatsuya Kawahara |
| 2018 | Interspeech | Forward-Backward Attention Decoder. | Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara |
| 2018 | Interspeech | Encoder Transfer for Attention-based Acoustic-to-word Speech Recognition. | Sei Ueno, Takafumi Moriya, Masato Mimura, Shinsuke Sakai, Yusuke Shinohara, Yoshikazu Yamaguchi, Yushi Aono, Tatsuya Kawahara |
| 2017 | ASRU | Cross-domain speech recognition using nonparallel corpora with cycle-consistent adversarial networks. | Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara |
| 2017 | ICASSP | Semi-supervised ensemble DNN acoustic model training. | Sheng Li, Xugang Lu, Shinsuke Sakai, Masato Mimura, Tatsuya Kawahara |
| 2017 | Interspeech | Social Signal Detection in Spontaneous Dialogue Using Bidirectional LSTM-CTC. | Hirofumi Inaguma, Koji Inoue, Masato Mimura, Tatsuya Kawahara |
| 2017 | Interspeech | Combined Multi-Channel NMF-Based Robust Beamforming for Noisy Speech Recognition. | Masato Mimura, Yoshiaki Bando, Kazuki Shimada, Shinsuke Sakai, Kazuyoshi Yoshii, Tatsuya Kawahara |
| 2016 | Interspeech | Joint Optimization of Denoising Autoencoder and DNN Acoustic Model Based on Multi-Target Learning for Noisy Speech Recognition. | Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara |
| 2015 | ICASSP | Deep autoencoders augmented with phone-class feature for reverberant speech recognition. | Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara |
| 2015 | Interspeech | Speech dereverberation using long short-term memory. | Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara |
| 2010 | Interspeech | Semi-automated update of automatic transcription system for the Japanese national congress. | Yuya Akita, Masato Mimura, Graham Neubig, Tatsuya Kawahara |
| 2010 | Interspeech | Learning a language model from continuous speech. | Graham Neubig, Masato Mimura, Shinsuke Mori, Tatsuya Kawahara |
| 2009 | ICASSP | Language model transformation applied to lightly supervised training of acoustic model for congress meetings. | Tatsuya Kawahara, Masato Mimura, Yuya Akita |
| 2009 | Interspeech | Automatic transcription system for meetings of the Japanese national congress. | Yuya Akita, Masato Mimura, Tatsuya Kawahara |
| 2002 | LREC | Continuous Speech Recognition Consortium an Open Repository for CSR Tools and Models. | Akinobu Lee, Tatsuya Kawahara, Kazuya Takeda, Masato Mimura, Atsushi Yamada, Akinori Ito, Katsunobu Itou, Kiyohiro Shikano |