| 2026 | ACL | Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback. | Siddhant Arora, Jinchuan Tian, Jiatong Shi, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe |
| 2026 | SIGdial | DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio. | Wataru Nakata, Yuki Saito, Kazuki Yamauchi, Emiru Tsunoo, Hiroshi Saruwatari |
| 2025 | ASRU | Spiralformer: Low Latency Encoder for Streaming Speech Recognition with Circular Layer Skipping and Early Exiting. | Emiru Tsunoo, Hayato Futami, Yosuke Kashiwagi, Siddhant Arora, Shinji Watanabe |
| 2025 | ICASSP | Hypothesis Clustering and Merging: Novel MultiTalker Speech Recognition with Speaker Tokens. | Yosuke Kashiwagi, Hayato Futami, Emiru Tsunoo, Siddhant Arora, Shinji Watanabe |
| 2025 | ICASSP | Causal Speech Enhancement with Predicting Semantics based on Quantized Self-supervised Learning Features. | Emiru Tsunoo, Yuki Saito, Wataru Nakata, Hiroshi Saruwatari |
| 2025 | Interspeech | Chain-of-Thought Training for Open E2E Spoken Dialogue Systems. | Siddhant Arora, Jinchuan Tian, Hayato Futami, Jee-weon Jung, Jiatong Shi, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe |
| 2025 | Interspeech | Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs. | Hayato Futami, Emiru Tsunoo, Yosuke Kashiwagi, Yuki Ito, Hassan Shahmohammadi, Siddhant Arora, Shinji Watanabe |
| 2025 | Interspeech | Differentiable K-means for Fully-optimized Discrete Token-based ASR. | Kentaro Onda, Yosuke Kashiwagi, Emiru Tsunoo, Hayato Futami, Shinji Watanabe |
| 2025 | NAACL | ESPnet-SDS: Unified Toolkit and Demo for Spoken Dialogue Systems. | Siddhant Arora, Yifan Peng, Jiatong Shi, Jinchuan Tian, William Chen, Shikhar Bharadwaj, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shuichiro Shimizu, Vaibhav Srivastav, Shinji Watanabe |
| 2024 | ICASSP | Phoneme-Aware Encoding for Prefix-Tree-Based Contextual ASR. | Hayato Futami, Emiru Tsunoo, Yosuke Kashiwagi, Hiroaki Ogawa, Siddhant Arora, Shinji Watanabe |
| 2024 | Interspeech | Finding Task-specific Subnetworks in Multi-task Spoken Language Understanding Model. | Hayato Futami, Siddhant Arora, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe |
| 2024 | Interspeech | Rapid Language Adaptation for Multilingual E2E Speech Recognition Using Encoder Prompting. | Yosuke Kashiwagi, Hayato Futami, Emiru Tsunoo, Siddhant Arora, Shinji Watanabe |
| 2024 | Interspeech | Decoder-only Architecture for Streaming End-to-end Speech Recognition. | Emiru Tsunoo, Hayato Futami, Yosuke Kashiwagi, Siddhant Arora, Shinji Watanabe |
| 2024 | NAACL | UniverSLU: Universal Spoken Language Understanding for Diverse Tasks with Natural Language Instructions. | Siddhant Arora, Hayato Futami, Jee-weon Jung, Yifan Peng, Roshan S. Sharma, Yosuke Kashiwagi, Emiru Tsunoo, Karen Livescu, Shinji Watanabe |
| 2023 | ICASSP | Joint Modelling of Spoken Language Understanding Tasks with Integrated Dialog History. | Siddhant Arora, Hayato Futami, Emiru Tsunoo, Brian Yan, Shinji Watanabe |
| 2023 | ICASSP | A Study on the Integration of Pipeline and E2E SLU Systems for Spoken Semantic Parsing Toward Stop Quality Challenge. | Siddhant Arora, Hayato Futami, Shih-Lun Wu, Jessica Huynh, Yifan Peng, Yosuke Kashiwagi, Emiru Tsunoo, Brian Yan, Shinji Watanabe |
| 2023 | ICASSP | The Pipeline System of ASR and NLU with MLM-based data Augmentation Toward Stop Low-Resource Challenge. | Hayato Futami, Jessica Huynh, Siddhant Arora, Shih-Lun Wu, Yosuke Kashiwagi, Yifan Peng, Brian Yan, Emiru Tsunoo, Shinji Watanabe |
| 2023 | ICASSP | Streaming Joint Speech Recognition and Disfluency Detection. | Hayato Futami, Emiru Tsunoo, Kentaro Shibata, Yosuke Kashiwagi, Takao Okuda, Siddhant Arora, Shinji Watanabe |
| 2023 | ICASSP | E-Branchformer-Based E2E SLU Toward Stop on-Device Challenge. | Yosuke Kashiwagi, Siddhant Arora, Hayato Futami, Jessica Huynh, Shih-Lun Wu, Yifan Peng, Brian Yan, Emiru Tsunoo, Shinji Watanabe |
| 2023 | Interspeech | Integrating Pretrained ASR and LM to Perform Sequence Generation for Spoken Language Understanding. | Siddhant Arora, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Brian Yan, Shinji Watanabe |
| 2023 | Interspeech | Tensor decomposition for minimization of E2E SLU model toward on-device processing. | Yosuke Kashiwagi, Siddhant Arora, Hayato Futami, Jessica Huynh, Shih-Lun Wu, Yifan Peng, Brian Yan, Emiru Tsunoo, Shinji Watanabe |
| 2023 | Interspeech | Integration of Frame- and Label-synchronous Beam Search for Streaming Encoder-decoder Speech Recognition. | Emiru Tsunoo, Hayato Futami, Yosuke Kashiwagi, Siddhant Arora, Shinji Watanabe |
| 2022 | ICASSP | Polyphone Disambiguation and Accent Prediction Using Pre-Trained Language Models in Japanese TTS Front-End. | Rem Hida, Masaki Hamada, Chie Kamada, Emiru Tsunoo, Toshiyuki Sekiya, Toshiyuki Kumakura |
| 2022 | ICASSP | Spatial Data Augmentation with Simulated Room Impulse Responses for Sound Event Localization and Detection. | Yuichiro Koyama, Kazuhide Shigemi, Masafumi Takahashi, Kazuki Shimada, Naoya Takahashi, Emiru Tsunoo, Shusuke Takahashi, Yuki Mitsufuji |
| 2022 | ICASSP | Joint Speech Recognition and Audio Captioning. | Chaitanya Narisetty, Emiru Tsunoo, Xuankai Chang, Yosuke Kashiwagi, Michael Hentschel, Shinji Watanabe |
| 2022 | ICASSP | Multi-ACCDOA: Localizing And Detecting Overlapping Sounds From The Same Class With Auxiliary Duplicating Permutation Invariant Training. | Kazuki Shimada, Yuichiro Koyama, Shusuke Takahashi, Naoya Takahashi, Emiru Tsunoo, Yuki Mitsufuji |
| 2022 | ICASSP | Run-and-Back Stitch Search: Novel Block Synchronous Decoding For Streaming Encoder-Decoder ASR. | Emiru Tsunoo, Chaitanya Narisetty, Michael Hentschel, Yosuke Kashiwagi, Shinji Watanabe |
| 2022 | Interspeech | Residual Language Model for End-to-end Speech Recognition. | Emiru Tsunoo, Yosuke Kashiwagi, Chaitanya Prasad Narisetty, Shinji Watanabe |
| 2021 | ICASSP | Making Punctuation Restoration Robust and Fast with Multi-Task Learning and Knowledge Distillation. | Michael Hentschel, Emiru Tsunoo, Takao Okuda |
| 2021 | ICASSP | Gaussian Kernelized Self-Attention for Long Sequence Data and its Application to CTC-Based Speech Recognition. | Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe |
| 2021 | Interspeech | Data Augmentation Methods for End-to-End Speech Recognition on Distant-Talk Scenarios. | Emiru Tsunoo, Kentaro Shibata, Chaitanya Narisetty, Yosuke Kashiwagi, Shinji Watanabe |
| 2019 | ASRU | Transformer ASR with Contextual Block Processing. | Emiru Tsunoo, Yosuke Kashiwagi, Toshiyuki Kumakura, Shinji Watanabe |
| 2019 | Interspeech | End-to-End Adaptation with Backpropagation Through WFST for On-Device Speech Recognition System. | Emiru Tsunoo, Yosuke Kashiwagi, Satoshi Asakawa, Toshiyuki Kumakura |
| 2017 | ASRU | Hierarchical recurrent neural network for story segmentation using fusion of lexical and acoustic features. | Emiru Tsunoo, Ondrej Klejch, Peter Bell, Steve Renals |
| 2017 | Interspeech | Hierarchical Recurrent Neural Network for Story Segmentation. | Emiru Tsunoo, Peter Bell, Steve Renals |
| 2010 | ICASSP | Music mood classification by rhythm and bass-line unit pattern analysis. | Emiru Tsunoo, Taichi Akase, Nobutaka Ono, Shigeki Sagayama |
| 2009 | ICASSP | Rhythm map: Extraction of unit rhythmic patterns and analysis of rhythmic structure from music acoustic signals. | Emiru Tsunoo, Nobutaka Ono, Shigeki Sagayama |