| 2025 | ICASSP | Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition. | Takaaki Hori, Martin Kocour, Adnan Haider, Erik McDermott, Xiaodan Zhuang |
| 2023 | ICASSP | Variable Attention Masking for Configurable Transformer Transducer Speech Recognition. | Pawel Swietojanski, Stefan Braun, Dogan Can, Thiago Fraga da Silva, Arnab Ghoshal, Takaaki Hori, Roger Hsiao, Henry Mason, Erik McDermott, Honza Silovsky, Ruchir Travadi, Xiaodan Zhuang |
| 2022 | ICASSP | Extended Graph Temporal Classification for Multi-Speaker End-to-End ASR. | Xuankai Chang, Niko Moritz, Takaaki Hori, Shinji Watanabe, Jonathan Le Roux |
| 2022 | ICASSP | Advancing Momentum Pseudo-Labeling with Conformer and Initialization Strategy. | Yosuke Higuchi, Niko Moritz, Jonathan Le Roux, Takaaki Hori |
| 2022 | ICASSP | Sequence Transduction with Graph-Based Supervision. | Niko Moritz, Takaaki Hori, Shinji Watanabe, Jonathan Le Roux |
| 2022 | ICASSP | Audio-Visual Scene-Aware Dialog and Reasoning Using Audio-Visual Transformers with Joint Student-Teacher Learning. | Ankit P. Shah, Shijie Geng, Peng Gao, Anoop Cherian, Takaaki Hori, Tim K. Marks, Jonathan Le Roux, Chiori Hori |
| 2022 | Interspeech | Low-Latency Online Streaming VideoQA Using Audio-Visual Transformers. | Chiori Hori, Takaaki Hori, Jonathan Le Roux |
| 2021 | ICASSP | Unsupervised Domain Adaptation for Speech Recognition via Uncertainty Driven Self-Training. | Sameer Khurana, Niko Moritz, Takaaki Hori, Jonathan Le Roux |
| 2021 | ICASSP | Capturing Multi-Resolution Context by Dilated Self-Attention. | Niko Moritz, Takaaki Hori, Jonathan Le Roux |
| 2021 | ICASSP | Semi-Supervised Speech Recognition Via Graph-Based Temporal Classification. | Niko Moritz, Takaaki Hori, Jonathan Le Roux |
| 2021 | Interspeech | Momentum Pseudo-Labeling for Semi-Supervised Speech Recognition. | Yosuke Higuchi, Niko Moritz, Jonathan Le Roux, Takaaki Hori |
| 2021 | Interspeech | Optimizing Latency for Online Video Captioning Using Audio-Visual Transformers. | Chiori Hori, Takaaki Hori, Jonathan Le Roux |
| 2021 | Interspeech | Advanced Long-Context End-to-End Speech Recognition Using Context-Expanded Transformers. | Takaaki Hori, Niko Moritz, Chiori Hori, Jonathan Le Roux |
| 2021 | Interspeech | Dual Causal/Non-Causal Self-Attention for Streaming End-to-End Speech Recognition. | Niko Moritz, Takaaki Hori, Jonathan Le Roux |
| 2020 | ICASSP | Streaming Automatic Speech Recognition with the Transformer Model. | Niko Moritz, Takaaki Hori, Jonathan Le Roux |
| 2020 | ICASSP | Unsupervised Speaker Adaptation Using Attention-Based Speaker Memory for End-to-End ASR. | Leda Sari, Niko Moritz, Takaaki Hori, Jonathan Le Roux |
| 2020 | Interspeech | Transformer-Based Long-Context End-to-End Speech Recognition. | Takaaki Hori, Niko Moritz, Chiori Hori, Jonathan Le Roux |
| 2020 | Interspeech | All-in-One Transformer: Unifying Speech Recognition, Audio Tagging, and Event Detection. | Niko Moritz, Gordon Wichern, Takaaki Hori, Jonathan Le Roux |
| 2019 | ASRU | A Comparative Study on Transformer vs RNN in Speech Applications. | Shigeki Karita, Xiaofei Wang, Shinji Watanabe, Takenori Yoshimura, Wangyou Zhang, Nanxin Chen, Tomoki Hayashi, Takaaki Hori, Hirofumi Inaguma, Ziyan Jiang, Masao Someki, Nelson Enrique Yalta Soplin, Ryuichi Yamamoto |
| 2019 | ASRU | Streaming End-to-End Speech Recognition with Joint CTC-Attention Based Models. | Niko Moritz, Takaaki Hori, Jonathan Le Roux |
| 2019 | ICASSP | Promising Accurate Prefix Boosting for Sequence-to-sequence ASR. | Murali Karthick Baskar, Luks Burget, Shinji Watanabe, Martin Karafit, Takaaki Hori, Jan Honza Cernock |
| 2019 | ICASSP | Language Model Integration Based on Memory Control for Sequence to Sequence Speech Recognition. | Jaejin Cho, Shinji Watanabe, Takaaki Hori, Murali Karthick Baskar, Hirofumi Inaguma, Jess Villalba, Najim Dehak |
| 2019 | ICASSP | End-to-end Audio Visual Scene-aware Dialog Using Multimodal Attention-based Video Features. | Chiori Hori, Huda AlAmri, Jue Wang, Gordon Wichern, Takaaki Hori, Anoop Cherian, Tim K. Marks, Vincent Cartillier, Raphael Gontijo Lopes, Abhishek Das, Irfan Essa, Dhruv Batra, Devi Parikh |
| 2019 | ICASSP | Cycle-consistency Training for End-to-end Speech Recognition. | Takaaki Hori, Ramn Fernandez Astudillo, Tomoki Hayashi, Yu Zhang, Shinji Watanabe, Jonathan Le Roux |
| 2019 | ICASSP | Triggered Attention for End-to-end Speech Recognition. | Niko Moritz, Takaaki Hori, Jonathan Le Roux |
| 2019 | ICASSP | Stream Attention-based Multi-array End-to-end Speech Recognition. | Xiaofei Wang, Ruizhi Li, Sri Harish Mallidi, Takaaki Hori, Shinji Watanabe, Hynek Hermansky |
| 2019 | Interspeech | Semi-Supervised Sequence-to-Sequence ASR Using Unpaired Speech and Text. | Murali Karthick Baskar, Shinji Watanabe, Ramn Fernandez Astudillo, Takaaki Hori, Luks Burget, Jan Cernock |
| 2019 | Interspeech | Joint Student-Teacher Learning for Audio-Visual Scene-Aware Dialog. | Chiori Hori, Anoop Cherian, Tim K. Marks, Takaaki Hori |
| 2019 | Interspeech | Analysis of Multilingual Sequence-to-Sequence Speech Recognition Systems. | Martin Karafit, Murali Karthick Baskar, Shinji Watanabe, Takaaki Hori, Matthew Wiesner, Jan Cernock |
| 2019 | Interspeech | Unidirectional Neural Network Architectures for End-to-End Automatic Speech Recognition. | Niko Moritz, Takaaki Hori, Jonathan Le Roux |
| 2019 | Interspeech | Vectorized Beam Search for CTC-Attention-Based Speech Recognition. | Hiroshi Seki, Takaaki Hori, Shinji Watanabe, Niko Moritz, Jonathan Le Roux |
| 2019 | Interspeech | End-to-End Multilingual Multi-Speaker Speech Recognition. | Hiroshi Seki, Takaaki Hori, Shinji Watanabe, Jonathan Le Roux, John R. Hershey |
| 2018 | ACL | A Purely End-to-End System for Multi-speaker Speech Recognition. | Hiroshi Seki, Takaaki Hori, Shinji Watanabe, Jonathan Le Roux, John R. Hershey |
| 2018 | CVPR | Multimodal Attention for Fusion of Audio and Spatiotemporal Features for Video Description. | Chiori Hori, Takaaki Hori, Gordon Wichern, Jue Wang, Teng-Yok Lee, Anoop Cherian, Tim K. Marks |
| 2018 | ICASSP | Speaker Adaptation for Multichannel End-to-End Speech Recognition. | Tsubasa Ochiai, Shinji Watanabe, Shigeru Katagiri, Takaaki Hori, John R. Hershey |
| 2018 | ICASSP | An End-to-End Language-Tracking Speech Recognizer for Mixed-Language Speech. | Hiroshi Seki, Shinji Watanabe, Takaaki Hori, Jonathan Le Roux, John R. Hershey |
| 2018 | ICASSP | End-to-End Multi-Speaker Speech Recognition. | Shane Settle, Jonathan Le Roux, Takaaki Hori, Shinji Watanabe, John R. Hershey |
| 2018 | Interspeech | ESPnet: End-to-End Speech Processing Toolkit. | Shinji Watanabe, Takaaki Hori, Shigeki Karita, Tomoki Hayashi, Jiro Nishitoba, Yuya Unno, Nelson Enrique Yalta Soplin, Jahn Heymann, Matthew Wiesner, Nanxin Chen, Adithya Renduchintala, Tsubasa Ochiai |
| 2017 | ACL | Joint CTC/attention decoding for end-to-end speech recognition. | Takaaki Hori, Shinji Watanabe, John R. Hershey |
| 2017 | ASRU | Early and late integration of audio features for automatic video description. | Chiori Hori, Takaaki Hori, Tim K. Marks, John R. Hershey |
| 2017 | ASRU | Multi-level language modeling and decoding for open vocabulary end-to-end speech recognition. | Takaaki Hori, Shinji Watanabe, John R. Hershey |
| 2017 | ASRU | Language independent end-to-end architecture for joint language identification and speech recognition. | Shinji Watanabe, Takaaki Hori, John R. Hershey |
| 2017 | ICASSP | BLSTM-HMM hybrid system combined with sound activity detection network for polyphonic Sound Event Detection. | Tomoki Hayashi, Shinji Watanabe, Tomoki Toda, Takaaki Hori, Jonathan Le Roux, Kazuya Takeda |
| 2017 | ICASSP | Joint CTC-attention based end-to-end speech recognition using multi-task learning. | Suyoun Kim, Takaaki Hori, Shinji Watanabe |
| 2017 | ICASSP | Student-teacher network learning with enhanced features. | Shinji Watanabe, Takaaki Hori, Jonathan Le Roux, John R. Hershey |
| 2017 | ICCV | Attention-Based Multimodal Fusion for Video Description. | Chiori Hori, Takaaki Hori, Teng-Yok Lee, Ziming Zhang, Bret Harsham, John R. Hershey, Tim K. Marks, Kazuhiro Sumi |
| 2017 | ICML | Multichannel End-to-end Speech Recognition. | Tsubasa Ochiai, Shinji Watanabe, Takaaki Hori, John R. Hershey |
| 2017 | Interspeech | Advances in Joint CTC-Attention Based End-to-End Speech Recognition with a Deep CNN Encoder and RNN-LM. | Takaaki Hori, Shinji Watanabe, Yu Zhang, William Chan |
| 2016 | ICASSP | Minimum word error training of long short-term memory recurrent neural network language models for speech recognition. | Takaaki Hori, Chiori Hori, Shinji Watanabe, John R. Hershey |
| 2016 | Interspeech | Context-Sensitive and Role-Dependent Spoken Language Understanding Using Bidirectional and Attention LSTMs. | Chiori Hori, Takaaki Hori, Shinji Watanabe, John R. Hershey |
| 2015 | ASRU | The MERL/SRI system for the 3RD CHiME challenge using beamforming, robust feature extraction, and advanced speech recognition. | Takaaki Hori, Zhuo Chen, Hakan Erdogan, John R. Hershey, Jonathan Le Roux, Vikramjit Mitra, Shinji Watanabe |
| 2015 | ICASSP | Double-layer neighborhood graph based similarity search for fast query-by-example spoken term detection. | Kazuo Aoyama, Atsunori Ogawa, Takashi Hattori, Takaaki Hori |
| 2015 | ICASSP | Context adaptive deep neural networks for fast acoustic model adaptation. | Marc Delcroix, Keisuke Kinoshita, Takaaki Hori, Tomohiro Nakatani |
| 2015 | ICASSP | WFST-based structural classification integrating dnn acoustic features and RNN language features for speech recognition. | Quoc Truong Do, Satoshi Nakamura, Marc Delcroix, Takaaki Hori |
| 2015 | ICASSP | ASR error detection and recognition rate estimation using deep bidirectional recurrent neural networks. | Atsunori Ogawa, Takaaki Hori |
| 2015 | Interspeech | Multiscale recurrent neural network based language model. | Tsuyoshi Morioka, Tomoharu Iwata, Takaaki Hori, Tetsunori Kobayashi |
| 2014 | ICASSP | Zero-resource spoken term detection using hierarchical graph-based similarity search. | Kazuo Aoyama, Atsunori Ogawa, Takashi Hattori, Takaaki Hori, Atsushi Nakamura |
| 2014 | ICASSP | Real-time one-pass decoding with recurrent neural network language model for speech recognition. | Takaaki Hori, Yotaro Kubo, Atsushi Nakamura |
| 2014 | ICASSP | Fast segment search for corpus-based speech enhancement based on speech recognition technology. | Atsunori Ogawa, Keisuke Kinoshita, Takaaki Hori, Tomohiro Nakatani, Atsushi Nakamura |
| 2014 | Interspeech | Restructuring output layers of deep neural networks using minimum risk parameter clustering. | Yotaro Kubo, Jun Suzuki, Takaaki Hori, Atsushi Nakamura |
| 2013 | ICASSP | Graph index based query-by-example search on a large speech data set. | Kazuo Aoyama, Atsunori Ogawa, Takashi Hattori, Takaaki Hori, Atsushi Nakamura |
| 2013 | ICASSP | Feature space variational Bayesian linear regression and its combination with model space VBLR. | Seong-Jun Hahm, Atsunori Ogawa, Marc Delcroix, Masakiyo Fujimoto, Takaaki Hori, Atsushi Nakamura |
| 2013 | ICASSP | Large vocabulary continuous speech recognition based on WFST structured classifiers and deep bottleneck features. | Yotaro Kubo, Takaaki Hori, Atsushi Nakamura |
| 2013 | ICASSP | Coupling beamforming with spatial and spectral feature based spectral enhancement and its application to meeting recognition. | Tomohiro Nakatani, Mehrez Souden, Shoko Araki, Takuya Yoshioka, Takaaki Hori, Atsunori Ogawa |
| 2013 | ICASSP | Discriminative recognition rate estimation for N-best list and its application to N-best rescoring. | Atsunori Ogawa, Takaaki Hori, Atsushi Nakamura |
| 2013 | Interspeech | A method for structure estimation of weighted finite-state transducers and its application to grapheme-to-phoneme conversion. | Yotaro Kubo, Takaaki Hori, Atsushi Nakamura |
| 2013 | Interspeech | Unsupervised discriminative language modeling using error rate estimator. | Takanobu Oba, Atsunori Ogawa, Takaaki Hori, Hirokazu Masataki, Atsushi Nakamura |
| 2012 | ICASSP | Handling uncertain observations in unsupervised topic-mixture language model adaptation. | Ekapol Chuangsuwanich, Shinji Watanabe, Takaaki Hori, Tomoharu Iwata, James R. Glass |
| 2012 | ICASSP | Spoken document retrieval by discriminative modeling in a high dimensional feature space. | Takanobu Oba, Takaaki Hori, Atsushi Nakamura, Akinori Ito |
| 2012 | ICASSP | Error type classification and word accuracy estimation using alignment features from word confusion network. | Atsunori Ogawa, Takaaki Hori, Atsushi Nakamura |
| 2012 | ICASSP | Bag Of ARCS: New representation of speech segment features based on finite state machines. | Shinji Watanabe, Yotaro Kubo, Takanobu Oba, Takaaki Hori, Atsushi Nakamura |
| 2012 | Interspeech | Speaker Adaptation Using Variational Bayesian Linear Regression in Normalized Feature Space. | Seong-Jun Hahm, Atsunori Ogawa, Masakiyo Fujimoto, Takaaki Hori, Atsushi Nakamura |
| 2012 | Interspeech | Efficient Beam Width Control to Suppress Excessive Speech Recognition Computation Time Based on Prior Score Range Normalization. | Satoshi Kobashikawa, Takaaki Hori, Yoshikazu Yamaguchi, Taichi Asami, Hirokazu Masataki, Satoshi Takahashi |
| 2012 | Interspeech | Integrating Deep Neural Networks into Structural Classification Approach based on Weighted Finite-State Transducers. | Yotaro Kubo, Takaaki Hori, Atsushi Nakamura |
| 2011 | ICASSP | Round-robin duel discriminative language models in one-pass decoding with on-the-fly error correction. | Takanobu Oba, Takaaki Hori, Akinori Ito, Atsushi Nakamura |
| 2011 | ICASSP | Gibbs sampling based Multi-scale Mixture Model for speaker clustering. | Shinji Watanabe, Daichi Mochihashi, Takaaki Hori, Atsushi Nakamura |
| 2010 | ICASSP | Search error risk minimization in Viterbi beam search for speech recognition. | Takaaki Hori, Shinji Watanabe, Atsushi Nakamura |
| 2010 | ICASSP | A comparative study on methods of Weighted language model training for reranking lvcsr N-best hypotheses. | Takanobu Oba, Takaaki Hori, Atsushi Nakamura |
| 2010 | ICASSP | A discriminative model for continuous speech recognition based on Weighted Finite State Transducers. | Shinji Watanabe, Takaaki Hori, Erik McDermott, Atsushi Nakamura |
| 2010 | Interspeech | Improvements of search error risk minimization in viterbi beam search for speech recognition. | Takaaki Hori, Shinji Watanabe, Atsushi Nakamura |
| 2010 | Interspeech | Round-robin discrimination model for reranking ASR hypotheses. | Takanobu Oba, Takaaki Hori, Atsushi Nakamura |
| 2010 | Interspeech | Large vocabulary continuous speech recognition using WFST-based linear classifier for structured data. | Shinji Watanabe, Takaaki Hori, Atsushi Nakamura |
| 2007 | ICASSP | Open-Vocabulary Spoken Utterance Retrieval using Confusion Networks. | Takaaki Hori, I. Lee Hetherington, Timothy J. Hazen, James R. Glass |
| 2007 | Interspeech | An approach to efficient generation of high-accuracy and compact error-corrective models for speech recognition. | Takanobu Oba, Takaaki Hori, Atsushi Nakamura |
| 2006 | ICASSP | An Extremely Large Vocabulary Approach to Named Entity Extraction from Speech. | Takaaki Hori, Atsushi Nakamura |
| 2006 | Interspeech | Sentence boundary detection using sequential dependency analysis combined with CRF-based chunking. | Takanobu Oba, Takaaki Hori, Atsushi Nakamura |
| 2005 | ICASSP | Efficient Generation of high-order context-dependent Weighted Finite State Transducers for Speech Recognition. | Mike Schuster, Takaaki Hori |
| 2005 | Interspeech | Generalized fast on-the-fly composition algorithm for WFST-based speech recognition. | Takaaki Hori, Atsushi Nakamura |
| 2005 | Interspeech | Experiments with probabilistic principal component analysis in LVCSR. | Mike Schuster, Takaaki Hori, Atsushi Nakamura |
| 2004 | Interspeech | Fast on-the-fly composition for weighted finite-state transducers in 1.8 million-word vocabulary continuous speech recognition. | Takaaki Hori, Chiori Hori, Yasuhiro Minami |
| 2003 | ACL | Spoken Interactive ODQA System: SPIQA. | Chiori Hori, Takaaki Hori, Hajime Tsukada, Hideki Isozaki, Yutaka Sasaki, Eisaku Maeda |
| 2003 | ICASSP | Deriving disambiguous queries in a spoken interactive ODQA system. | Chiori Hori, Takaaki Hori, Hideki Isozaki, Eisaku Maeda, Shigeru Katagiri, Sadaoki Furui |
| 2003 | ICASSP | Language model adaptation using WFST-based speaking-style translation. | Takaaki Hori, Daniel Willett, Yasuhiro Minami |
| 2003 | Interspeech | Evaluation method for automatic speech summarization. | Chiori Hori, Takaaki Hori, Sadaoki Furui |
| 2003 | Interspeech | Speech summarization using weighted finite-state transducers. | Takaaki Hori, Chiori Hori, Yasuhiro Minami |
| 2001 | Interspeech | Improved phoneme-history-dependent search for large-vocabulary continuous-speech recognition. | Takaaki Hori, Yoshiaki Noda, Shoichi Matsunaga |