| 2025 | ASRU | Robot Confirmation Generation and Action Planning Using Long-context Q-Former Integrated with Multimodal LLM. | Chiori Hori, Yoshiki Masuyama, Siddarth Jain, Radu Corcodel, Devesh K. Jha, Diego Romeres, Jonathan Le Roux |
| 2025 | ICASSP | Interactive Robot Action Replanning using Multimodal LLM Trained from Human Demonstration Videos. | Chiori Hori, Motonari Kambara, Komei Sugiura, Kei Ota, Sameer Khurana, Siddarth Jain, Radu Corcodel, Devesh K. Jha, Diego Romeres, Jonathan Le Roux |
| 2025 | Interspeech | Factorized RVQ-GAN For Disentangled Speech Tokenization. | Sameer Khurana, Dominik Klement, Antoine Laurent, Dominik Bobos, Juraj Novosad, Peter Gazdik, Ellen Zhang, Zili Huang, Amir Hussein, Ricard Marxer, Yoshiki Masuyama, Ryo Aihara, Chiori Hori, Franois G. Germain, Gordon Wichern, Jonathan Le Roux |
| 2024 | ICASSP | Generation or Replication: Auscultating Audio Latent Diffusion Models. | Dimitrios Bralios, Gordon Wichern, Franois G. Germain, Zexu Pan, Sameer Khurana, Chiori Hori, Jonathan Le Roux |
| 2024 | ICASSP | WI-FI based Indoor Monitoring Enhanced by Multimodal Fusion. | Chiori Hori, Pu Wang, Mahbub Rahman, Cristian J. Vaca-Rubio, Sameer Khurana, Anoop Cherian, Jonathan Le Roux |
| 2024 | ICASSP | NIIRF: Neural IIR Filter Field for HRTF Upsampling and Personalization. | Yoshiki Masuyama, Gordon Wichern, Franois G. Germain, Zexu Pan, Sameer Khurana, Chiori Hori, Jonathan Le Roux |
| 2024 | Interspeech | ZeroST: Zero-Shot Speech Translation. | Sameer Khurana, Chiori Hori, Antoine Laurent, Gordon Wichern, Jonathan Le Roux |
| 2024 | ICRA | Interactive Planning Using Large Language Models for Partially Observable Robotic Tasks. | Lingfeng Sun, Devesh K. Jha, Chiori Hori, Siddarth Jain, Radu Corcodel, Xinghao Zhu, Masayoshi Tomizuka, Diego Romeres |
| 2023 | ASRU | Scenario-Aware Audio-Visual TF-Gridnet for Target Speech Extraction. | Zexu Pan, Gordon Wichern, Yoshiki Masuyama, Franois G. Germain, Sameer Khurana, Chiori Hori, Jonathan Le Roux |
| 2023 | Interspeech | Style-transfer based Speech and Audio-visual Scene understanding for Robot Action Sequence Acquisition from Videos. | Chiori Hori, Puyuan Peng, David Harwath, Xinyu Liu, Kei Ota, Siddarth Jain, Radu Corcodel, Devesh K. Jha, Diego Romeres, Jonathan Le Roux |
| 2022 | AAAI | (2.5+1)D Spatio-Temporal Scene Graphs for Video Question Answering. | Anoop Cherian, Chiori Hori, Tim K. Marks, Jonathan Le Roux |
| 2022 | ICASSP | Audio-Visual Scene-Aware Dialog and Reasoning Using Audio-Visual Transformers with Joint Student-Teacher Learning. | Ankit P. Shah, Shijie Geng, Peng Gao, Anoop Cherian, Takaaki Hori, Tim K. Marks, Jonathan Le Roux, Chiori Hori |
| 2022 | Interspeech | Low-Latency Online Streaming VideoQA Using Audio-Visual Transformers. | Chiori Hori, Takaaki Hori, Jonathan Le Roux |
| 2021 | AAAI | Dynamic Graph Representation Learning for Video Dialog via Multi-Modal Shuffled Transformers. | Shijie Geng, Peng Gao, Moitreya Chatterjee, Chiori Hori, Jonathan Le Roux, Yongfeng Zhang, Hongsheng Li, Anoop Cherian |
| 2021 | Interspeech | Optimizing Latency for Online Video Captioning Using Audio-Visual Transformers. | Chiori Hori, Takaaki Hori, Jonathan Le Roux |
| 2021 | Interspeech | Advanced Long-Context End-to-End Speech Recognition Using Context-Expanded Transformers. | Takaaki Hori, Niko Moritz, Chiori Hori, Jonathan Le Roux |
| 2020 | ICASSP | Multi-Layer Content Interaction Through Quaternion Product for Visual Question Answering. | Lei Shi, Shijie Geng, Kai Shuang, Chiori Hori, Songxiang Liu, Peng Gao, Sen Su |
| 2020 | Interspeech | Transformer-Based Long-Context End-to-End Speech Recognition. | Takaaki Hori, Niko Moritz, Chiori Hori, Jonathan Le Roux |
| 2020 | WACV | Spatio-Temporal Ranked-Attention Networks for Video Captioning. | Anoop Cherian, Jue Wang, Chiori Hori, Tim K. Marks |
| 2019 | CVPR | Audio Visual Scene-Aware Dialog. | Huda AlAmri, Vincent Cartillier, Abhishek Das, Jue Wang, Anoop Cherian, Irfan Essa, Dhruv Batra, Tim K. Marks, Chiori Hori, Peter Anderson, Stefan Lee, Devi Parikh |
| 2019 | ICASSP | End-to-end Audio Visual Scene-aware Dialog Using Multimodal Attention-based Video Features. | Chiori Hori, Huda AlAmri, Jue Wang, Gordon Wichern, Takaaki Hori, Anoop Cherian, Tim K. Marks, Vincent Cartillier, Raphael Gontijo Lopes, Abhishek Das, Irfan Essa, Dhruv Batra, Devi Parikh |
| 2019 | Interspeech | Joint Student-Teacher Learning for Audio-Visual Scene-Aware Dialog. | Chiori Hori, Anoop Cherian, Tim K. Marks, Takaaki Hori |
| 2018 | CVPR | Multimodal Attention for Fusion of Audio and Spatiotemporal Features for Video Description. | Chiori Hori, Takaaki Hori, Gordon Wichern, Jue Wang, Teng-Yok Lee, Anoop Cherian, Tim K. Marks |
| 2017 | ASRU | Early and late integration of audio features for automatic video description. | Chiori Hori, Takaaki Hori, Tim K. Marks, John R. Hershey |
| 2017 | ICCV | Attention-Based Multimodal Fusion for Video Description. | Chiori Hori, Takaaki Hori, Teng-Yok Lee, Ziming Zhang, Bret Harsham, John R. Hershey, Tim K. Marks, Kazuhiro Sumi |
| 2016 | ICASSP | Minimum word error training of long short-term memory recurrent neural network language models for speech recognition. | Takaaki Hori, Chiori Hori, Shinji Watanabe, John R. Hershey |
| 2016 | Interspeech | Context-Sensitive and Role-Dependent Spoken Language Understanding Using Bidirectional and Attention LSTMs. | Chiori Hori, Takaaki Hori, Shinji Watanabe, John R. Hershey |
| 2015 | ICASSP | Extraction of pitch register from expressive speech in Japanese. | Jinfu Ni, Yoshinori Shiga, Chiori Hori |
| 2015 | ICASSP | Speaker adaptive training for deep neural networks embedding linear transformation networks. | Tsubasa Ochiai, Shigeki Matsuda, Hideyuki Watanabe, Xugang Lu, Chiori Hori, Shigeru Katagiri |
| 2015 | Interspeech | Sparse representation with temporal max-smoothing for acoustic event detection. | Xugang Lu, Peng Shen, Yu Tsao, Chiori Hori, Hisashi Kawai |
| 2015 | Interspeech | HMM based myanmar text to speech system. | Ye Kyaw Thu, Win Pa Pa, Jinfu Ni, Yoshinori Shiga, Andrew M. Finch, Chiori Hori, Hisashi Kawai, Eiichiro Sumita |
| 2014 | COLING | Recurrent Neural Network-based Tuple Sequence Model for Machine Translation. | Youzheng Wu, Taro Watanabe, Chiori Hori |
| 2014 | ICASSP | Semantic context inference for spoken document retrieval using term association matrices. | Chien-Lin Huang, Chiori Hori |
| 2014 | ICASSP | Sparse representation based on a bag of spectral exemplars for acoustic event detection. | Xugang Lu, Yu Tsao, Shigeki Matsuda, Chiori Hori |
| 2014 | ICASSP | Speaker Adaptive Training using Deep Neural Networks. | Tsubasa Ochiai, Shigeki Matsuda, Xugang Lu, Chiori Hori, Shigeru Katagiri |
| 2014 | ICASSP | Translating TED speeches by recurrent neural network based translation model. | Youzheng Wu, Xinhui Hu, Chiori Hori |
| 2014 | Interspeech | Ensemble modeling of denoising autoencoder for speech spectrum restoration. | Xugang Lu, Yu Tsao, Shigeki Matsuda, Chiori Hori |
| 2014 | ICRA | Non-monologue HMM-based speech synthesis for service robots: A cloud robotics approach. | Komei Sugiura, Yoshinori Shiga, Hisashi Kawai, Teruhisa Misu, Chiori Hori |
| 2013 | ICASSP | Semantic inference based on neural probabilistic language modeling for speech indexing. | Chien-Lin Huang, Chiori Hori, Hideki Kashioka |
| 2013 | ICASSP | Speaker clustering using vector representation with long-term feature for lecture speech recognition. | Chien-Lin Huang, Chiori Hori, Hideki Kashioka, Bin Ma |
| 2013 | ICASSP | Joint analysis of vocal tract length and temporal information for robust speech recognition. | Chien-Lin Huang, Chiori Hori, Hideki Kashioka, Bin Ma |
| 2013 | Interspeech | A lecture transcription system combining neural network acoustic and language models. | Peter Bell, Hitoshi Yamamoto, Pawel Swietojanski, Youzheng Wu, Fergus McInnes, Chiori Hori, Steve Renals |
| 2013 | Interspeech | Speech spectrum restoration based on conditional restricted boltzmann machine. | Xugang Lu, Shigeki Matsuda, Chiori Hori |
| 2013 | Interspeech | Speech enhancement based on deep denoising autoencoder. | Xugang Lu, Yu Tsao, Shigeki Matsuda, Chiori Hori |
| 2013 | Interspeech | A targets-based superpositional model of fundamental frequency contours applied to HMM-based speech synthesis. | Jinfu Ni, Yoshinori Shiga, Chiori Hori, Yutaka Kidawara |
| 2013 | Interspeech | Cross-lingual acoustic model adaptation based on transfer vector field smoothing with MAP. | Masahiro Saiko, Shigeki Matsuda, Ken Hanazawa, Ryosuke Isotani, Chiori Hori |
| 2013 | MDM | Multilingual Speech-to-Speech Translation System: VoiceTra. | Shigeki Matsuda, Xinhui Hu, Yoshinori Shiga, Hideki Kashioka, Chiori Hori, Keiji Yasuda, Hideo Okuma, Masao Uchiyama, Eiichiro Sumita, Hisashi Kawai, Satoshi Nakamura |
| 2013 | MDM | WFST-Based Spoken Dialogue System on Smartphones - Its Development and Implementation for Field Use. | Etsuo Mizukami, Teruhisa Misu, Chiori Hori |
| 2012 | COLING | Factored Language Model based on Recurrent Neural Network. | Youzheng Wu, Xugang Lu, Hitoshi Yamamoto, Shigeki Matsuda, Chiori Hori, Hideki Kashioka |
| 2012 | ICASSP | A comparison of dynamic WFST decoding approaches. | Paul R. Dixon, Chiori Hori, Hideki Kashioka |
| 2012 | ICASSP | A linear projection approach to environment modeling for robust speech recognition. | Yu Tsao, Chien-Lin Huang, Shigeki Matsuda, Chiori Hori, Hideki Kashioka |
| 2012 | Interspeech | A Specialized WFST Approach for Class Models and Dynamic Vocabulary. | Paul R. Dixon, Chiori Hori, Hideki Kashioka |
| 2012 | Interspeech | Ensemble Classifiers Using Unsupervised Data Selection for Speaker Recognition. | Chien-Lin Huang, Chiori Hori, Hideki Kashioka, Bin Ma |
| 2012 | Interspeech | Speech restoration based on deep learning autoencoder with layer-wised pretraining. | Xugang Lu, Shigeki Matsuda, Chiori Hori, Hideki Kashioka |
| 2012 | Interspeech | Improving WFST-based G2P Conversion with Alignment Constraints and RNNLM N-best Rescoring. | Josef R. Novak, Nobuaki Minematsu, Keikichi Hirose, Chiori Hori, Hideki Kashioka, Paul R. Dixon |
| 2012 | Interspeech | Leveraging Social Annotation for Topic Language Model Adaptation. | Youzheng Wu, Kazuhiko Abe, Paul R. Dixon, Chiori Hori, Hideki Kashioka |
| 2012 | Interspeech | Tied-State Mixture Language Model for WFST-based Speech Recognition. | Hitoshi Yamamoto, Paul R. Dixon, Shigeki Matsuda, Chiori Hori, Hideki Kashioka |
| 2011 | IJCNLP | Improving Related Entity Finding via Incorporating Homepages and Recognizing Fine-grained Entities. | Youzheng Wu, Chiori Hori, Hisashi Kawai, Hideki Kashioka |
| 2011 | IJCNLP | Answering Complex Questions via Exploiting Social Q&A Collection. | Youzheng Wu, Chiori Hori, Hisashi Kawai, Hideki Kashioka |
| 2011 | Interspeech | User Study of Spoken Decision Support System. | Teruhisa Misu, Kiyonori Ohtake, Chiori Hori, Hisashi Kawai, Satoshi Nakamura |
| 2011 | Interspeech | Incorporating Regional Information to Enhance MAP-Based Stochastic Feature Compensation for Robust Speech Recognition. | Yu Tsao, Paul R. Dixon, Chiori Hori, Hisashi Kawai |
| 2010 | LREC | Dialogue Acts Annotation for NICT Kyoto Tour Dialogue Corpus to Construct Statistical Dialogue Systems. | Kiyonori Ohtake, Teruhisa Misu, Chiori Hori, Hideki Kashioka, Satoshi Nakamura |
| 2010 | SIGdial | Modeling Spoken Decision Making Dialogue and Optimization of its Dialogue Strategy. | Teruhisa Misu, Komei Sugiura, Kiyonori Ohtake, Chiori Hori, Hideki Kashioka, Hisashi Kawai, Satoshi Nakamura |
| 2009 | ASRU | Weighted finite state transducer based statistical dialog management. | Chiori Hori, Kiyonori Ohtake, Teruhisa Misu, Hideki Kashioka, Satoshi Nakamura |
| 2009 | ASRU | The Asian network-based speech-to-speech translation system. | Sakriani Sakti, Noriyuki Kimura, Michael Paul, Chiori Hori, Eiichiro Sumita, Satoshi Nakamura, Jun Park, Chai Wutiwiwatchai, Bo Xu, Hammam Riza, Karunesh Arora, Chi Mai Luong, Haizhou Li |
| 2009 | ICASSP | Statistical dialog management applied to WFST-based dialog systems. | Chiori Hori, Kiyonori Ohtake, Teruhisa Misu, Hideki Kashioka, Satoshi Nakamura |
| 2009 | Interspeech | Recent advances in WFST-based dialog system. | Chiori Hori, Kiyonori Ohtake, Teruhisa Misu, Hideki Kashioka, Satoshi Nakamura |
| 2009 | Interspeech | Annotating communicative function and semantic content in dialogue act for construction of consulting dialogue systems. | Teruhisa Misu, Kiyonori Ohtake, Chiori Hori, Hideki Kashioka, Satoshi Nakamura |
| 2008 | Interspeech | Dialog management using weighted finite-state transducers. | Chiori Hori, Kiyonori Ohtake, Teruhisa Misu, Hideki Kashioka, Satoshi Nakamura |
| 2008 | Interspeech | Detection of feeling through back-channels in spoken dialogue. | Tatsuya Kawahara, Masayoshi Toyokura, Teruhisa Misu, Chiori Hori |
| 2007 | ASRU | Consolidation based speech translation. | Chiori Hori, Bing Zhao, Stephan Vogel, Alex Waibel |
| 2005 | Interspeech | Spontaneous speech consolidation for spoken language applications. | Chiori Hori, Alex Waibel |
| 2004 | Interspeech | Fast on-the-fly composition for weighted finite-state transducers in 1.8 million-word vocabulary continuous speech recognition. | Takaaki Hori, Chiori Hori, Yasuhiro Minami |
| 2003 | ACL | Spoken Interactive ODQA System: SPIQA. | Chiori Hori, Takaaki Hori, Hajime Tsukada, Hideki Isozaki, Yutaka Sasaki, Eisaku Maeda |
| 2003 | ICASSP | Deriving disambiguous queries in a spoken interactive ODQA system. | Chiori Hori, Takaaki Hori, Hideki Isozaki, Eisaku Maeda, Shigeru Katagiri, Sadaoki Furui |
| 2003 | ICASSP | Automatic speech summarization based on sentence extraction and compaction. | Tomonori Kikuchi, Sadaoki Furui, Chiori Hori |
| 2003 | Interspeech | Evaluation method for automatic speech summarization. | Chiori Hori, Takaaki Hori, Sadaoki Furui |
| 2003 | Interspeech | Speech summarization using weighted finite-state transducers. | Takaaki Hori, Chiori Hori, Yasuhiro Minami |
| 2002 | ICASSP | Automatic speech summarization applied to English broadcast news speech. | Chiori Hori, Sadaoki Furui, Robert G. Malkin, Hua Yu, Alex Waibel |
| 2001 | ICASSP | Ubiquitous speech processing. | Sadaoki Furui, Koji Iwano, Chiori Hori, Takahiro Shinozaki, Yohei Saito, Satoshi Tamura |
| 2001 | Interspeech | Advances in automatic speech summarization. | Chiori Hori, Sadaoki Furui |
| 2001 | Interspeech | Towards automatic transcription of spontaneous presentations. | Takahiro Shinozaki, Chiori Hori, Sadaoki Furui |
| 2000 | ICASSP | Automatic speech summarization based on word significance and linguistic likelihood. | Chiori Hori, Sadaoki Furui |
| 2000 | Interspeech | Improvements in automatic speech summarization and evaluation methods. | Chiori Hori, Sadaoki Furui |
| 2000 | Interspeech | Language modeling by stochastic dependency grammar for Japanese speech recognition. | Akinori Ito, Chiori Hori, Masaharu Katoh, Masaki Kohda |