Skip to content

Hirofumi Inaguma

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

37

Venues

8

Active years

2016–2025

Best venue rank

A*

Where they publish

Papers

37 indexed papers, newest first.

YearVenueTitleAuthors
2025EMNLPSeeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation.Weiting Tan, Jiachen Lian, Hirofumi Inaguma, Paden Tomasello, Philipp Koehn, Xutai Ma
2024ICLRMulti-resolution HuBERT: Multi-resolution Speech Self-Supervised Learning with Masked Unit Prediction.Jiatong Shi, Hirofumi Inaguma, Xutai Ma, Ilia Kulikov, Anna Y. Sun
2024InterspeechInvestigating Decoder-only Large Language Models for Speech-to-text Translation.Chao-Wei Huang, Hui Lu, Hongyu Gong, Hirofumi Inaguma, Ilia Kulikov, Ruslan Mavlyutov, Sravya Popuri
2024InterspeechMMM: Multi-Layer Multi-Residual Multi-Stream Discrete Speech Representation from Self-supervised Learning Model.Jiatong Shi, Xutai Ma, Hirofumi Inaguma, Anna Sun, Shinji Watanabe
2023ACLHybrid Transducer and Attention based Encoder-Decoder Modeling for Speech-to-Text Tasks.Yun Tang, Anna Y. Sun, Hirofumi Inaguma, Xinyue Chen, Ning Dong, Xutai Ma, Paden Tomasello, Juan Pino
2023ACLSpeech-to-Speech Translation for a Real-world Unwritten Language.Peng-Jen Chen, Kevin Tran, Yilin Yang, Jingfei Du, Justine Kao, Yu-An Chung, Paden Tomasello, Paul-Ambroise Duquenne, Holger Schwenk, Hongyu Gong, Hirofumi Inaguma, Sravya Popuri, Changhan Wang, Juan Pino, Wei-Ning Hsu, Ann Lee
2023ACLUnitY: Two-pass Direct Speech-to-speech Translation with Discrete Units.Hirofumi Inaguma, Sravya Popuri, Ilia Kulikov, Peng-Jen Chen, Changhan Wang, Yu-An Chung, Yun Tang, Ann Lee, Shinji Watanabe, Juan Pino
2023ACLSimple and Effective Unsupervised Speech Translation.Changhan Wang, Hirofumi Inaguma, Peng-Jen Chen, Ilia Kulikov, Yun Tang, Wei-Ning Hsu, Michael Auli, Juan Pino
2023ACLESPnet-ST-v2: Multipurpose Spoken Language Translation Toolkit.Brian Yan, Jiatong Shi, Yun Tang, Hirofumi Inaguma, Yifan Peng, Siddharth Dalmia, Peter Polak, Patrick Fernandes, Dan Berrebbi, Tomoki Hayashi, Xiaohui Zhang, Zhaoheng Ni, Moto Hira, Soumi Maiti, Juan Pino, Shinji Watanabe
2023ICASSPNamed Entity Detection and Injection for Direct Speech Translation.Marco Gaido, Yun Tang, Ilia Kulikov, Rongqing Huang, Hongyu Gong, Hirofumi Inaguma
2023ICASSPEnhancing Speech-To-Speech Translation with Multiple TTS Targets.Jiatong Shi, Yun Tang, Ann Lee, Hirofumi Inaguma, Changhan Wang, Juan Pino, Shinji Watanabe
2023InterspeechExploration on HuBERT with Multiple Resolution.Jiatong Shi, Yun Tang, Hirofumi Inaguma, Hongyu Gong, Juan Pino, Shinji Watanabe
2022InterspeechNon-autoregressive Error Correction for CTC-based ASR with Phone-conditioned Masked LM.Hayato Futami, Hirofumi Inaguma, Sei Ueno, Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara
2021ASRUA Study of Transducer Based End-to-End ASR with ESPnet: Architecture, Auxiliary Loss and Decoding Strategies.Florian Boyer, Yusuke Shinohara, Takaaki Ishii, Hirofumi Inaguma, Shinji Watanabe
2021ASRUASR Rescoring and Confidence Estimation with Electra.Hayato Futami, Hirofumi Inaguma, Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara
2021ASRUA Comparative Study on Non-Autoregressive Modelings for Speech-to-Text Generation.Yosuke Higuchi, Nanxin Chen, Yuya Fujita, Hirofumi Inaguma, Tatsuya Komatsu, Jaesong Lee, Jumon Nozaki, Tianzi Wang, Shinji Watanabe
2021ASRUFast-MD: Fast Multi-Decoder End-to-End Speech Translation with Non-Autoregressive Hidden Intermediates.Hirofumi Inaguma, Siddharth Dalmia, Brian Yan, Shinji Watanabe
2021ICASSPRecent Developments on Espnet Toolkit Boosted By Conformer.Pengcheng Guo, Florian Boyer, Xuankai Chang, Tomoki Hayashi, Yosuke Higuchi, Hirofumi Inaguma, Naoyuki Kamo, Chenda Li, Daniel Garcia-Romero, Jiatong Shi, Jing Shi, Shinji Watanabe, Kun Wei, Wangyou Zhang, Yuekai Zhang
2021ICASSPImproved Mask-CTC for Non-Autoregressive End-to-End ASR.Yosuke Higuchi, Hirofumi Inaguma, Shinji Watanabe, Tetsuji Ogawa, Tetsunori Kobayashi
2021ICASSPORTHROS: non-autoregressive end-to-end speech translation With dual-decoder.Hirofumi Inaguma, Yosuke Higuchi, Kevin Duh, Tatsuya Kawahara, Shinji Watanabe
2021InterspeechStableEmit: Selection Probability Discount for Reducing Emission Latency of Streaming Monotonic Attention ASR.Hirofumi Inaguma, Tatsuya Kawahara
2021InterspeechVAD-Free Streaming Hybrid CTC/Attention ASR for Unsegmented Recording.Hirofumi Inaguma, Tatsuya Kawahara
2021NAACLSource and Target Bidirectional Knowledge Distillation for End-to-end Speech Translation.Hirofumi Inaguma, Tatsuya Kawahara, Shinji Watanabe
2020ACLESPnet-ST: All-in-One Speech Translation Toolkit.Hirofumi Inaguma, Shun Kiyono, Kevin Duh, Shigeki Karita, Nelson Yalta, Tomoki Hayashi, Shinji Watanabe
2020ICASSPMinimum Latency Training Strategies for Streaming Sequence-to-Sequence ASR.Hirofumi Inaguma, Yashesh Gaur, Liang Lu, Jinyu Li, Yifan Gong
2020InterspeechEnd-to-End Speech-to-Dialog-Act Recognition.Viet-Trung Dang, Tianyu Zhao, Sei Ueno, Hirofumi Inaguma, Tatsuya Kawahara
2020InterspeechDistilling the Knowledge of BERT for Sequence-to-Sequence ASR.Hayato Futami, Hirofumi Inaguma, Sei Ueno, Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara
2020InterspeechCTC-Synchronous Training for Monotonic Attention Model.Hirofumi Inaguma, Masato Mimura, Tatsuya Kawahara
2020InterspeechEnhancing Monotonic Multihead Attention for Streaming ASR.Hirofumi Inaguma, Masato Mimura, Tatsuya Kawahara
2019ASRUMultilingual End-to-End Speech Translation.Hirofumi Inaguma, Kevin Duh, Tatsuya Kawahara, Shinji Watanabe
2019ASRUA Comparative Study on Transformer vs RNN in Speech Applications.Shigeki Karita, Xiaofei Wang, Shinji Watanabe, Takenori Yoshimura, Wangyou Zhang, Nanxin Chen, Tomoki Hayashi, Takaaki Hori, Hirofumi Inaguma, Ziyan Jiang, Masao Someki, Nelson Enrique Yalta Soplin, Ryuichi Yamamoto
2019ICASSPLanguage Model Integration Based on Memory Control for Sequence to Sequence Speech Recognition.Jaejin Cho, Shinji Watanabe, Takaaki Hori, Murali Karthick Baskar, Hirofumi Inaguma, Jess Villalba, Najim Dehak
2019ICASSPTransfer Learning of Language-independent End-to-end ASR with Language Model Fusion.Hirofumi Inaguma, Jaejin Cho, Murali Karthick Baskar, Tatsuya Kawahara, Shinji Watanabe
2018ICASSPAn End-to-End Approach to Joint Social Signal Detection and Automatic Speech Recognition.Hirofumi Inaguma, Masato Mimura, Koji Inoue, Kazuyoshi Yoshii, Tatsuya Kawahara
2018ICASSPAcoustic-to-Word Attention-Based Model Complemented with Character-Level CTC-Based Model.Sei Ueno, Hirofumi Inaguma, Masato Mimura, Tatsuya Kawahara
2017InterspeechSocial Signal Detection in Spontaneous Dialogue Using Bidirectional LSTM-CTC.Hirofumi Inaguma, Koji Inoue, Masato Mimura, Tatsuya Kawahara
2016ICMIPrediction of ice-breaking between participants using prosodic features in the first meeting dialogue.Hirofumi Inaguma, Koji Inoue, Shizuka Nakamura, Katsuya Takanashi, Tatsuya Kawahara