Hirofumi Inaguma
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
37
Venues
8
Active years
2016–2025
Best venue rank
A*
Where they publish
Papers
37 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2025 | EMNLP | Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation. | Weiting Tan, Jiachen Lian, Hirofumi Inaguma, Paden Tomasello, Philipp Koehn, Xutai Ma |
| 2024 | ICLR | Multi-resolution HuBERT: Multi-resolution Speech Self-Supervised Learning with Masked Unit Prediction. | Jiatong Shi, Hirofumi Inaguma, Xutai Ma, Ilia Kulikov, Anna Y. Sun |
| 2024 | Interspeech | Investigating Decoder-only Large Language Models for Speech-to-text Translation. | Chao-Wei Huang, Hui Lu, Hongyu Gong, Hirofumi Inaguma, Ilia Kulikov, Ruslan Mavlyutov, Sravya Popuri |
| 2024 | Interspeech | MMM: Multi-Layer Multi-Residual Multi-Stream Discrete Speech Representation from Self-supervised Learning Model. | Jiatong Shi, Xutai Ma, Hirofumi Inaguma, Anna Sun, Shinji Watanabe |
| 2023 | ACL | Hybrid Transducer and Attention based Encoder-Decoder Modeling for Speech-to-Text Tasks. | Yun Tang, Anna Y. Sun, Hirofumi Inaguma, Xinyue Chen, Ning Dong, Xutai Ma, Paden Tomasello, Juan Pino |
| 2023 | ACL | Speech-to-Speech Translation for a Real-world Unwritten Language. | Peng-Jen Chen, Kevin Tran, Yilin Yang, Jingfei Du, Justine Kao, Yu-An Chung, Paden Tomasello, Paul-Ambroise Duquenne, Holger Schwenk, Hongyu Gong, Hirofumi Inaguma, Sravya Popuri, Changhan Wang, Juan Pino, Wei-Ning Hsu, Ann Lee |
| 2023 | ACL | UnitY: Two-pass Direct Speech-to-speech Translation with Discrete Units. | Hirofumi Inaguma, Sravya Popuri, Ilia Kulikov, Peng-Jen Chen, Changhan Wang, Yu-An Chung, Yun Tang, Ann Lee, Shinji Watanabe, Juan Pino |
| 2023 | ACL | Simple and Effective Unsupervised Speech Translation. | Changhan Wang, Hirofumi Inaguma, Peng-Jen Chen, Ilia Kulikov, Yun Tang, Wei-Ning Hsu, Michael Auli, Juan Pino |
| 2023 | ACL | ESPnet-ST-v2: Multipurpose Spoken Language Translation Toolkit. | Brian Yan, Jiatong Shi, Yun Tang, Hirofumi Inaguma, Yifan Peng, Siddharth Dalmia, Peter Polak, Patrick Fernandes, Dan Berrebbi, Tomoki Hayashi, Xiaohui Zhang, Zhaoheng Ni, Moto Hira, Soumi Maiti, Juan Pino, Shinji Watanabe |
| 2023 | ICASSP | Named Entity Detection and Injection for Direct Speech Translation. | Marco Gaido, Yun Tang, Ilia Kulikov, Rongqing Huang, Hongyu Gong, Hirofumi Inaguma |
| 2023 | ICASSP | Enhancing Speech-To-Speech Translation with Multiple TTS Targets. | Jiatong Shi, Yun Tang, Ann Lee, Hirofumi Inaguma, Changhan Wang, Juan Pino, Shinji Watanabe |
| 2023 | Interspeech | Exploration on HuBERT with Multiple Resolution. | Jiatong Shi, Yun Tang, Hirofumi Inaguma, Hongyu Gong, Juan Pino, Shinji Watanabe |
| 2022 | Interspeech | Non-autoregressive Error Correction for CTC-based ASR with Phone-conditioned Masked LM. | Hayato Futami, Hirofumi Inaguma, Sei Ueno, Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara |
| 2021 | ASRU | A Study of Transducer Based End-to-End ASR with ESPnet: Architecture, Auxiliary Loss and Decoding Strategies. | Florian Boyer, Yusuke Shinohara, Takaaki Ishii, Hirofumi Inaguma, Shinji Watanabe |
| 2021 | ASRU | ASR Rescoring and Confidence Estimation with Electra. | Hayato Futami, Hirofumi Inaguma, Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara |
| 2021 | ASRU | A Comparative Study on Non-Autoregressive Modelings for Speech-to-Text Generation. | Yosuke Higuchi, Nanxin Chen, Yuya Fujita, Hirofumi Inaguma, Tatsuya Komatsu, Jaesong Lee, Jumon Nozaki, Tianzi Wang, Shinji Watanabe |
| 2021 | ASRU | Fast-MD: Fast Multi-Decoder End-to-End Speech Translation with Non-Autoregressive Hidden Intermediates. | Hirofumi Inaguma, Siddharth Dalmia, Brian Yan, Shinji Watanabe |
| 2021 | ICASSP | Recent Developments on Espnet Toolkit Boosted By Conformer. | Pengcheng Guo, Florian Boyer, Xuankai Chang, Tomoki Hayashi, Yosuke Higuchi, Hirofumi Inaguma, Naoyuki Kamo, Chenda Li, Daniel Garcia-Romero, Jiatong Shi, Jing Shi, Shinji Watanabe, Kun Wei, Wangyou Zhang, Yuekai Zhang |
| 2021 | ICASSP | Improved Mask-CTC for Non-Autoregressive End-to-End ASR. | Yosuke Higuchi, Hirofumi Inaguma, Shinji Watanabe, Tetsuji Ogawa, Tetsunori Kobayashi |
| 2021 | ICASSP | ORTHROS: non-autoregressive end-to-end speech translation With dual-decoder. | Hirofumi Inaguma, Yosuke Higuchi, Kevin Duh, Tatsuya Kawahara, Shinji Watanabe |
| 2021 | Interspeech | StableEmit: Selection Probability Discount for Reducing Emission Latency of Streaming Monotonic Attention ASR. | Hirofumi Inaguma, Tatsuya Kawahara |
| 2021 | Interspeech | VAD-Free Streaming Hybrid CTC/Attention ASR for Unsegmented Recording. | Hirofumi Inaguma, Tatsuya Kawahara |
| 2021 | NAACL | Source and Target Bidirectional Knowledge Distillation for End-to-end Speech Translation. | Hirofumi Inaguma, Tatsuya Kawahara, Shinji Watanabe |
| 2020 | ACL | ESPnet-ST: All-in-One Speech Translation Toolkit. | Hirofumi Inaguma, Shun Kiyono, Kevin Duh, Shigeki Karita, Nelson Yalta, Tomoki Hayashi, Shinji Watanabe |
| 2020 | ICASSP | Minimum Latency Training Strategies for Streaming Sequence-to-Sequence ASR. | Hirofumi Inaguma, Yashesh Gaur, Liang Lu, Jinyu Li, Yifan Gong |
| 2020 | Interspeech | End-to-End Speech-to-Dialog-Act Recognition. | Viet-Trung Dang, Tianyu Zhao, Sei Ueno, Hirofumi Inaguma, Tatsuya Kawahara |
| 2020 | Interspeech | Distilling the Knowledge of BERT for Sequence-to-Sequence ASR. | Hayato Futami, Hirofumi Inaguma, Sei Ueno, Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara |
| 2020 | Interspeech | CTC-Synchronous Training for Monotonic Attention Model. | Hirofumi Inaguma, Masato Mimura, Tatsuya Kawahara |
| 2020 | Interspeech | Enhancing Monotonic Multihead Attention for Streaming ASR. | Hirofumi Inaguma, Masato Mimura, Tatsuya Kawahara |
| 2019 | ASRU | Multilingual End-to-End Speech Translation. | Hirofumi Inaguma, Kevin Duh, Tatsuya Kawahara, Shinji Watanabe |
| 2019 | ASRU | A Comparative Study on Transformer vs RNN in Speech Applications. | Shigeki Karita, Xiaofei Wang, Shinji Watanabe, Takenori Yoshimura, Wangyou Zhang, Nanxin Chen, Tomoki Hayashi, Takaaki Hori, Hirofumi Inaguma, Ziyan Jiang, Masao Someki, Nelson Enrique Yalta Soplin, Ryuichi Yamamoto |
| 2019 | ICASSP | Language Model Integration Based on Memory Control for Sequence to Sequence Speech Recognition. | Jaejin Cho, Shinji Watanabe, Takaaki Hori, Murali Karthick Baskar, Hirofumi Inaguma, Jess Villalba, Najim Dehak |
| 2019 | ICASSP | Transfer Learning of Language-independent End-to-end ASR with Language Model Fusion. | Hirofumi Inaguma, Jaejin Cho, Murali Karthick Baskar, Tatsuya Kawahara, Shinji Watanabe |
| 2018 | ICASSP | An End-to-End Approach to Joint Social Signal Detection and Automatic Speech Recognition. | Hirofumi Inaguma, Masato Mimura, Koji Inoue, Kazuyoshi Yoshii, Tatsuya Kawahara |
| 2018 | ICASSP | Acoustic-to-Word Attention-Based Model Complemented with Character-Level CTC-Based Model. | Sei Ueno, Hirofumi Inaguma, Masato Mimura, Tatsuya Kawahara |
| 2017 | Interspeech | Social Signal Detection in Spontaneous Dialogue Using Bidirectional LSTM-CTC. | Hirofumi Inaguma, Koji Inoue, Masato Mimura, Tatsuya Kawahara |
| 2016 | ICMI | Prediction of ice-breaking between participants using prosodic features in the first meeting dialogue. | Hirofumi Inaguma, Koji Inoue, Shizuka Nakamura, Katsuya Takanashi, Tatsuya Kawahara |