| 2026 | AAAI | Difference Vector Equalization for Robust Fine-tuning of Vision-Language Models. | Satoshi Suzuki, Shin'ya Yamaguchi, Shoichiro Takeda, Taiga Yamane, Naoki Makishima, Naotaka Kawata, Mana Ihori, Tomohiro Tanaka, Shota Orihashi, Ryo Masumura |
| 2026 | WACV | Distribution Highlighted Reference-based Label Distribution Learning for Facial Age Estimation. | Satoshi Suzuki, Shin'ya Yamaguchi, Shoichiro Takeda, Takuhiro Kaneko, Shota Orihashi, Ryo Masumura |
| 2025 | AAAI | Multimodal Fine-Grained Apparent Personality Trait Recognition: Joint Modeling of Big Five and Questionnaire Item-level Scores. | Ryo Masumura, Shota Orihashi, Mana Ihori, Tomohiro Tanaka, Naoki Makishima, Satoshi Suzuki, Saki Mizuno, Nobukatsu Hojo |
| 2025 | AAAI | ToMATO: Verbalizing the Mental States of Role-Playing LLMs for Benchmarking Theory of Mind. | Kazutoshi Shinoda, Nobukatsu Hojo, Kyosuke Nishida, Saki Mizuno, Keita Suzuki, Ryo Masumura, Hiroaki Sugiyama, Kuniko Saito |
| 2025 | ASRU | Few-shot Personalization via In-Context Learning for Speech Emotion Recognition based on Speech-Language Model. | Mana Ihori, Taiga Yamane, Naotaka Kawata, Naoki Makishima, Tomohiro Tanaka, Satoshi Suzuki, Shota Orihashi, Ryo Masumura |
| 2025 | ASRU | Phoneme Overlapping-Aware Pre-Training with External Text Resources for Multi-Talker ASR. | Ryo Masumura, Tomohiro Tanaka, Naoki Makishima, Mana Ihori, Shota Orihashi, Naotaka Kawata, Taiga Yamane, Satoshi Suzuki, Takafumi Moriya |
| 2025 | ASRU | All-in-One ASR: Unifying Encoder-Decoder Models of CTC, Attention, and Transducer in Dual-Mode ASR. | Takafumi Moriya, Masato Mimura, Tomohiro Tanaka, Hiroshi Sato, Ryo Masumura, Atsunori Ogawa |
| 2025 | ICASSP | Alignment-Free Training for Transducer-based Multi-Talker ASR. | Takafumi Moriya, Shota Horiguchi, Marc Delcroix, Ryo Masumura, Takanori Ashihara, Hiroshi Sato, Kohei Matsuura, Masato Mimura |
| 2025 | ICCV | MVTrajecter: Multi-View Pedestrian Tracking With Trajectory Motion Cost and Trajectory Appearance Cost. | Taiga Yamane, Ryo Masumura, Satoshi Suzuki, Shota Orihashi |
| 2025 | Interspeech | Leveraging LLMs for Written to Spoken Style Data Transformation to Enhance Spoken Dialog State Tracking. | Haris Gulzar, Monikka Roslianna Busto, Akiko Masaki, Takeharu Eda, Ryo Masumura |
| 2025 | Interspeech | Unified Audio-Visual Modeling for Recognizing Which Face Spoke When and What in Multi-Talker Overlapped Speech and Video. | Naoki Makishima, Naotaka Kawata, Taiga Yamane, Mana Ihori, Tomohiro Tanaka, Satoshi Suzuki, Shota Orihashi, Ryo Masumura |
| 2025 | Interspeech | SOMSRED-SVC: Sequential Output Modeling with Speaker Vector Constraints for Joint Multi-Talker Overlapped ASR and Speaker Diarization. | Naoki Makishima, Naotaka Kawata, Taiga Yamane, Mana Ihori, Tomohiro Tanaka, Satoshi Suzuki, Shota Orihashi, Ryo Masumura |
| 2024 | ICASSP | Talking Face Generation for Impression Conversion Considering Speech Semantics. | Saki Mizuno, Nobukatsu Hojo, Kazutoshi Shinoda, Keita Suzuki, Mana Ihori, Hiroshi Sato, Tomohiro Tanaka, Naotaka Kawata, Satoshi Kobashikawa, Ryo Masumura |
| 2024 | ICIP | Scene Generalized Multi-View Pedestrian Detection with Rotation-Based Augmentation and Regularization. | Satoshi Suzuki, Shotaro Tora, Ryo Masumura |
| 2024 | ICIP | MVAFormer: RGB-Based Multi-View Spatio-Temporal Action Recognition with Transformer. | Taiga Yamane, Satoshi Suzuki, Ryo Masumura, Shotaro Tora |
| 2024 | ICPR | Born-Again Multi-task Self-training for Multi-task Facial Emotion Recognition. | Ryo Masumura, Akihiko Takashima, Satoshi Suzuki, Shota Orihashi |
| 2024 | Interspeech | Factor-Conditioned Speaking-Style Captioning. | Atsushi Ando, Takafumi Moriya, Shota Horiguchi, Ryo Masumura |
| 2024 | Interspeech | SOMSRED: Sequential Output Modeling for Joint Multi-talker Overlapped Speech Recognition and Speaker Diarization. | Naoki Makishima, Naotaka Kawata, Mana Ihori, Tomohiro Tanaka, Shota Orihashi, Atsushi Ando, Ryo Masumura |
| 2024 | Interspeech | Unified Multi-Talker ASR with and without Target-speaker Enrollment. | Ryo Masumura, Naoki Makishima, Tomohiro Tanaka, Mana Ihori, Naotaka Kawata, Shota Orihashi, Kazutoshi Shinoda, Taiga Yamane, Saki Mizuno, Keita Suzuki, Satoshi Suzuki, Nobukatsu Hojo, Takafumi Moriya, Atsushi Ando |
| 2024 | Interspeech | Boosting Hybrid Autoregressive Transducer-based ASR with Internal Acoustic Model Training and Dual Blank Thresholding. | Takafumi Moriya, Takanori Ashihara, Masato Mimura, Hiroshi Sato, Kohei Matsuura, Ryo Masumura, Taichi Asami |
| 2024 | Interspeech | Learning from Multiple Annotator Biased Labels in Multimodal Conversation. | Kazutoshi Shinoda, Nobukatsu Hojo, Saki Mizuno, Keita Suzuki, Satoshi Kobashikawa, Ryo Masumura |
| 2024 | Interspeech | Participant-Pair-Wise Bottleneck Transformer for Engagement Estimation from Video Conversation. | Keita Suzuki, Nobukatsu Hojo, Kazutoshi Shinoda, Saki Mizuno, Ryo Masumura |
| 2023 | ICASSP | Modeling Lead-Lag Structure in Facial Expression Synchrony for Social-Psychological Outcome Prediction from Negotiation Interaction. | Nobukatsu Hojo, Saki Mizuno, Satoshi Kobashikawa, Ryo Masumura |
| 2023 | ICASSP | Leveraging Large Text Corpora For End-To-End Speech Summarization. | Kohei Matsuura, Takanori Ashihara, Takafumi Moriya, Tomohiro Tanaka, Atsunori Ogawa, Marc Delcroix, Ryo Masumura |
| 2023 | ICASSP | Next-Speaker Prediction Based on Non-Verbal Information in Multi-Party Video Conversation. | Saki Mizuno, Nobukatsu Hojo, Satoshi Kobashikawa, Ryo Masumura |
| 2023 | ICASSP | Improving Scheduled Sampling for Neural Transducer-Based ASR. | Takafumi Moriya, Takanori Ashihara, Hiroshi Sato, Kohei Matsuura, Tomohiro Tanaka, Ryo Masumura |
| 2023 | ICASSP | Leveraging Language Embeddings for Cross-Lingual Self-Supervised Speech Representation Learning. | Tomohiro Tanaka, Ryo Masumura, Mana Ihori, Hiroshi Sato, Taiga Yamane, Takanori Ashihara, Kohei Matsuura, Takafumi Moriya |
| 2023 | ICCV | Adversarial Finetuning with Latent Representation Constraint to Mitigate Accuracy-Robustness Tradeoff. | Satoshi Suzuki, Shin'ya Yamaguchi, Shoichiro Takeda, Sekitoshi Kanai, Naoki Makishima, Atsushi Ando, Ryo Masumura |
| 2023 | ICIP | Distilling Knowledge of Bidirectional Language Model for Scene Text Recognition. | Shota Orihashi, Yoshihiro Yamazaki, Mihiro Uchida, Akihiko Takashima, Ryo Masumura |
| 2023 | ICIP | OnDA-DETR: Online Domain Adaptation for Detection Transformers with Self-Training Framework. | Satoshi Suzuki, Taiga Yamane, Naoki Makishima, Keita Suzuki, Atsushi Ando, Ryo Masumura |
| 2023 | ICIP | Open-Set Recognition for Facial-Expression Recognition. | Mihiro Uchida, Shota Orihashi, Akihiko Takashima, Yoshihiro Yamazaki, Ryo Masumura |
| 2023 | INLG | Retrieval, Masking, and Generation: Feedback Comment Generation using Masked Comment Examples. | Mana Ihori, Hiroshi Sato, Tomohiro Tanaka, Ryo Masumura |
| 2023 | Interspeech | Audio-Visual Praise Estimation for Conversational Video based on Synchronization-Guided Multimodal Transformer. | Nobukatsu Hojo, Saki Mizuno, Satoshi Kobashikawa, Ryo Masumura, Mana Ihori, Hiroshi Sato, Tomohiro Tanaka |
| 2023 | Interspeech | Transcribing Speech as Spoken and Written Dual Text Using an Autoregressive Model. | Mana Ihori, Hiroshi Sato, Tomohiro Tanaka, Ryo Masumura, Saki Mizuno, Nobukatsu Hojo |
| 2023 | Interspeech | What are differences? Comparing DNN and Human by Their Performance and Characteristics in Speaker Age Estimation. | Yuki Kitagishi, Naohiro Tawara, Atsunori Ogawa, Ryo Masumura, Taichi Asami |
| 2023 | Interspeech | Joint Autoregressive Modeling of End-to-End Multi-Talker Overlapped Speech Recognition and Utterance-level Timestamp Prediction. | Naoki Makishima, Keita Suzuki, Satoshi Suzuki, Atsushi Ando, Ryo Masumura |
| 2023 | Interspeech | End-to-End Joint Target and Non-Target Speakers ASR. | Ryo Masumura, Naoki Makishima, Taiga Yamane, Yoshihiko Yamazaki, Saki Mizuno, Mana Ihori, Mihiro Uchida, Keita Suzuki, Hiroshi Sato, Tomohiro Tanaka, Akihiko Takashima, Satoshi Suzuki, Takafumi Moriya, Nobukatsu Hojo, Atsushi Ando |
| 2023 | Interspeech | Knowledge Distillation for Neural Transducer-based Target-Speaker ASR: Exploiting Parallel Mixture/Single-Talker Speech Data. | Takafumi Moriya, Hiroshi Sato, Tsubasa Ochiai, Marc Delcroix, Takanori Ashihara, Kohei Matsuura, Tomohiro Tanaka, Ryo Masumura, Atsunori Ogawa, Taichi Asami |
| 2023 | Interspeech | Downstream Task Agnostic Speech Enhancement with Self-Supervised Representation Loss. | Hiroshi Sato, Ryo Masumura, Tsubasa Ochiai, Marc Delcroix, Takafumi Moriya, Takanori Ashihara, Kentaro Shinayama, Saki Mizuno, Mana Ihori, Tomohiro Tanaka, Nobukatsu Hojo |
| 2022 | COLING | Multi-Perspective Document Revision. | Mana Ihori, Hiroshi Sato, Tomohiro Tanaka, Ryo Masumura |
| 2022 | ICASSP | Customer Satisfaction Estimation Using Unsupervised Representation Learning with Multi-Format Prediction Loss. | Atsushi Ando, Yumiko Murata, Ryo Masumura, Satoshi Suzuki, Naoki Makishima, Takafumi Moriya, Takanori Ashihara, Hiroshi Sato |
| 2022 | ICASSP | Hybrid RNN-T/Attention-Based Streaming ASR with Triggered Chunkwise Attention and Dual Internal Language Model Integration. | Takafumi Moriya, Takanori Ashihara, Atsushi Ando, Hiroshi Sato, Tomohiro Tanaka, Kohei Matsuura, Ryo Masumura, Marc Delcroix, Takahiro Shinozaki |
| 2022 | ICIP | Fully Shareable Scene Text Recognition Modeling for Horizontal and Vertical Writing. | Shota Orihashi, Yoshihiro Yamazaki, Mihiro Uchida, Akihiko Takashima, Ryo Masumura |
| 2022 | Interspeech | Speaker consistency loss and step-wise optimization for semi-supervised joint training of TTS and ASR using unpaired text data. | Naoki Makishima, Satoshi Suzuki, Atsushi Ando, Ryo Masumura |
| 2022 | Interspeech | End-to-End Joint Modeling of Conversation History-Dependent and Independent ASR Systems with Multi-History Training. | Ryo Masumura, Yoshihiro Yamazaki, Saki Mizuno, Naoki Makishima, Mana Ihori, Mihiro Uchida, Hiroshi Sato, Tomohiro Tanaka, Akihiko Takashima, Satoshi Suzuki, Shota Orihashi, Takafumi Moriya, Nobukatsu Hojo, Atsushi Ando |
| 2022 | Interspeech | Predicting VQVAE-based Character Acting Style from Quotation-Annotated Text for Audiobook Speech Synthesis. | Wataru Nakata, Tomoki Koriyama, Shinnosuke Takamichi, Yuki Saito, Yusuke Ijima, Ryo Masumura, Hiroshi Saruwatari |
| 2022 | Interspeech | Dialogue Acts Aided Important Utterance Detection Based on Multiparty and Multimodal Information. | Fumio Nihei, Ryo Ishii, Yukiko I. Nakano, Kyosuke Nishida, Ryo Masumura, Atsushi Fukayama, Takao Nakamura |
| 2022 | Interspeech | Strategies to Improve Robustness of Target Speech Extraction to Enrollment Variations. | Hiroshi Sato, Tsubasa Ochiai, Marc Delcroix, Keisuke Kinoshita, Takafumi Moriya, Naoki Makishima, Mana Ihori, Tomohiro Tanaka, Ryo Masumura |
| 2022 | Interspeech | Interactive Co-Learning with Cross-Modal Transformer for Audio-Visual Emotion Recognition. | Akihiko Takashima, Ryo Masumura, Atsushi Ando, Yoshihiro Yamazaki, Mihiro Uchida, Shota Orihashi |
| 2022 | Interspeech | Domain Adversarial Self-Supervised Speech Representation Learning for Improving Unknown Domain Downstream Tasks. | Tomohiro Tanaka, Ryo Masumura, Hiroshi Sato, Mana Ihori, Kohei Matsuura, Takanori Ashihara, Takafumi Moriya |
| 2022 | LREC | Multimodal Negotiation Corpus with Various Subjective Assessments for Social-Psychological Outcome Prediction from Non-Verbal Cues. | Nobukatsu Hojo, Satoshi Kobashikawa, Saki Mizuno, Ryo Masumura |
| 2021 | ASRU | Hierarchical Knowledge Distillation for Dialogue Sequence Labeling. | Shota Orihashi, Yoshihiro Yamazaki, Naoki Makishima, Mana Ihori, Akihiko Takashima, Tomohiro Tanaka, Ryo Masumura |
| 2021 | ICASSP | Speech Emotion Recognition Based on Listener Adaptive Models. | Atsushi Ando, Ryo Masumura, Hiroshi Sato, Takafumi Moriya, Takanori Ashihara, Yusuke Ijima, Tomoki Toda |
| 2021 | ICASSP | MAPGN: Masked Pointer-Generator Network for Sequence-to-Sequence Pre-Training. | Mana Ihori, Naoki Makishima, Tomohiro Tanaka, Akihiko Takashima, Shota Orihashi, Ryo Masumura |
| 2021 | ICASSP | Audio-Visual Speech Separation Using Cross-Modal Correspondence Loss. | Naoki Makishima, Mana Ihori, Akihiko Takashima, Tomohiro Tanaka, Shota Orihashi, Ryo Masumura |
| 2021 | ICASSP | Hierarchical Transformer-Based Large-Context End-To-End ASR with Large-Context Knowledge Distillation. | Ryo Masumura, Naoki Makishima, Mana Ihori, Akihiko Takashima, Tomohiro Tanaka, Shota Orihashi |
| 2021 | ICASSP | Simpleflat: A Simple Whole-Network Pre-Training Approach for RNN Transducer-Based End-to-End Speech Recognition. | Takafumi Moriya, Takanori Ashihara, Tomohiro Tanaka, Tsubasa Ochiai, Hiroshi Sato, Atsushi Ando, Yusuke Ijima, Ryo Masumura, Yusuke Shinohara |
| 2021 | Interspeech | Zero-Shot Joint Modeling of Multiple Spoken-Text-Style Conversion Tasks Using Switching Tokens. | Mana Ihori, Naoki Makishima, Tomohiro Tanaka, Akihiko Takashima, Shota Orihashi, Ryo Masumura |
| 2021 | Interspeech | Enrollment-Less Training for Personalized Voice Activity Detection. | Naoki Makishima, Mana Ihori, Tomohiro Tanaka, Akihiko Takashima, Shota Orihashi, Ryo Masumura |
| 2021 | Interspeech | Unified Autoregressive Modeling for Joint End-to-End Multi-Talker Overlapped Speech Recognition and Speaker Attribute Estimation. | Ryo Masumura, Daiki Okamura, Naoki Makishima, Mana Ihori, Akihiko Takashima, Tomohiro Tanaka, Shota Orihashi |
| 2021 | Interspeech | Streaming End-to-End Speech Recognition for Hybrid RNN-T/Attention Architecture. | Takafumi Moriya, Tomohiro Tanaka, Takanori Ashihara, Tsubasa Ochiai, Hiroshi Sato, Atsushi Ando, Ryo Masumura, Marc Delcroix, Taichi Asami |
| 2021 | Interspeech | Cross-Modal Transformer-Based Neural Correction Models for Automatic Speech Recognition. | Tomohiro Tanaka, Ryo Masumura, Mana Ihori, Akihiko Takashima, Takafumi Moriya, Takanori Ashihara, Shota Orihashi, Naoki Makishima |
| 2021 | Interspeech | End-to-End Rich Transcription-Style Automatic Speech Recognition with Semi-Supervised Learning. | Tomohiro Tanaka, Ryo Masumura, Mana Ihori, Akihiko Takashima, Shota Orihashi, Naoki Makishima |
| 2020 | ICASSP | Large-Context Pointer-Generator Networks for Spoken-to-Written Style Conversion. | Mana Ihori, Akihiko Takashima, Ryo Masumura |
| 2020 | ICASSP | Sequence-Level Consistency Training for Semi-Supervised End-to-End Automatic Speech Recognition. | Ryo Masumura, Mana Ihori, Akihiko Takashima, Takafumi Moriya, Atsushi Ando, Yusuke Shinohara |
| 2020 | ICASSP | Distilling Attention Weights for CTC-Based ASR Systems. | Takafumi Moriya, Hiroshi Sato, Tomohiro Tanaka, Takanori Ashihara, Ryo Masumura, Yusuke Shinohara |
| 2020 | INLG | Memory Attentive Fusion: External Language Model Integration for Transformer-based Sequence-to-Sequence Model. | Mana Ihori, Ryo Masumura, Naoki Makishima, Tomohiro Tanaka, Akihiko Takashima, Shota Orihashi |
| 2020 | Interspeech | A Transformer-Based Audio Captioning Model with Keyword Estimation. | Yuma Koizumi, Ryo Masumura, Kyosuke Nishida, Masahiro Yasuda, Shoichiro Saito |
| 2020 | Interspeech | Phoneme-to-Grapheme Conversion Based Large-Scale Pre-Training for End-to-End Automatic Speech Recognition. | Ryo Masumura, Naoki Makishima, Mana Ihori, Akihiko Takashima, Tomohiro Tanaka, Shota Orihashi |
| 2020 | Interspeech | Self-Distillation for Improving CTC-Transformer-Based ASR Systems. | Takafumi Moriya, Tsubasa Ochiai, Shigeki Karita, Hiroshi Sato, Tomohiro Tanaka, Takanori Ashihara, Ryo Masumura, Yusuke Shinohara, Marc Delcroix |
| 2020 | Interspeech | Unsupervised Domain Adaptation for Dialogue Sequence Labeling Based on Hierarchical Adversarial Training. | Shota Orihashi, Mana Ihori, Tomohiro Tanaka, Ryo Masumura |
| 2020 | Interspeech | Investigating Effective Additional Contextual Factors in DNN-Based Spontaneous Speech Synthesis. | Yuki Yamashita, Tomoki Koriyama, Yuki Saito, Shinnosuke Takamichi, Yusuke Ijima, Ryo Masumura, Hiroshi Saruwatari |
| 2020 | LREC | Parallel Corpus for Japanese Spoken-to-Written Style Conversion. | Mana Ihori, Akihiko Takashima, Ryo Masumura |
| 2020 | LREC | Generating Responses that Reflect Meta Information in User-Generated Question Answer Pairs. | Takashi Kodama, Ryuichiro Higashinaka, Koh Mitsuda, Ryo Masumura, Yushi Aono, Ryuta Nakamura, Noritake Adachi, Hidetoshi Kawabata |
| 2020 | LREC | DNN-based Speech Synthesis Using Abundant Tags of Spontaneous Speech Corpus. | Yuki Yamashita, Tomoki Koriyama, Yuki Saito, Shinnosuke Takamichi, Yusuke Ijima, Ryo Masumura, Hiroshi Saruwatari |
| 2019 | ASRU | Improving Speech-Based End-of-Turn Detection Via Cross-Modal Representation Learning with Punctuated Text Data. | Ryo Masumura, Mana Ihori, Tomohiro Tanaka, Atsushi Ando, Ryo Ishii, Takanobu Oba, Ryuichiro Higashinaka |
| 2019 | ASRU | Generalized Large-Context Language Models Based on Forward-Backward Hierarchical Recurrent Encoder-Decoder Models. | Ryo Masumura, Mana Ihori, Tomohiro Tanaka, Itsumi Saito, Kyosuke Nishida, Takanobu Oba |
| 2019 | ICASSP | Large Context End-to-end Automatic Speech Recognition via Extension of Hierarchical Recurrent Encoder-decoder Models. | Ryo Masumura, Tomohiro Tanaka, Takafumi Moriya, Yusuke Shinohara, Takanobu Oba, Yushi Aono |
| 2019 | Interspeech | Speech Emotion Recognition Based on Multi-Label Emotion Existence Model. | Atsushi Ando, Ryo Masumura, Hosana Kamiyama, Satoshi Kobashikawa, Yushi Aono |
| 2019 | Interspeech | End-to-End Automatic Speech Recognition with a Reconstruction Criterion Using Speech-to-Text and Text-to-Speech Encoder-Decoders. | Ryo Masumura, Hiroshi Sato, Tomohiro Tanaka, Takafumi Moriya, Yusuke Ijima, Takanobu Oba |
| 2019 | Interspeech | Improving Conversation-Context Language Models with Multiple Spoken Language Understanding Models. | Ryo Masumura, Tomohiro Tanaka, Atsushi Ando, Hosana Kamiyama, Takanobu Oba, Satoshi Kobashikawa, Yushi Aono |
| 2019 | Interspeech | Joint Maximization Decoder with Neural Converters for Fully Neural Network-Based Japanese Speech Recognition. | Takafumi Moriya, Jian Wang, Tomohiro Tanaka, Ryo Masumura, Yusuke Shinohara, Yoshikazu Yamaguchi, Yushi Aono |
| 2019 | Interspeech | A Joint End-to-End and DNN-HMM Hybrid Automatic Speech Recognition System with Transferring Sharable Knowledge. | Tomohiro Tanaka, Ryo Masumura, Takafumi Moriya, Takanobu Oba, Yushi Aono |
| 2018 | COLING | Multi-task and Multi-lingual Joint Learning of Neural Lexical Utterance Classification based on Partially-shared Modeling. | Ryo Masumura, Tomohiro Tanaka, Ryuichiro Higashinaka, Hirokazu Masataki, Yushi Aono |
| 2018 | EMNLP | Adversarial Training for Multi-task and Multi-lingual Joint Modeling of Utterance Intent Classification. | Ryo Masumura, Yusuke Shinohara, Ryuichiro Higashinaka, Yushi Aono |
| 2018 | ICASSP | Soft-Target Training with Ambiguous Emotional Utterances for DNN-Based Speech Emotion Classification. | Atsushi Ando, Satoshi Kobashikawa, Hosana Kamiyama, Ryo Masumura, Yusuke Ijima, Yushi Aono |
| 2018 | ICASSP | Neural Confnet Classification: Fully Neural Network Based Spoken Utterance Classification Using Word Confusion Networks. | Ryo Masumura, Yusuke Ijima, Taichi Asami, Hirokazu Masataki, Ryuichiro Higashinaka |
| 2018 | Interspeech | Automatic Question Detection from Acoustic and Phonetic Features Using Feature-wise Pre-training. | Atsushi Ando, Reine Asakawa, Ryo Masumura, Hosana Kamiyama, Satoshi Kobashikawa, Yushi Aono |
| 2018 | Interspeech | Role Play Dialogue Aware Language Models Based on Conditional Hierarchical Recurrent Encoder-Decoder. | Ryo Masumura, Tomohiro Tanaka, Atsushi Ando, Hirokazu Masataki, Yushi Aono |
| 2018 | Interspeech | Neural Error Corrective Language Models for Automatic Speech Recognition. | Tomohiro Tanaka, Ryo Masumura, Hirokazu Masataki, Yushi Aono |
| 2018 | SIGdial | Neural Dialogue Context Online End-of-Turn Detection. | Ryo Masumura, Tomohiro Tanaka, Atsushi Ando, Ryo Ishii, Ryuichiro Higashinaka, Yushi Aono |
| 2017 | ICASSP | Domain adaptation of DNN acoustic models using knowledge distillation. | Taichi Asami, Ryo Masumura, Yoshikazu Yamaguchi, Hirokazu Masataki, Yushi Aono |
| 2017 | ICASSP | Parallel phonetically aware DNNs and LSTM-RNNS for frame-by-frame discriminative modeling of spoken language identification. | Ryo Masumura, Taichi Asami, Hirokazu Masataki, Yushi Aono |
| 2017 | IJCNLP | Hyperspherical Query Likelihood Models with Word Embeddings. | Ryo Masumura, Taichi Asami, Hirokazu Masataki, Kugatsu Sadamitsu, Kyosuke Nishida, Ryuichiro Higashinaka |
| 2017 | IJCNLP | Improving Neural Text Normalization with Data Augmentation at Character- and Morphological Levels. | Itsumi Saito, Jun Suzuki, Kyosuke Nishida, Kugatsu Sadamitsu, Satoshi Kobashikawa, Ryo Masumura, Yuji Matsumoto, Junji Tomita |
| 2017 | Interspeech | Hierarchical LSTMs with Joint Learning for Estimating Customer Satisfaction from Contact Center Calls. | Atsushi Ando, Ryo Masumura, Hosana Kamiyama, Satoshi Kobashikawa, Yushi Aono |
| 2017 | Interspeech | Prosody Aware Word-Level Encoder Based on BLSTM-RNNs for DNN-Based Speech Synthesis. | Yusuke Ijima, Nobukatsu Hojo, Ryo Masumura, Taichi Asami |
| 2017 | Interspeech | Online End-of-Turn Detection from Speech Based on Stacked Time-Asynchronous Sequential Networks. | Ryo Masumura, Taichi Asami, Hirokazu Masataki, Ryo Ishii, Ryuichiro Higashinaka |
| 2017 | Interspeech | Parallel Hierarchical Attention Networks with Shared Memory Reader for Multi-Stream Conversational Document Classification. | Naoki Sawada, Ryo Masumura, Hiromitsu Nishizaki |
| 2016 | Interspeech | Recurrent Out-of-Vocabulary Word Detection Using Distribution of Features. | Taichi Asami, Ryo Masumura, Yushi Aono, Koichi Shinoda |
| 2016 | Interspeech | Language Identification Based on Generative Modeling of Posteriorgram Sequences Extracted from Frame-by-Frame DNNs and LSTM-RNNs. | Ryo Masumura, Taichi Asami, Hirokazu Masataki, Yushi Aono, Sumitaka Sakauchi |
| 2015 | EMNLP | Hierarchical Latent Words Language Models for Robust Modeling to Out-Of Domain Tasks. | Ryo Masumura, Taichi Asami, Takanobu Oba, Hirokazu Masataki, Sumitaka Sakauchi, Akinori Ito |
| 2015 | Interspeech | Training data selection for acoustic modeling via submodular optimization of joint kullback-leibler divergence. | Taichi Asami, Ryo Masumura, Hirokazu Masataki, Manabu Okamoto, Sumitaka Sakauchi |
| 2015 | Interspeech | Combinations of various language model technologies including data expansion and adaptation in spontaneous speech recognition. | Ryo Masumura, Taichi Asami, Takanobu Oba, Hirokazu Masataki, Sumitaka Sakauchi, Akinori Ito |
| 2015 | Interspeech | Latent words recurrent neural network language models. | Ryo Masumura, Taichi Asami, Takanobu Oba, Hirokazu Masataki, Sumitaka Sakauchi, Akinori Ito |
| 2015 | PACLIC | Discourse Relation Recognition by Comparing Various Units of Sentence Expression with Recursive Neural Network. | Atsushi Otsuka, Toru Hirano, Chiaki Miyazaki, Ryo Masumura, Ryuichiro Higashinaka, Toshiro Makino, Yoshihiro Matsuo |
| 2014 | ICASSP | Role play dialogue topic model for language model adaptation in multi-party conversation speech recognition. | Ryo Masumura, Takanobu Oba, Hirokazu Masataki, Osamu Yoshioka, Satoshi Takahashi |
| 2014 | Interspeech | Read and spontaneous speech classification based on variance of GMM supervectors. | Taichi Asami, Ryo Masumura, Hirokazu Masataki, Sumitaka Sakauchi |
| 2014 | Interspeech | Mixture of latent words language models for domain adaptation. | Ryo Masumura, Taichi Asami, Takanobu Oba, Hirokazu Masataki, Sumitaka Sakauchi |
| 2013 | ICASSP | Use of latent words language models in ASR: A sampling-based implementation. | Ryo Masumura, Hirokazu Masataki, Takanobu Oba, Osamu Yoshioka, Satoshi Takahashi |
| 2013 | Interspeech | Viterbi decoding for latent words language models using gibbs sampling. | Ryo Masumura, Hirokazu Masataki, Takanobu Oba, Osamu Yoshioka, Satoshi Takahashi |
| 2011 | Interspeech | Training a Language Model Using Webdata for Large Vocabulary Japanese Spontaneous Speech Recognition. | Ryo Masumura, Seongjun Hahm, Akinori Ito |
| 2011 | Interspeech | Language Model Expansion Using Webdata for Spoken Document Retrieval. | Ryo Masumura, Seongjun Hahm, Akinori Ito |