| 2025 | ICASSP | Speech Re-Painting for Robust ASR. | Kyle Kastner, Gary Wang, Isaac Elias, Takaaki Saeki, Pedro Moreno Mengibar, Franoise Beaufays, Andrew Rosenberg, Bhuvana Ramabhadran |
| 2024 | ICASSP | Extending Multilingual Speech Synthesis to 100+ Languages without Transcribed Data. | Takaaki Saeki, Gary Wang, Nobuyuki Morioka, Isaac Elias, Kyle Kastner, Andrew Rosenberg, Bhuvana Ramabhadran, Heiga Zen, Franoise Beaufays, Hadar Shemtov |
| 2024 | ICASSP | Diversity-Based Core-Set Selection for Text-to-Speech with Linguistic and Acoustic Features. | Kentaro Seki, Shinnosuke Takamichi, Takaaki Saeki, Hiroshi Saruwatari |
| 2024 | Interspeech | SpeechBERTScore: Reference-Aware Automatic Evaluation of Speech Generation Leveraging NLP Evaluation Metrics. | Takaaki Saeki, Soumi Maiti, Shinnosuke Takamichi, Shinji Watanabe, Hiroshi Saruwatari |
| 2023 | ASRU | Yodas: Youtube-Oriented Dataset for Audio and Speech. | Xinjian Li, Shinnosuke Takamichi, Takaaki Saeki, William Chen, Sayaka Shiota, Shinji Watanabe |
| 2023 | ICASSP | Speechlmscore: Evaluating Speech Generation Using Speech Language Model. | Soumi Maiti, Yifan Peng, Takaaki Saeki, Shinji Watanabe |
| 2023 | ICASSP | Virtuoso: Massive Multilingual Speech-Text Joint Semi-Supervised Learning for Text-to-Speech. | Takaaki Saeki, Heiga Zen, Zhehuai Chen, Nobuyuki Morioka, Gary Wang, Yu Zhang, Ankur Bapna, Andrew Rosenberg, Bhuvana Ramabhadran |
| 2023 | ICASSP | Duration-Aware Pause Insertion Using Pre-Trained Language Model for Multi-Speaker Text-To-Speech. | Dong Yang, Tomoki Koriyama, Yuki Saito, Takaaki Saeki, Detai Xin, Hiroshi Saruwatari |
| 2023 | IJCAI | Learning to Speak from Text: Zero-Shot Multilingual Text-to-Speech with Unsupervised Text Pretraining. | Takaaki Saeki, Soumi Maiti, Xinjian Li, Shinji Watanabe, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2022 | Interspeech | SelfRemaster: Self-Supervised Speech Restoration with Analysis-by-Synthesis Approach Using Channel Modeling. | Takaaki Saeki, Shinnosuke Takamichi, Tomohiko Nakamura, Naoko Tanji, Hiroshi Saruwatari |
| 2022 | Interspeech | DRSpeech: Degradation-Robust Text-to-Speech Synthesis with Frame-Level and Utterance-Level Acoustic Representation Learning. | Takaaki Saeki, Kentaro Tachibana, Ryuichi Yamamoto |
| 2022 | Interspeech | UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022. | Takaaki Saeki, Detai Xin, Wataru Nakata, Tomoki Koriyama, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2022 | LREC | SSR7000: A Synchronized Corpus of Ultrasound Tongue Imaging for End-to-End Silent Speech Recognition. | Naoki Kimura, Zixiong Su, Takaaki Saeki, Jun Rekimoto |
| 2022 | LREC | Personalized Filled-pause Generation with Group-wise Prediction Models. | Yuta Matsunaga, Takaaki Saeki, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2021 | ASRU | Low-Latency Incremental Text-to-Speech Synthesis with Distilled Context Prediction Network. | Takaaki Saeki, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2020 | ICASSP | Lifter Training and Sub-Band Modeling for Computationally Efficient and High-Quality Voice Conversion Using Spectral Differentials. | Takaaki Saeki, Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2020 | Interspeech | End-to-End Deep Learning Speech Recognition Model for Silent Speech Challenge. | Naoki Kimura, Zixiong Su, Takaaki Saeki |
| 2020 | Interspeech | Real-Time, Full-Band, Online DNN-Based Voice Conversion System Using a Single CPU. | Takaaki Saeki, Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |