| 2026 | LREC | J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling. | Wataru Nakata, Kentaro Seki, Hitomi Yanaka, Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2026 | SIGdial | DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio. | Wataru Nakata, Yuki Saito, Kazuki Yamauchi, Emiru Tsunoo, Hiroshi Saruwatari |
| 2025 | ASRU | Multi-Sampling-Frequency Naturalness MOS Prediction Using Self-Supervised Learning Model with Sampling-Frequency-Independent Layer. | Go Nishikawa, Wataru Nakata, Yuki Saito, Kanami Imamura, Hiroshi Saruwatari, Tomohiko Nakamura |
| 2025 | ICASSP | Causal Speech Enhancement with Predicting Semantics based on Quantized Self-supervised Learning Features. | Emiru Tsunoo, Yuki Saito, Wataru Nakata, Hiroshi Saruwatari |
| 2023 | ASRU | COCO-NUT: Corpus of Japanese Utterance and Voice Characteristics Description for Prompt-Based Control. | Aya Watanabe, Shinnosuke Takamichi, Yuki Saito, Wataru Nakata, Detai Xin, Hiroshi Saruwatari |
| 2022 | Interspeech | Predicting VQVAE-based Character Acting Style from Quotation-Annotated Text for Audiobook Speech Synthesis. | Wataru Nakata, Tomoki Koriyama, Shinnosuke Takamichi, Yuki Saito, Yusuke Ijima, Ryo Masumura, Hiroshi Saruwatari |
| 2022 | Interspeech | UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022. | Takaaki Saeki, Detai Xin, Wataru Nakata, Tomoki Koriyama, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2022 | Interspeech | J-MAC: Japanese multi-speaker audiobook corpus for speech synthesis. | Shinnosuke Takamichi, Wataru Nakata, Naoko Tanji, Hiroshi Saruwatari |