| 2025 | ASRU | Layer-wise Analysis for Quality of Multilingual Synthesized Speech. | Erica Cooper, Takuma Okamoto, Yamato Ohtani, Tomoki Toda, Hisashi Kawai |
| 2025 | ASRU | Voice Factor Control Using FIR-Based Fast Neural Vocoder for Speech Generation Applications. | Yamato Ohtani, Takuma Okamoto, Tomoki Toda, Hisashi Kawai |
| 2025 | ICASSP | Mora-Level Prosody Prediction for Text-to-Speech Using Japanese BERT Without Accentual Labels. | Tadashi Ogura, Takuma Okamoto, Yamato Ohtani, Erica Cooper, Tomoki Toda, Hisashi Kawai |
| 2025 | Interspeech | GST-BERT-TTS: Prosody Prediction Without Accentual Labels For Multi-Speaker TTS Using BERT With Global Style Tokens. | Tadashi Ogura, Takuma Okamoto, Yamato Ohtani, Erica Cooper, Tomoki Toda, Hisashi Kawai |
| 2024 | ICASSP | FIRNet: Fundamental Frequency Controllable Fast Neural Vocoder With Trainable Finite Impulse Response Filter. | Yamato Ohtani, Takuma Okamoto, Tomoki Toda, Hisashi Kawai |
| 2024 | ICASSP | Convnext-TTS And Convnext-VC: Convnext-Based Fast End-To-End Sequence-To-Sequence Text-To-Speech And Voice Conversion. | Takuma Okamoto, Yamato Ohtani, Tomoki Toda, Hisashi Kawai |
| 2024 | Interspeech | Mobile PresenTra: NICT fast neural text-to-speech system on smartphones with incremental inference of MS-FC-HiFi-GAN for law-latency synthesis. | Takuma Okamoto, Yamato Ohtani, Hisashi Kawai |
| 2024 | Interspeech | Challenge of Singing Voice Synthesis Using Only Text-To-Speech Corpus With FIRNet Source-Filter Neural Vocoder. | Takuma Okamoto, Yamato Ohtani, Sota Shimizu, Tomoki Toda, Hisashi Kawai |
| 2023 | ASRU | WaveNeXt: ConvNeXt-Based Fast Neural Vocoder Without ISTFT layer. | Takuma Okamoto, Haruki Yamashita, Yamato Ohtani, Tomoki Toda, Hisashi Kawai |
| 2022 | Interspeech | Spoken-Text-Style Transfer with Conditional Variational Autoencoder and Content Word Storage. | Daiki Yoshioka, Yusuke Yasuda, Noriyuki Matsunaga, Yamato Ohtani, Tomoki Toda |
| 2020 | Interspeech | A Cyclical Post-Filtering Approach to Mismatch Refinement of Neural Vocoder for Text-to-Speech Systems. | Yi-Chiao Wu, Patrick Lumban Tobing, Kazuki Yasuhara, Noriyuki Matsunaga, Yamato Ohtani, Tomoki Toda |
| 2016 | Interspeech | Voice Quality Control Using Perceptual Expressions for Statistical Parametric Speech Synthesis Based on Cluster Adaptive Training. | Yamato Ohtani, Koichiro Mori, Masahiro Morita |
| 2015 | Interspeech | Emotional transplant in statistical speech synthesis based on emotion additive model. | Yamato Ohtani, Yu Nasu, Masahiro Morita, Masami Akamine |
| 2014 | Interspeech | GMM-based bandwidth extension using sub-band basis spectrum model. | Yamato Ohtani, Masatsune Tamura, Masahiro Morita, Masami Akamine |
| 2012 | Interspeech | Histogram-based spectral equalization for HMM-based speech synthesis using mel-LSP. | Yamato Ohtani, Masatsune Tamura, Masahiro Morita, Takehiko Kagoshima, Masami Akamine |
| 2012 | Interspeech | HMM-based speech synthesis using sub-band basis spectrum model. | Yamato Ohtani, Masatsune Tamura, Masahiro Morita, Takehiko Kagoshima, Masami Akamine |
| 2011 | ICASSP | Continuous F0 in the source-excitation generation for HMM-based TTS: Do we need voiced/unvoiced classification? | Javier Latorre, Mark J. F. Gales, Sabine Buchholz, Kate M. Knill, Masatsune Tamura, Yamato Ohtani, Masami Akamine |
| 2010 | ICASSP | Non-parallel training for many-to-many eigenvoice conversion. | Yamato Ohtani, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2010 | Interspeech | Adaptive voice-quality control based on one-to-many eigenvoice conversion. | Kumi Ohta, Tomoki Toda, Yamato Ohtani, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2009 | Interspeech | Cross-language voice conversion based on eigenvoices. | Malorie Charlier, Yamato Ohtani, Tomoki Toda, Alexis Moinet, Thierry Dutoit |
| 2009 | Interspeech | Many-to-many eigenvoice conversion with reference voice. | Yamato Ohtani, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2008 | Interspeech | Low-delay voice conversion based on maximum likelihood estimation of spectral parameter trajectory. | Takashi Muramatsu, Yamato Ohtani, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2008 | Interspeech | An improved one-to-many eigenvoice conversion system. | Yamato Ohtani, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2008 | Interspeech | Maximum a posteriori adaptation for many-to-one eigenvoice conversion. | Daisuke Tani, Tomoki Toda, Yamato Ohtani, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2007 | ICASSP | One-to-Many and Many-to-One Voice Conversion Based on Eigenvoices. | Tomoki Toda, Yamato Ohtani, Kiyohiro Shikano |
| 2007 | Interspeech | Speaker adaptive training for one-to-many eigenvoice conversion based on Gaussian mixture model. | Yamato Ohtani, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2006 | Interspeech | Maximum likelihood voice conversion based on GMM with STRAIGHT mixed excitation. | Yamato Ohtani, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2006 | Interspeech | Eigenvoice conversion based on Gaussian mixture model. | Tomoki Toda, Yamato Ohtani, Kiyohiro Shikano |