| 2025 | ASRU | Layer-wise Analysis for Quality of Multilingual Synthesized Speech. | Erica Cooper, Takuma Okamoto, Yamato Ohtani, Tomoki Toda, Hisashi Kawai |
| 2025 | ASRU | Voice Factor Control Using FIR-Based Fast Neural Vocoder for Speech Generation Applications. | Yamato Ohtani, Takuma Okamoto, Tomoki Toda, Hisashi Kawai |
| 2025 | ASRU | Speech Masking System Based on Spatially Separated Multiple TTS Maskers With A Compact Circular Loudspeaker Array. | Takuma Okamoto |
| 2025 | ICASSP | Mora-Level Prosody Prediction for Text-to-Speech Using Japanese BERT Without Accentual Labels. | Tadashi Ogura, Takuma Okamoto, Yamato Ohtani, Erica Cooper, Tomoki Toda, Hisashi Kawai |
| 2025 | Interspeech | GST-BERT-TTS: Prosody Prediction Without Accentual Labels For Multi-Speaker TTS Using BERT With Global Style Tokens. | Tadashi Ogura, Takuma Okamoto, Yamato Ohtani, Erica Cooper, Tomoki Toda, Hisashi Kawai |
| 2025 | Interspeech | Simultaneous Speech Translation Integrated Compact Multiple Sound Spot Synthesis System On A Laptop Carried Out With A Backpack. | Takuma Okamoto, Michiyo Kono |
| 2024 | ICASSP | FIRNet: Fundamental Frequency Controllable Fast Neural Vocoder With Trainable Finite Impulse Response Filter. | Yamato Ohtani, Takuma Okamoto, Tomoki Toda, Hisashi Kawai |
| 2024 | ICASSP | Convnext-TTS And Convnext-VC: Convnext-Based Fast End-To-End Sequence-To-Sequence Text-To-Speech And Voice Conversion. | Takuma Okamoto, Yamato Ohtani, Tomoki Toda, Hisashi Kawai |
| 2024 | Interspeech | Mobile PresenTra: NICT fast neural text-to-speech system on smartphones with incremental inference of MS-FC-HiFi-GAN for law-latency synthesis. | Takuma Okamoto, Yamato Ohtani, Hisashi Kawai |
| 2024 | Interspeech | Challenge of Singing Voice Synthesis Using Only Text-To-Speech Corpus With FIRNet Source-Filter Neural Vocoder. | Takuma Okamoto, Yamato Ohtani, Sota Shimizu, Tomoki Toda, Hisashi Kawai |
| 2023 | ASRU | WaveNeXt: ConvNeXt-Based Fast Neural Vocoder Without ISTFT layer. | Takuma Okamoto, Haruki Yamashita, Yamato Ohtani, Tomoki Toda, Hisashi Kawai |
| 2023 | ICASSP | Continuous Action Space-Based Spoken Language Acquisition Agent Using Residual Sentence Embedding and Transformer Decoder. | Ryota Komatsu, Yusuke Kimura, Takuma Okamoto, Takahiro Shinozaki |
| 2023 | Interspeech | E2E-S2S-VC: End-To-End Sequence-To-Sequence Voice Conversion. | Takuma Okamoto, Tomoki Toda, Hisashi Kawai |
| 2021 | ASRU | Multi-Stream HiFi-GAN with Data-Driven Waveform Decomposition. | Takuma Okamoto, Tomoki Toda, Hisashi Kawai |
| 2021 | ICASSP | High-Intelligibility Speech Synthesis for Dysarthric Speakers with LPCNet-Based TTS and CycleVAE-Based VC. | Keisuke Matsubara, Takuma Okamoto, Ryoichi Takashima, Tetsuya Takiguchi, Tomoki Toda, Yoshinori Shiga, Hisashi Kawai |
| 2021 | ICASSP | Close-Talking Recording with Planarly Distributed Microphones. | Takuma Okamoto |
| 2021 | ICASSP | Noise Level Limited Sub-Modeling for Diffusion Probabilistic Vocoders. | Takuma Okamoto, Tomoki Toda, Yoshinori Shiga, Hisashi Kawai |
| 2020 | ICASSP | Transformer-Based Text-to-Speech with Weighted Forced Attention. | Takuma Okamoto, Tomoki Toda, Yoshinori Shiga, Hisashi Kawai |
| 2020 | Interspeech | Quasi-Periodic Parallel WaveGAN Vocoder: A Non-Autoregressive Pitch-Dependent Dilated Convolution Model for Parametric Speech Generation. | Yi-Chiao Wu, Tomoki Hayashi, Takuma Okamoto, Hisashi Kawai, Tomoki Toda |
| 2019 | ASRU | Tacotron-Based Acoustic Model Using Phoneme Alignment for Practical Neural Text-to-Speech Systems. | Takuma Okamoto, Tomoki Toda, Yoshinori Shiga, Hisashi Kawai |
| 2019 | ICASSP | Horizontal 3D Sound Field Recording and 2.5D Synthesis with Omni-directional Circular Arrays. | Takuma Okamoto |
| 2019 | ICASSP | Investigations of Real-time Gaussian Fftnet and Parallel Wavenet Neural Vocoders with Simple Acoustic Features. | Takuma Okamoto, Tomoki Toda, Yoshinori Shiga, Hisashi Kawai |
| 2019 | Interspeech | Real-Time Neural Text-to-Speech with Sequence-to-Sequence Acoustic Model and WaveGlow or Single Gaussian WaveRNN Vocoders. | Takuma Okamoto, Tomoki Toda, Yoshinori Shiga, Hisashi Kawai |
| 2018 | ICASSP | An Investigation of Subband Wavenet Vocoder Covering Entire Audible Frequency Range with Limited Acoustic Features. | Takuma Okamoto, Kentaro Tachibana, Tomoki Toda, Yoshinori Shiga, Hisashi Kawai |
| 2017 | ASRU | Subband wavenet with overlapped single-sideband filterbanks. | Takuma Okamoto, Kentaro Tachibana, Tomoki Toda, Yoshinori Shiga, Hisashi Kawai |
| 2017 | ICASSP | Analytical approach to 2.5D sound field control using a circular double-layer array of fixed-directivity loudspeakers. | Takuma Okamoto |
| 2016 | ICASSP | 2.5D higher order ambisonics for a sound field described by angular spectrum coefficients. | Takuma Okamoto |
| 2015 | ICASSP | Near-field sound propagation based on a circular and linear array combination. | Takuma Okamoto |
| 2014 | ICASSP | Generation of multiple sound zones by spatial filtering in wavenumber domain using a linear array of loudspeakers. | Takuma Okamoto |