| 2025 | ICASSP | SimulTron: On-Device Simultaneous Speech to Speech Translation. | Alex Agranovich, Eliya Nachmani, Oleg Rybakov, Yifan Ding, Ye Jia, Nadav Bar, Heiga Zen, Michelle Tadmor Ramanovich |
| 2024 | ICASSP | Translatotron 3: Speech to Speech Translation with Monolingual Data. | Eliya Nachmani, Alon Levkovitch, Yifan Ding, Chulayuth Asawaroengchai, Heiga Zen, Michelle Tadmor Ramanovich |
| 2024 | ICASSP | Extending Multilingual Speech Synthesis to 100+ Languages without Transcribed Data. | Takaaki Saeki, Gary Wang, Nobuyuki Morioka, Isaac Elias, Kyle Kastner, Andrew Rosenberg, Bhuvana Ramabhadran, Heiga Zen, Franoise Beaufays, Hadar Shemtov |
| 2024 | Interspeech | FLEURS-R: A Restored Multilingual Speech Corpus for Generation Tasks. | Min Ma, Yuma Koizumi, Shigeki Karita, Heiga Zen, Jason Riesa, Haruko Ishikawa, Michiel Bacchiani |
| 2023 | CoRL | SayTap: Language to Quadrupedal Locomotion. | Yujin Tang, Wenhao Yu, Jie Tan, Heiga Zen, Aleksandra Faust, Tatsuya Harada |
| 2023 | ICASSP | Virtuoso: Massive Multilingual Speech-Text Joint Semi-Supervised Learning for Text-to-Speech. | Takaaki Saeki, Heiga Zen, Zhehuai Chen, Nobuyuki Morioka, Gary Wang, Yu Zhang, Ankur Bapna, Andrew Rosenberg, Bhuvana Ramabhadran |
| 2023 | ICASSP | Lightweight, Multi-Speaker, Multi-Lingual Indic Text-to-Speech. | Abhayjeet Singh, Amala Nagireddi, Deekshitha G, Jesuraja Bandekar, Roopa R., Sandhya Badiger, Sathvik Udupa, Prasanta Kumar Ghosh, Hema A. Murthy, Heiga Zen, Pranaw Kumar, Kamal Kant, Amol Bole, Bira Chandra Singh, Keiichi Tokuda, Mark Hasegawa-Johnson, Philipp Olbrich |
| 2023 | Interspeech | LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus. | Yuma Koizumi, Heiga Zen, Shigeki Karita, Yifan Ding, Kohei Yatabe, Nobuyuki Morioka, Michiel Bacchiani, Yu Zhang, Wei Han, Ankur Bapna |
| 2022 | Interspeech | MAESTRO: Matched Speech Text Representations through Modality Matching. | Zhehuai Chen, Yu Zhang, Andrew Rosenberg, Bhuvana Ramabhadran, Pedro J. Moreno, Ankur Bapna, Heiga Zen |
| 2022 | Interspeech | Training Text-To-Speech Systems From Synthetic Data: A Practical Approach For Accent Transfer Tasks. | Lev Finkelstein, Heiga Zen, Norman Casagrande, Chun-an Chan, Ye Jia, Tom Kenter, Alexey Petelin, Jonathan Shen, Vincent Wan, Yu Zhang, Yonghui Wu, Rob Clark |
| 2022 | Interspeech | SpecGrad: Diffusion Probabilistic Model based Neural Vocoder with Adaptive Noise Spectral Shaping. | Yuma Koizumi, Heiga Zen, Kohei Yatabe, Nanxin Chen, Michiel Bacchiani |
| 2022 | LREC | CVSS Corpus and Massively Multilingual Speech-to-Speech Translation. | Ye Jia, Michelle Tadmor Ramanovich, Quan Wang, Heiga Zen |
| 2021 | ICASSP | Parallel Tacotron: Non-Autoregressive and Controllable TTS. | Isaac Elias, Heiga Zen, Jonathan Shen, Yu Zhang, Ye Jia, Ron J. Weiss, Yonghui Wu |
| 2021 | ICLR | WaveGrad: Estimating Gradients for Waveform Generation. | Nanxin Chen, Yu Zhang, Heiga Zen, Ron J. Weiss, Mohammad Norouzi, William Chan |
| 2021 | Interspeech | Semi-Supervision in ASR: Sequential MixMatch and Factorized TTS-Based Augmentation. | Zhehuai Chen, Andrew Rosenberg, Yu Zhang, Heiga Zen, Mohammadreza Ghodsi, Yinghui Huang, Jesse Emond, Gary Wang, Bhuvana Ramabhadran, Pedro J. Moreno |
| 2021 | Interspeech | WaveGrad 2: Iterative Refinement for Text-to-Speech Synthesis. | Nanxin Chen, Yu Zhang, Heiga Zen, Ron J. Weiss, Mohammad Norouzi, Najim Dehak, William Chan |
| 2021 | Interspeech | Parallel Tacotron 2: A Non-Autoregressive Neural TTS Model with Differentiable Duration Modeling. | Isaac Elias, Heiga Zen, Jonathan Shen, Yu Zhang, Ye Jia, R. J. Skerry-Ryan, Yonghui Wu |
| 2021 | Interspeech | PnG BERT: Augmented BERT on Phonemes and Graphemes for Neural TTS. | Ye Jia, Heiga Zen, Jonathan Shen, Yu Zhang, Yonghui Wu |
| 2020 | ICASSP | Generating Diverse and Natural Text-to-Speech Samples Using a Quantized Fine-Grained VAE and Autoregressive Prosody Prior. | Guangzhi Sun, Yu Zhang, Ron J. Weiss, Yuan Cao, Heiga Zen, Andrew Rosenberg, Bhuvana Ramabhadran, Yonghui Wu |
| 2020 | ICASSP | Fully-Hierarchical Fine-Grained Prosody Modeling For Interpretable Speech Synthesis. | Guangzhi Sun, Yu Zhang, Ron J. Weiss, Yuan Cao, Heiga Zen, Yonghui Wu |
| 2019 | ICLR | Sample Efficient Adaptive Text-to-Speech. | Yutian Chen, Yannis M. Assael, Brendan Shillingford, David Budden, Scott E. Reed, Heiga Zen, Quan Wang, Luis C. Cobo, Andrew Trask, Ben Laurie, aglar Glehre, Aron van den Oord, Oriol Vinyals, Nando de Freitas |
| 2019 | ICLR | Hierarchical Generative Modeling for Controllable Speech Synthesis. | Wei-Ning Hsu, Yu Zhang, Ron J. Weiss, Heiga Zen, Yonghui Wu, Yuxuan Wang, Yuan Cao, Ye Jia, Zhifeng Chen, Jonathan Shen, Patrick Nguyen, Ruoming Pang |
| 2019 | Interspeech | LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech. | Heiga Zen, Viet Dang, Rob Clark, Yu Zhang, Ron J. Weiss, Ye Jia, Zhifeng Chen, Yonghui Wu |
| 2019 | Interspeech | Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning. | Yu Zhang, Ron J. Weiss, Heiga Zen, Yonghui Wu, Zhifeng Chen, R. J. Skerry-Ryan, Ye Jia, Andrew Rosenberg, Bhuvana Ramabhadran |
| 2018 | ICML | Parallel WaveNet: Fast High-Fidelity Speech Synthesis. | Aron van den Oord, Yazhe Li, Igor Babuschkin, Karen Simonyan, Oriol Vinyals, Koray Kavukcuoglu, George van den Driessche, Edward Lockhart, Luis C. Cobo, Florian Stimberg, Norman Casagrande, Dominik Grewe, Seb Noury, Sander Dieleman, Erich Elsen, Nal Kalchbrenner, Heiga Zen, Alex Graves, Helen King, Tom Walters, Dan Belov, Demis Hassabis |
| 2018 | Interspeech | Sequence-to-sequence Neural Network Model with 2D Attention for Learning Japanese Pitch Accents. | Antoine Bruguier, Heiga Zen, Arkady Arkhangorodsky |
| 2016 | ICASSP | Directly modeling voiced and unvoiced components in speech waveforms by neural networks. | Keiichi Tokuda, Heiga Zen |
| 2016 | Interspeech | Multi-Language Multi-Speaker Acoustic Modeling for LSTM-RNN Based Statistical Parametric Speech Synthesis. | Bo Li, Heiga Zen |
| 2016 | Interspeech | Fast, Compact, and High Quality LSTM-RNN Based Statistical Parametric Speech Synthesizers for Mobile Devices. | Heiga Zen, Yannis Agiomyrgiannakis, Niels Egberts, Fergus Henderson, Przemyslaw Szczepaniak |
| 2015 | ICASSP | Directly modeling speech waveforms by neural networks for statistical parametric speech synthesis. | Keiichi Tokuda, Heiga Zen |
| 2015 | ICASSP | Unidirectional long short-term memory recurrent neural network with recurrent output layer for low-latency speech synthesis. | Heiga Zen, Hasim Sak |
| 2014 | ICASSP | Deep mixture density networks for acoustic modeling in statistical parametric speech synthesis. | Heiga Zen, Andrew W. Senior |
| 2013 | ICASSP | Statistical parametric speech synthesis using deep neural networks. | Heiga Zen, Andrew W. Senior, Mike Schuster |
| 2012 | ICASSP | Cepstral analysis based on the glimpse proportion measure for improving the intelligibility of HMM-based synthetic speech in noise. | Cassia Valentini-Botinhao, Ranniery Maia, Junichi Yamagishi, Simon King, Heiga Zen |
| 2012 | Interspeech | Combining multiple high quality corpora for improving HMM-TTS. | Vincent Wan, Javier Latorre, K. K. Chin, Langzhou Chen, Mark J. F. Gales, Heiga Zen, Kate M. Knill, Masami Akamine |
| 2011 | ICASSP | Decision tree-based context clustering based on cross validation and hierarchical priors. | Heiga Zen, Mark J. F. Gales |
| 2011 | Interspeech | Estimation of Window Coefficients for Dynamic Feature Extraction for HMM-Based Speech Synthesis. | Ling-Hui Chen, Yoshihiko Nankaku, Heiga Zen, Keiichi Tokuda, Zhen-Hua Ling, Li-Rong Dai |
| 2011 | Interspeech | Multipulse Sequences for Residual Signal Modeling. | Ranniery Maia, Heiga Zen, Kate M. Knill, Mark J. F. Gales, Sabine Buchholz |
| 2011 | Interspeech | Gaussian Process Experts for Voice Conversion. | Nicholas Pilkington, Heiga Zen, Mark J. F. Gales |
| 2011 | Interspeech | The Effect of Using Normalized Models in Statistical Speech Synthesis. | Matt Shannon, Heiga Zen, William J. Byrne |
| 2010 | ICASSP | Statistical parametric speech synthesis based on product of experts. | Heiga Zen, Mark J. F. Gales, Yoshihiko Nankaku, Keiichi Tokuda |
| 2010 | Interspeech | Training a parametric-based logF0 model with the minimum generation error criterion. | Javier Latorre, Mark J. F. Gales, Heiga Zen |
| 2010 | Interspeech | An implementation of decision tree-based context clustering on graphics processing units. | Nicholas Pilkington, Heiga Zen |
| 2010 | Interspeech | Context adaptive training with factorized decision trees for HMM-based speech synthesis. | Kai Yu, Heiga Zen, Franois Mairesse, Steve J. Young |
| 2010 | Interspeech | Speaker and language adaptive training for HMM-based polyglot speech synthesis. | Heiga Zen |
| 2009 | ICASSP | A Bayesian approach to HMM-based speech synthesis. | Kei Hashimoto, Heiga Zen, Yoshihiko Nankaku, Takashi Masuko, Keiichi Tokuda |
| 2009 | ICASSP | Stereo-based stochastic noise compensation based on trajectory GMMS. | Heiga Zen, Yoshihiko Nankaku, Keiichi Tokuda |
| 2009 | Interspeech | Tying covariance matrices to reduce the footprint of HMM-based speech synthesis systems. | Keiichiro Oura, Heiga Zen, Yoshihiko Nankaku, Akinobu Lee, Keiichi Tokuda |
| 2009 | Interspeech | Context-dependent additive log f_0 model for HMM-based speech synthesis. | Heiga Zen, Norbert Braunschweiler |
| 2008 | ICASSP | Acoustic modeling with contextual additive structure for HMM-based speech recognition. | Yoshihiko Nankaku, Kazuhiro Nakamura, Heiga Zen, Keiichi Tokuda |
| 2008 | ICASSP | Performance evaluation of the speaker-independent HMM-based speech synthesis system "HTS 2007" for the Blizzard Challenge 2007. | Junichi Yamagishi, Takashi Nose, Heiga Zen, Tomoki Toda, Keiichi Tokuda |
| 2008 | Interspeech | Bayesian context clustering using cross valid prior distribution for HMM-based speech recognition. | Kei Hashimoto, Heiga Zen, Yoshihiko Nankaku, Akinobu Lee, Keiichi Tokuda |
| 2008 | Interspeech | Unsupervised adaptation for HMM-based speech synthesis. | Simon King, Keiichi Tokuda, Heiga Zen, Junichi Yamagishi |
| 2008 | Interspeech | Acoustic modeling based on model structure annealing for speech recognition. | Sayaka Shiota, Kei Hashimoto, Heiga Zen, Yoshihiko Nankaku, Akinobu Lee, Keiichi Tokuda |
| 2008 | Interspeech | Probabilistic feature mapping based on trajectory HMMs. | Heiga Zen, Yoshihiko Nankaku, Keiichi Tokuda |
| 2007 | ICASSP | Statistical Parametric Speech Synthesis. | Alan W. Black, Heiga Zen, Keiichi Tokuda |
| 2007 | Interspeech | A trainable excitation model for HMM-based speech synthesis. | Ranniery Maia, Tomoki Toda, Heiga Zen, Yoshihiko Nankaku, Keiichi Tokuda |
| 2007 | Interspeech | Model-space MLLR for trajectory HMMs. | Heiga Zen, Yoshihiko Nankaku, Keiichi Tokuda |
| 2006 | ICASSP | Hidden Semi-Markov Model Based Speech Recognition System using Weighted Finite-State Transducer. | Keiichiro Oura, Heiga Zen, Yoshihiko Nankaku, Akinobu Lee, Keiichi Tokuda |
| 2006 | ICASSP | Estimating Trajectory Hmm Parameters Using Monte Carlo Em With Gibbs Sampler. | Heiga Zen, Yoshihiko Nankaku, Keiichi Tokuda, Tadashi Kitamura |
| 2006 | Interspeech | An HMM-based singing voice synthesis system. | Keijiro Saino, Heiga Zen, Yoshihiko Nankaku, Akinobu Lee, Keiichi Tokuda |
| 2006 | Interspeech | Speaker adaptation of trajectory HMMs using feature-space MLLR. | Heiga Zen, Yoshihiko Nankaku, Keiichi Tokuda, Tadashi Kitamura |
| 2005 | ICASSP | Sparse KPCA for Feature Extraction in Speech Recognition. | Amaro A. de Lima, Heiga Zen, Yoshihiko Nankaku, Keiichi Tokuda, Tadashi Kitamura, Fernando Gil Resende |
| 2005 | Interspeech | On building a concatenative speech synthesis system from the blizzard challenge speech databases. | Wael Hamza, Raimo Bakis, Zhiwei Shuang, Heiga Zen |
| 2005 | Interspeech | An overview of nitech HMM-based speech synthesis system for blizzard challenge 2005. | Heiga Zen, Tomoki Toda |
| 2004 | ICASSP | A Viterbi algorithm for a trajectory model derived from HMM with explicit relationship between static and dynamic features. | Heiga Zen, Keiichi Tokuda, Tadashi Kitamura |
| 2004 | Interspeech | Deterministic annealing EM algorithm in parameter estimation for acoustic model. | Yohei Itaya, Heiga Zen, Yoshihiko Nankaku, Chiyomi Miyajima, Keiichi Tokuda, Tadashi Kitamura |
| 2004 | Interspeech | Constructing emotional speech synthesizers with limited speech database. | Heiga Zen, Tadashi Kitamura, Murtaza Bulut, Shrikanth S. Narayanan, Ryosuke Tsuzuki, Keiichi Tokuda |
| 2004 | Interspeech | Hidden semi-Markov model based speech synthesis. | Heiga Zen, Keiichi Tokuda, Takashi Masuko, Takao Kobayashi, Tadashi Kitamura |
| 2003 | ICASSP | Improving the performance of HMM-based very low bit rate speech coding. | Takahiro Hoshiya, Shinji Sako, Heiga Zen, Keiichi Tokuda, Takashi Masuko, Takao Kobayashi, Tadashi Kitamura |
| 2003 | ICASSP | Speech recognition using voice-characteristic-dependent acoustic models. | Hiroyuki Suzuki, Heiga Zen, Yoshihiko Nankaku, Chiyomi Miyajima, Keiichi Tokuda, Tadashi Kitamura |
| 2003 | Interspeech | On the use of kernel PCA for feature extraction in speech recognition. | Amaro A. de Lima, Heiga Zen, Yoshihiko Nankaku, Chiyomi Miyajima, Keiichi Tokuda, Tadashi Kitamura |
| 2003 | Interspeech | Towards the development of a brazilian portuguese text-to-speech system based on HMM. | Ranniery Maia, Heiga Zen, Keiichi Tokuda, Tadashi Kitamura, Fernando Gil Vianna Resende Jr. |
| 2003 | Interspeech | Trajectory modeling based on HMMs with the explicit relationship between static and dynamic features. | Keiichi Tokuda, Heiga Zen, Tadashi Kitamura |
| 2003 | Interspeech | Decision tree-based simultaneous clustering of phonetic contexts, dimensions, and state positions for acoustic modeling. | Heiga Zen, Keiichi Tokuda, Tadashi Kitamura |
| 2002 | Interspeech | Decision tree distribution tying based on a dimensional split technique. | Heiga Zen, Keiichi Tokuda, Tadashi Kitamura |