Skip to content

Heiga Zen

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

76

Venues

6

Active years

2002–2025

Best venue rank

A*

Where they publish

Papers

76 indexed papers, newest first.

YearVenueTitleAuthors
2025ICASSPSimulTron: On-Device Simultaneous Speech to Speech Translation.Alex Agranovich, Eliya Nachmani, Oleg Rybakov, Yifan Ding, Ye Jia, Nadav Bar, Heiga Zen, Michelle Tadmor Ramanovich
2024ICASSPTranslatotron 3: Speech to Speech Translation with Monolingual Data.Eliya Nachmani, Alon Levkovitch, Yifan Ding, Chulayuth Asawaroengchai, Heiga Zen, Michelle Tadmor Ramanovich
2024ICASSPExtending Multilingual Speech Synthesis to 100+ Languages without Transcribed Data.Takaaki Saeki, Gary Wang, Nobuyuki Morioka, Isaac Elias, Kyle Kastner, Andrew Rosenberg, Bhuvana Ramabhadran, Heiga Zen, Franoise Beaufays, Hadar Shemtov
2024InterspeechFLEURS-R: A Restored Multilingual Speech Corpus for Generation Tasks.Min Ma, Yuma Koizumi, Shigeki Karita, Heiga Zen, Jason Riesa, Haruko Ishikawa, Michiel Bacchiani
2023CoRLSayTap: Language to Quadrupedal Locomotion.Yujin Tang, Wenhao Yu, Jie Tan, Heiga Zen, Aleksandra Faust, Tatsuya Harada
2023ICASSPVirtuoso: Massive Multilingual Speech-Text Joint Semi-Supervised Learning for Text-to-Speech.Takaaki Saeki, Heiga Zen, Zhehuai Chen, Nobuyuki Morioka, Gary Wang, Yu Zhang, Ankur Bapna, Andrew Rosenberg, Bhuvana Ramabhadran
2023ICASSPLightweight, Multi-Speaker, Multi-Lingual Indic Text-to-Speech.Abhayjeet Singh, Amala Nagireddi, Deekshitha G, Jesuraja Bandekar, Roopa R., Sandhya Badiger, Sathvik Udupa, Prasanta Kumar Ghosh, Hema A. Murthy, Heiga Zen, Pranaw Kumar, Kamal Kant, Amol Bole, Bira Chandra Singh, Keiichi Tokuda, Mark Hasegawa-Johnson, Philipp Olbrich
2023InterspeechLibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus.Yuma Koizumi, Heiga Zen, Shigeki Karita, Yifan Ding, Kohei Yatabe, Nobuyuki Morioka, Michiel Bacchiani, Yu Zhang, Wei Han, Ankur Bapna
2022InterspeechMAESTRO: Matched Speech Text Representations through Modality Matching.Zhehuai Chen, Yu Zhang, Andrew Rosenberg, Bhuvana Ramabhadran, Pedro J. Moreno, Ankur Bapna, Heiga Zen
2022InterspeechTraining Text-To-Speech Systems From Synthetic Data: A Practical Approach For Accent Transfer Tasks.Lev Finkelstein, Heiga Zen, Norman Casagrande, Chun-an Chan, Ye Jia, Tom Kenter, Alexey Petelin, Jonathan Shen, Vincent Wan, Yu Zhang, Yonghui Wu, Rob Clark
2022InterspeechSpecGrad: Diffusion Probabilistic Model based Neural Vocoder with Adaptive Noise Spectral Shaping.Yuma Koizumi, Heiga Zen, Kohei Yatabe, Nanxin Chen, Michiel Bacchiani
2022LRECCVSS Corpus and Massively Multilingual Speech-to-Speech Translation.Ye Jia, Michelle Tadmor Ramanovich, Quan Wang, Heiga Zen
2021ICASSPParallel Tacotron: Non-Autoregressive and Controllable TTS.Isaac Elias, Heiga Zen, Jonathan Shen, Yu Zhang, Ye Jia, Ron J. Weiss, Yonghui Wu
2021ICLRWaveGrad: Estimating Gradients for Waveform Generation.Nanxin Chen, Yu Zhang, Heiga Zen, Ron J. Weiss, Mohammad Norouzi, William Chan
2021InterspeechSemi-Supervision in ASR: Sequential MixMatch and Factorized TTS-Based Augmentation.Zhehuai Chen, Andrew Rosenberg, Yu Zhang, Heiga Zen, Mohammadreza Ghodsi, Yinghui Huang, Jesse Emond, Gary Wang, Bhuvana Ramabhadran, Pedro J. Moreno
2021InterspeechWaveGrad 2: Iterative Refinement for Text-to-Speech Synthesis.Nanxin Chen, Yu Zhang, Heiga Zen, Ron J. Weiss, Mohammad Norouzi, Najim Dehak, William Chan
2021InterspeechParallel Tacotron 2: A Non-Autoregressive Neural TTS Model with Differentiable Duration Modeling.Isaac Elias, Heiga Zen, Jonathan Shen, Yu Zhang, Ye Jia, R. J. Skerry-Ryan, Yonghui Wu
2021InterspeechPnG BERT: Augmented BERT on Phonemes and Graphemes for Neural TTS.Ye Jia, Heiga Zen, Jonathan Shen, Yu Zhang, Yonghui Wu
2020ICASSPGenerating Diverse and Natural Text-to-Speech Samples Using a Quantized Fine-Grained VAE and Autoregressive Prosody Prior.Guangzhi Sun, Yu Zhang, Ron J. Weiss, Yuan Cao, Heiga Zen, Andrew Rosenberg, Bhuvana Ramabhadran, Yonghui Wu
2020ICASSPFully-Hierarchical Fine-Grained Prosody Modeling For Interpretable Speech Synthesis.Guangzhi Sun, Yu Zhang, Ron J. Weiss, Yuan Cao, Heiga Zen, Yonghui Wu
2019ICLRSample Efficient Adaptive Text-to-Speech.Yutian Chen, Yannis M. Assael, Brendan Shillingford, David Budden, Scott E. Reed, Heiga Zen, Quan Wang, Luis C. Cobo, Andrew Trask, Ben Laurie, aglar Glehre, Aron van den Oord, Oriol Vinyals, Nando de Freitas
2019ICLRHierarchical Generative Modeling for Controllable Speech Synthesis.Wei-Ning Hsu, Yu Zhang, Ron J. Weiss, Heiga Zen, Yonghui Wu, Yuxuan Wang, Yuan Cao, Ye Jia, Zhifeng Chen, Jonathan Shen, Patrick Nguyen, Ruoming Pang
2019InterspeechLibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech.Heiga Zen, Viet Dang, Rob Clark, Yu Zhang, Ron J. Weiss, Ye Jia, Zhifeng Chen, Yonghui Wu
2019InterspeechLearning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning.Yu Zhang, Ron J. Weiss, Heiga Zen, Yonghui Wu, Zhifeng Chen, R. J. Skerry-Ryan, Ye Jia, Andrew Rosenberg, Bhuvana Ramabhadran
2018ICMLParallel WaveNet: Fast High-Fidelity Speech Synthesis.Aron van den Oord, Yazhe Li, Igor Babuschkin, Karen Simonyan, Oriol Vinyals, Koray Kavukcuoglu, George van den Driessche, Edward Lockhart, Luis C. Cobo, Florian Stimberg, Norman Casagrande, Dominik Grewe, Seb Noury, Sander Dieleman, Erich Elsen, Nal Kalchbrenner, Heiga Zen, Alex Graves, Helen King, Tom Walters, Dan Belov, Demis Hassabis
2018InterspeechSequence-to-sequence Neural Network Model with 2D Attention for Learning Japanese Pitch Accents.Antoine Bruguier, Heiga Zen, Arkady Arkhangorodsky
2016ICASSPDirectly modeling voiced and unvoiced components in speech waveforms by neural networks.Keiichi Tokuda, Heiga Zen
2016InterspeechMulti-Language Multi-Speaker Acoustic Modeling for LSTM-RNN Based Statistical Parametric Speech Synthesis.Bo Li, Heiga Zen
2016InterspeechFast, Compact, and High Quality LSTM-RNN Based Statistical Parametric Speech Synthesizers for Mobile Devices.Heiga Zen, Yannis Agiomyrgiannakis, Niels Egberts, Fergus Henderson, Przemyslaw Szczepaniak
2015ICASSPDirectly modeling speech waveforms by neural networks for statistical parametric speech synthesis.Keiichi Tokuda, Heiga Zen
2015ICASSPUnidirectional long short-term memory recurrent neural network with recurrent output layer for low-latency speech synthesis.Heiga Zen, Hasim Sak
2014ICASSPDeep mixture density networks for acoustic modeling in statistical parametric speech synthesis.Heiga Zen, Andrew W. Senior
2013ICASSPStatistical parametric speech synthesis using deep neural networks.Heiga Zen, Andrew W. Senior, Mike Schuster
2012ICASSPCepstral analysis based on the glimpse proportion measure for improving the intelligibility of HMM-based synthetic speech in noise.Cassia Valentini-Botinhao, Ranniery Maia, Junichi Yamagishi, Simon King, Heiga Zen
2012InterspeechCombining multiple high quality corpora for improving HMM-TTS.Vincent Wan, Javier Latorre, K. K. Chin, Langzhou Chen, Mark J. F. Gales, Heiga Zen, Kate M. Knill, Masami Akamine
2011ICASSPDecision tree-based context clustering based on cross validation and hierarchical priors.Heiga Zen, Mark J. F. Gales
2011InterspeechEstimation of Window Coefficients for Dynamic Feature Extraction for HMM-Based Speech Synthesis.Ling-Hui Chen, Yoshihiko Nankaku, Heiga Zen, Keiichi Tokuda, Zhen-Hua Ling, Li-Rong Dai
2011InterspeechMultipulse Sequences for Residual Signal Modeling.Ranniery Maia, Heiga Zen, Kate M. Knill, Mark J. F. Gales, Sabine Buchholz
2011InterspeechGaussian Process Experts for Voice Conversion.Nicholas Pilkington, Heiga Zen, Mark J. F. Gales
2011InterspeechThe Effect of Using Normalized Models in Statistical Speech Synthesis.Matt Shannon, Heiga Zen, William J. Byrne
2010ICASSPStatistical parametric speech synthesis based on product of experts.Heiga Zen, Mark J. F. Gales, Yoshihiko Nankaku, Keiichi Tokuda
2010InterspeechTraining a parametric-based logF0 model with the minimum generation error criterion.Javier Latorre, Mark J. F. Gales, Heiga Zen
2010InterspeechAn implementation of decision tree-based context clustering on graphics processing units.Nicholas Pilkington, Heiga Zen
2010InterspeechContext adaptive training with factorized decision trees for HMM-based speech synthesis.Kai Yu, Heiga Zen, Franois Mairesse, Steve J. Young
2010InterspeechSpeaker and language adaptive training for HMM-based polyglot speech synthesis.Heiga Zen
2009ICASSPA Bayesian approach to HMM-based speech synthesis.Kei Hashimoto, Heiga Zen, Yoshihiko Nankaku, Takashi Masuko, Keiichi Tokuda
2009ICASSPStereo-based stochastic noise compensation based on trajectory GMMS.Heiga Zen, Yoshihiko Nankaku, Keiichi Tokuda
2009InterspeechTying covariance matrices to reduce the footprint of HMM-based speech synthesis systems.Keiichiro Oura, Heiga Zen, Yoshihiko Nankaku, Akinobu Lee, Keiichi Tokuda
2009InterspeechContext-dependent additive log f_0 model for HMM-based speech synthesis.Heiga Zen, Norbert Braunschweiler
2008ICASSPAcoustic modeling with contextual additive structure for HMM-based speech recognition.Yoshihiko Nankaku, Kazuhiro Nakamura, Heiga Zen, Keiichi Tokuda
2008ICASSPPerformance evaluation of the speaker-independent HMM-based speech synthesis system "HTS 2007" for the Blizzard Challenge 2007.Junichi Yamagishi, Takashi Nose, Heiga Zen, Tomoki Toda, Keiichi Tokuda
2008InterspeechBayesian context clustering using cross valid prior distribution for HMM-based speech recognition.Kei Hashimoto, Heiga Zen, Yoshihiko Nankaku, Akinobu Lee, Keiichi Tokuda
2008InterspeechUnsupervised adaptation for HMM-based speech synthesis.Simon King, Keiichi Tokuda, Heiga Zen, Junichi Yamagishi
2008InterspeechAcoustic modeling based on model structure annealing for speech recognition.Sayaka Shiota, Kei Hashimoto, Heiga Zen, Yoshihiko Nankaku, Akinobu Lee, Keiichi Tokuda
2008InterspeechProbabilistic feature mapping based on trajectory HMMs.Heiga Zen, Yoshihiko Nankaku, Keiichi Tokuda
2007ICASSPStatistical Parametric Speech Synthesis.Alan W. Black, Heiga Zen, Keiichi Tokuda
2007InterspeechA trainable excitation model for HMM-based speech synthesis.Ranniery Maia, Tomoki Toda, Heiga Zen, Yoshihiko Nankaku, Keiichi Tokuda
2007InterspeechModel-space MLLR for trajectory HMMs.Heiga Zen, Yoshihiko Nankaku, Keiichi Tokuda
2006ICASSPHidden Semi-Markov Model Based Speech Recognition System using Weighted Finite-State Transducer.Keiichiro Oura, Heiga Zen, Yoshihiko Nankaku, Akinobu Lee, Keiichi Tokuda
2006ICASSPEstimating Trajectory Hmm Parameters Using Monte Carlo Em With Gibbs Sampler.Heiga Zen, Yoshihiko Nankaku, Keiichi Tokuda, Tadashi Kitamura
2006InterspeechAn HMM-based singing voice synthesis system.Keijiro Saino, Heiga Zen, Yoshihiko Nankaku, Akinobu Lee, Keiichi Tokuda
2006InterspeechSpeaker adaptation of trajectory HMMs using feature-space MLLR.Heiga Zen, Yoshihiko Nankaku, Keiichi Tokuda, Tadashi Kitamura
2005ICASSPSparse KPCA for Feature Extraction in Speech Recognition.Amaro A. de Lima, Heiga Zen, Yoshihiko Nankaku, Keiichi Tokuda, Tadashi Kitamura, Fernando Gil Resende
2005InterspeechOn building a concatenative speech synthesis system from the blizzard challenge speech databases.Wael Hamza, Raimo Bakis, Zhiwei Shuang, Heiga Zen
2005InterspeechAn overview of nitech HMM-based speech synthesis system for blizzard challenge 2005.Heiga Zen, Tomoki Toda
2004ICASSPA Viterbi algorithm for a trajectory model derived from HMM with explicit relationship between static and dynamic features.Heiga Zen, Keiichi Tokuda, Tadashi Kitamura
2004InterspeechDeterministic annealing EM algorithm in parameter estimation for acoustic model.Yohei Itaya, Heiga Zen, Yoshihiko Nankaku, Chiyomi Miyajima, Keiichi Tokuda, Tadashi Kitamura
2004InterspeechConstructing emotional speech synthesizers with limited speech database.Heiga Zen, Tadashi Kitamura, Murtaza Bulut, Shrikanth S. Narayanan, Ryosuke Tsuzuki, Keiichi Tokuda
2004InterspeechHidden semi-Markov model based speech synthesis.Heiga Zen, Keiichi Tokuda, Takashi Masuko, Takao Kobayashi, Tadashi Kitamura
2003ICASSPImproving the performance of HMM-based very low bit rate speech coding.Takahiro Hoshiya, Shinji Sako, Heiga Zen, Keiichi Tokuda, Takashi Masuko, Takao Kobayashi, Tadashi Kitamura
2003ICASSPSpeech recognition using voice-characteristic-dependent acoustic models.Hiroyuki Suzuki, Heiga Zen, Yoshihiko Nankaku, Chiyomi Miyajima, Keiichi Tokuda, Tadashi Kitamura
2003InterspeechOn the use of kernel PCA for feature extraction in speech recognition.Amaro A. de Lima, Heiga Zen, Yoshihiko Nankaku, Chiyomi Miyajima, Keiichi Tokuda, Tadashi Kitamura
2003InterspeechTowards the development of a brazilian portuguese text-to-speech system based on HMM.Ranniery Maia, Heiga Zen, Keiichi Tokuda, Tadashi Kitamura, Fernando Gil Vianna Resende Jr.
2003InterspeechTrajectory modeling based on HMMs with the explicit relationship between static and dynamic features.Keiichi Tokuda, Heiga Zen, Tadashi Kitamura
2003InterspeechDecision tree-based simultaneous clustering of phonetic contexts, dimensions, and state positions for acoustic modeling.Heiga Zen, Keiichi Tokuda, Tadashi Kitamura
2002InterspeechDecision tree distribution tying based on a dimensional split technique.Heiga Zen, Keiichi Tokuda, Tadashi Kitamura