| 2024 | EMNLP | A Two-Step Approach for Data-Efficient French Pronunciation Learning. | Hoyeon Lee, Hyeeun Jang, Jong-Hwan Kim, Jae-Min Kim |
| 2024 | ICASSP | Enhancing Multilingual TTS with Voice Conversion Based Data Augmentation and Posterior Embedding. | Hyun-Wook Yoon, Jin-Seob Kim, Ryuichi Yamamoto, Ryo Terashima, Chan-Ho Song, Jae-Min Kim, Eunwoo Song |
| 2023 | ICASSP | Period VITS: Variational Inference with Explicit Pitch Modeling for End-To-End Emotional Speech Synthesis. | Yuma Shirahata, Ryuichi Yamamoto, Eunwoo Song, Ryo Terashima, Jae-Min Kim, Kentaro Tachibana |
| 2023 | Interspeech | Cross-Lingual Transfer Learning for Phrase Break Prediction with Multilingual Language Model. | Hoyeon Lee, Hyun-Wook Yoon, Jong-Hwan Kim, Jae-Min Kim |
| 2022 | Interspeech | TTS-by-TTS 2: Data-Selective Augmentation for Neural Speech Synthesis Using Ranking Support Vector Machine with Variational Autoencoder. | Eunwoo Song, Ryuichi Yamamoto, Ohsung Kwon, Chan-Ho Song, Min-Jae Hwang, Suhyeon Oh, Hyun-Wook Yoon, Jin-Seob Kim, Jae-Min Kim |
| 2022 | Interspeech | Cross-Speaker Emotion Transfer for Low-Resource Text-to-Speech Using Non-Parallel Voice Conversion with Pitch-Shift Data Augmentation. | Ryo Terashima, Ryuichi Yamamoto, Eunwoo Song, Yuma Shirahata, Hyun-Wook Yoon, Jae-Min Kim, Kentaro Tachibana |
| 2022 | Interspeech | Language Model-Based Emotion Prediction Methods for Emotional Speech Synthesis Systems. | Hyun-Wook Yoon, Ohsung Kwon, Hoyeon Lee, Ryuichi Yamamoto, Eunwoo Song, Jae-Min Kim, Min-Jae Hwang |
| 2022 | NAACL | Fast Bilingual Grapheme-To-Phoneme Conversion. | Hwa-Yeon Kim, Jong-Hwan Kim, Jae-Min Kim |
| 2021 | ICASSP | TTS-by-TTS: TTS-Driven Data Augmentation for Fast and High-Quality Speech Synthesis. | Min-Jae Hwang, Ryuichi Yamamoto, Eunwoo Song, Jae-Min Kim |
| 2021 | ICASSP | NN-KOG2P: A Novel Grapheme-to-Phoneme Model for Korean Language. | Hwa-Yeon Kim, Jong-Hwan Kim, Jae-Min Kim |
| 2021 | ICASSP | Parallel Waveform Synthesis Based on Generative Adversarial Networks with Voicing-Aware Conditional Discriminators. | Ryuichi Yamamoto, Eunwoo Song, Min-Jae Hwang, Jae-Min Kim |
| 2021 | Interspeech | Label Embedding for Chinese Grapheme-to-Phoneme Conversion. | Eunbi Choi, Hwa-Yeon Kim, Jong-Hwan Kim, Jae-Min Kim |
| 2021 | Interspeech | High-Fidelity Parallel WaveGAN with Multi-Band Harmonic-Plus-Noise Model. | Min-Jae Hwang, Ryuichi Yamamoto, Eunwoo Song, Jae-Min Kim |
| 2020 | ICASSP | Parallel Wavegan: A Fast Waveform Generation Model Based on Generative Adversarial Networks with Multi-Resolution Spectrogram. | Ryuichi Yamamoto, Eunwoo Song, Jae-Min Kim |
| 2020 | Interspeech | Neural Text-to-Speech with a Modeling-by-Generation Excitation Vocoder. | Eunwoo Song, Min-Jae Hwang, Ryuichi Yamamoto, Jin-Seob Kim, Ohsung Kwon, Jae-Min Kim |
| 2019 | Interspeech | Probability Density Distillation with Generative Adversarial Networks for High-Quality Parallel Waveform Generation. | Ryuichi Yamamoto, Eunwoo Song, Jae-Min Kim |