| 2025 | ICASSP | Rethinking Mean Opinion Scores in Speech Quality Assessment: Score Aggregation through Quantized Distribution Fitting. | Yuto Kondo, Hirokazu Kameoka, Kou Tanaka, Takuhiro Kaneko |
| 2025 | Interspeech | FasterVoiceGrad: Faster One-step Diffusion-Based Voice Conversion with Adversarial Diffusion Conversion Distillation. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Yuto Kondo |
| 2025 | Interspeech | Vocoder-Projected Feature Discriminator. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Yuto Kondo |
| 2025 | Interspeech | JIS: A Speech Corpus of Japanese Idol Speakers with Various Speaking Styles. | Yuto Kondo, Hirokazu Kameoka, Kou Tanaka, Takuhiro Kaneko |
| 2024 | ICASSP | Training Generative Adversarial Network-Based Vocoder with Limited Data Using Augmentation-Conditional Discriminator. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka |
| 2024 | ICASSP | Selecting N-Lowest Scores for Training MOS Prediction Models. | Yuto Kondo, Hirokazu Kameoka, Kou Tanaka, Takuhiro Kaneko |
| 2024 | Interspeech | FastVoiceGrad: One-step Diffusion-Based Voice Conversion with Adversarial Conditional Diffusion Distillation. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Yuto Kondo |
| 2024 | Interspeech | PRVAE-VC2: Non-Parallel Voice Conversion by Distillation of Speech Representations. | Kou Tanaka, Hirokazu Kameoka, Takuhiro Kaneko, Yuto Kondo |
| 2023 | ICASSP | Wave-U-Net Discriminator: Fast and Lightweight Discriminator for Generative Adversarial Network-Based Speech Synthesis. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Shogo Seki |
| 2023 | ICASSP | JSV-VC: Jointly Trained Speaker Verification and Voice Conversion Models. | Shogo Seki, Hirokazu Kameoka, Kou Tanaka, Takuhiro Kaneko |
| 2023 | Interspeech | iSTFTNet2: Faster and More Lightweight iSTFT-Based Neural Vocoder Using 1D-2D CNN. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Shogo Seki |
| 2023 | Interspeech | CFVC: Conditional Filtering for Controllable Voice Conversion. | Kou Tanaka, Takuhiro Kaneko, Hirokazu Kameoka, Shogo Seki |
| 2022 | ICASSP | ISTFTNET: Fast and Lightweight Mel-Spectrogram Vocoder Incorporating Inverse Short-Time Fourier Transform. | Takuhiro Kaneko, Kou Tanaka, Hirokazu Kameoka, Shogo Seki |
| 2022 | Interspeech | CAUSE: Crossmodal Action Unit Sequence Estimation from Speech. | Hirokazu Kameoka, Takuhiro Kaneko, Shogo Seki, Kou Tanaka |
| 2022 | Interspeech | MISRNet: Lightweight Neural Vocoder Using Multi-Input Single Shared Residual Blocks. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Shogo Seki |
| 2021 | ICASSP | Maskcyclegan-VC: Learning Non-Parallel Voice Conversion with Filling in Frames. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Nobukatsu Hojo |
| 2020 | Interspeech | CycleGAN-VC3: Examining and Improving CycleGAN-VCs for Mel-Spectrogram Conversion. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Nobukatsu Hojo |
| 2020 | SIGdial | Collection and Analysis of Dialogues Provided by Two Speakers Acting as One. | Tsunehiro Arimoto, Ryuichiro Higashinaka, Kou Tanaka, Takahito Kawanishi, Hiroaki Sugiyama, Hiroshi Sawada, Hiroshi Ishiguro |
| 2019 | ICASSP | Cyclegan-VC2: Improved Cyclegan-based Non-parallel Voice Conversion. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Nobukatsu Hojo |
| 2019 | ICASSP | ATTS2S-VC: Sequence-to-sequence Voice Conversion with Attention and Context Preservation Mechanisms. | Kou Tanaka, Hirokazu Kameoka, Takuhiro Kaneko, Nobukatsu Hojo |
| 2019 | Interspeech | StarGAN-VC2: Rethinking Conditional Methods for StarGAN-Based Voice Conversion. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Nobukatsu Hojo |
| 2018 | ICASSP | Vae-Space: Deep Generative Model of Voice Fundamental Frequency Contours. | Kou Tanaka, Hirokazu Kameoka, Kazuho Morikawa |
| 2017 | Interspeech | Physically Constrained Statistical F | Kou Tanaka, Hirokazu Kameoka, Tomoki Toda, Satoshi Nakamura |
| 2016 | ICASSP | Statistical F0 prediction for electrolaryngeal speech enhancement considering generative process of F0 contours within product of experts framework. | Kou Tanaka, Hirokazu Kameoka, Tomoki Toda, Satoshi Nakamura |
| 2015 | ASSETS | An Enhanced Electrolarynx with Automatic Fundamental Frequency Control based on Statistical Prediction. | Kou Tanaka, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2015 | Interspeech | Non-audible murmur enhancement based on statistical conversion using air- and body-conductive microphones in noisy environments. | Yusuke Tajiri, Kou Tanaka, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2014 | ICASSP | An evaluation of excitation feature prediction in a hybrid approach to electrolaryngeal speech enhancement. | Kou Tanaka, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2014 | Interspeech | Direct F | Kou Tanaka, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2013 | Interspeech | A hybrid approach to electrolaryngeal speech enhancement based on spectral subtraction and statistical voice conversion. | Kou Tanaka, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |