| 2025 | ICASSP | Rethinking Mean Opinion Scores in Speech Quality Assessment: Score Aggregation through Quantized Distribution Fitting. | Yuto Kondo, Hirokazu Kameoka, Kou Tanaka, Takuhiro Kaneko |
| 2025 | Interspeech | FasterVoiceGrad: Faster One-step Diffusion-Based Voice Conversion with Adversarial Diffusion Conversion Distillation. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Yuto Kondo |
| 2025 | Interspeech | Vocoder-Projected Feature Discriminator. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Yuto Kondo |
| 2025 | Interspeech | JIS: A Speech Corpus of Japanese Idol Speakers with Various Speaking Styles. | Yuto Kondo, Hirokazu Kameoka, Kou Tanaka, Takuhiro Kaneko |
| 2024 | ICASSP | Training Generative Adversarial Network-Based Vocoder with Limited Data Using Augmentation-Conditional Discriminator. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka |
| 2024 | ICASSP | Selecting N-Lowest Scores for Training MOS Prediction Models. | Yuto Kondo, Hirokazu Kameoka, Kou Tanaka, Takuhiro Kaneko |
| 2024 | Interspeech | FastVoiceGrad: One-step Diffusion-Based Voice Conversion with Adversarial Conditional Diffusion Distillation. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Yuto Kondo |
| 2024 | Interspeech | PRVAE-VC2: Non-Parallel Voice Conversion by Distillation of Speech Representations. | Kou Tanaka, Hirokazu Kameoka, Takuhiro Kaneko, Yuto Kondo |
| 2023 | ICASSP | Wave-U-Net Discriminator: Fast and Lightweight Discriminator for Generative Adversarial Network-Based Speech Synthesis. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Shogo Seki |
| 2023 | ICASSP | JSV-VC: Jointly Trained Speaker Verification and Voice Conversion Models. | Shogo Seki, Hirokazu Kameoka, Kou Tanaka, Takuhiro Kaneko |
| 2023 | Interspeech | iSTFTNet2: Faster and More Lightweight iSTFT-Based Neural Vocoder Using 1D-2D CNN. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Shogo Seki |
| 2023 | Interspeech | CFVC: Conditional Filtering for Controllable Voice Conversion. | Kou Tanaka, Takuhiro Kaneko, Hirokazu Kameoka, Shogo Seki |
| 2022 | ICASSP | Attentionpit: Soft Permutation Invariant Training for Audio Source Separation with Attention Mechanism. | Hirokazu Kameoka, Shogo Seki, Li Li, Chihiro Watanabe |
| 2022 | ICASSP | ISTFTNET: Fast and Lightweight Mel-Spectrogram Vocoder Incorporating Inverse Short-Time Fourier Transform. | Takuhiro Kaneko, Kou Tanaka, Hirokazu Kameoka, Shogo Seki |
| 2022 | ICASSP | HBP: An Efficient Block Permutation Solver Using Hungarian Algorithm and Spectrogram Inpainting for Multichannel Audio Source Separation. | Li Li, Hirokazu Kameoka, Shogo Seki |
| 2022 | ICASSP | Investigation And Comparison of Optimization Methods for Variational Autoencoder-Based Underdetermined Multichannel Source Separation. | Shogo Seki, Hirokazu Kameoka, Li Li |
| 2022 | Interspeech | CAUSE: Crossmodal Action Unit Sequence Estimation from Speech. | Hirokazu Kameoka, Takuhiro Kaneko, Shogo Seki, Kou Tanaka |
| 2022 | Interspeech | MISRNet: Lightweight Neural Vocoder Using Multi-Input Single Shared Residual Blocks. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Shogo Seki |
| 2021 | ICASSP | SepNet: A Deep Separation Matrix Prediction Network for Multichannel Audio Source Separation. | Shota Inoue, Hirokazu Kameoka, Li Li, Shoji Makino |
| 2021 | ICASSP | Maskcyclegan-VC: Learning Non-Parallel Voice Conversion with Filling in Frames. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Nobukatsu Hojo |
| 2021 | Interspeech | StarGAN-VC+ASR: StarGAN-Based Non-Parallel Voice Conversion Regularized by Automatic Speech Recognition. | Shoki Sakamoto, Akira Taniguchi, Tadahiro Taniguchi, Hirokazu Kameoka |
| 2020 | Interspeech | Voice Transformer Network: Sequence-to-Sequence Voice Conversion Using Transformer with Text-to-Speech Pretraining. | Wen-Chin Huang, Tomoki Hayashi, Yi-Chiao Wu, Hirokazu Kameoka, Tomoki Toda |
| 2020 | Interspeech | CycleGAN-VC3: Examining and Improving CycleGAN-VCs for Mel-Spectrogram Conversion. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Nobukatsu Hojo |
| 2019 | ICASSP | Joint Separation and Dereverberation of Reverberant Mixtures with Multichannel Variational Autoencoder. | Shota Inoue, Hirokazu Kameoka, Li Li, Shogo Seki, Shoji Makino |
| 2019 | ICASSP | Seeing through Sounds: Predicting Visual Semantic Segmentation Results from Multichannel Audio Signals. | Go Irie, Mirela Ostrek, Haochen Wang, Hirokazu Kameoka, Akisato Kimura, Takahito Kawanishi, Kunio Kashino |
| 2019 | ICASSP | Cyclegan-VC2: Improved Cyclegan-based Non-parallel Voice Conversion. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Nobukatsu Hojo |
| 2019 | ICASSP | Fast MVAE: Joint Separation and Classification of Mixed Sources Based on Multichannel Variational Autoencoder with Auxiliary Classifier. | Li Li, Hirokazu Kameoka, Shoji Makino |
| 2019 | ICASSP | ATTS2S-VC: Sequence-to-sequence Voice Conversion with Attention and Context Preservation Mechanisms. | Kou Tanaka, Hirokazu Kameoka, Takuhiro Kaneko, Nobukatsu Hojo |
| 2019 | Interspeech | StarGAN-VC2: Rethinking Conditional Methods for StarGAN-Based Voice Conversion. | Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Nobukatsu Hojo |
| 2019 | Interspeech | A Modified Algorithm for Multiple Input Spectrogram Inversion. | Dongxiao Wang, Hirokazu Kameoka, Koichi Shinoda |
| 2018 | ICASSP | Speech Waveform Synthesis from MFCC Sequences with Generative Adversarial Networks. | Lauri Juvela, Bajibabu Bollepalli, Xin Wang, Hirokazu Kameoka, Manu Airaksinen, Junichi Yamagishi, Paavo Alku |
| 2018 | ICASSP | Joint Separation and Dereverberation of Reverberant Mixtures with Determined Multichannel Non-Negative Matrix Factorization. | Hideaki Kagami, Hirokazu Kameoka, Masahiro Yukawa |
| 2018 | ICASSP | Deep Clustering with Gated Convolutional Networks. | Li Li, Hirokazu Kameoka |
| 2018 | ICASSP | Vae-Space: Deep Generative Model of Voice Fundamental Frequency Contours. | Kou Tanaka, Hirokazu Kameoka, Kazuho Morikawa |
| 2017 | ICASSP | A majorization-minimization algorithm with projected gradient updates for time-domain spectrogram factorization. | Hideaki Kagami, Hirokazu Kameoka, Masahiro Yukawa |
| 2017 | ICASSP | Complex NMF with the generalized Kullback-Leibler divergence. | Hirokazu Kameoka, Hideaki Kagami, Masahiro Yukawa |
| 2017 | ICASSP | Generative adversarial network-based postfilter for statistical parametric speech synthesis. | Takuhiro Kaneko, Hirokazu Kameoka, Nobukatsu Hojo, Yusuke Ijima, Kaoru Hiramatsu, Kunio Kashino |
| 2017 | ICASSP | Fast algorithm for statistical phrase/accent command estimation based on generative model incorporating spectral features. | Ryotaro Sato, Hirokazu Kameoka, Kunio Kashino |
| 2017 | ICASSP | A noise suppression method for body-conducted soft speech based on non-negative tensor factorization of air- and body-conducted signals. | Yusuke Tajiri, Hirokazu Kameoka, Tomoki Toda |
| 2017 | Interspeech | DNN-SPACE: DNN-HMM-Based Generative Model of Voice F | Nobukatsu Hojo, Yasuhito Ohsugi, Yusuke Ijima, Hirokazu Kameoka |
| 2017 | Interspeech | Sequence-to-Sequence Voice Conversion with Similarity Metric Learned Using Generative Adversarial Networks. | Takuhiro Kaneko, Hirokazu Kameoka, Kaoru Hiramatsu, Kunio Kashino |
| 2017 | Interspeech | Generative Adversarial Network-Based Postfilter for STFT Spectrograms. | Takuhiro Kaneko, Shinji Takaki, Hirokazu Kameoka, Junichi Yamagishi |
| 2017 | Interspeech | Speech Enhancement Using Non-Negative Spectrogram Models with Mel-Generalized Cepstral Regularization. | Li Li, Hirokazu Kameoka, Tomoki Toda, Shoji Makino |
| 2017 | Interspeech | Direct Modeling of Frequency Spectra and Waveform Generation Based on Phase Recovery for DNN-Based Speech Synthesis. | Shinji Takaki, Hirokazu Kameoka, Junichi Yamagishi |
| 2017 | Interspeech | Physically Constrained Statistical F | Kou Tanaka, Hirokazu Kameoka, Tomoki Toda, Satoshi Nakamura |
| 2016 | ICASSP | Sparse sound field decomposition with multichannel extension of complex NMF. | Naoki Murata, Shoichi Koyama, Hirokazu Kameoka, Norihiro Takamune, Hiroshi Saruwatari |
| 2016 | ICASSP | Shifted and convolutive source-filter non-negative matrix factorization for monaural audio source separation. | Tomohiko Nakamura, Hirokazu Kameoka |
| 2016 | ICASSP | Statistical F0 prediction for electrolaryngeal speech enhancement considering generative process of F0 contours within product of experts framework. | Kou Tanaka, Hirokazu Kameoka, Tomoki Toda, Satoshi Nakamura |
| 2016 | Interspeech | Majorisation-Minimisation Based Optimisation of the Composite Autoregressive System with Application to Glottal Inverse Filtering. | Lauri Juvela, Hirokazu Kameoka, Manu Airaksinen, Junichi Yamagishi, Paavo Alku |
| 2016 | Interspeech | Semi-Supervised Joint Enhancement of Spectral and Cepstral Sequences of Noisy Speech. | Li Li, Hirokazu Kameoka, Takuya Higuchi, Hiroshi Saruwatari |
| 2016 | Interspeech | Acoustic-to-Articulatory Inversion Mapping Based on Latent Trajectory Gaussian Mixture Model. | Patrick Lumban Tobing, Tomoki Toda, Hirokazu Kameoka, Satoshi Nakamura |
| 2015 | ICASSP | Multi-resolution signal decomposition with time-domain spectrogram factorization. | Hirokazu Kameoka |
| 2015 | ICASSP | Efficient multichannel nonnegative matrix factorization exploiting rank-1 spatial model. | Daichi Kitamura, Nobutaka Ono, Hiroshi Sawada, Hirokazu Kameoka, Hiroshi Saruwatari |
| 2015 | ICASSP | L | Tomohiko Nakamura, Hirokazu Kameoka |
| 2014 | DAFX | Fast Signal Reconstruction from Magnitude Spectrogram of Continuous Wavelet Transform Based on Spectrogram Consistency. | Tomohiko Nakamura, Hirokazu Kameoka |
| 2014 | ICASSP | Underdetermined blind separation and tracking of moving sources based ONDOA-HMM. | Takuya Higuchi, Norihiro Takamune, Tomohiko Nakamura, Hirokazu Kameoka |
| 2014 | ICASSP | Timbre replacement of harmonic and drum components for music audio signals. | Tomohiko Nakamura, Hirokazu Kameoka, Kazuyoshi Yoshii, Masataka Goto |
| 2014 | ICASSP | Mondrian hidden Markov model for music signal processing. | Masahiro Nakano, Yasunori Ohishi, Hirokazu Kameoka, Ryo Mukai, Kunio Kashino |
| 2014 | ICASSP | Mixture of Gaussian process experts for predicting sung melodic contour with expressive dynamic fluctuations. | Yasunori Ohishi, Daichi Mochihashi, Hirokazu Kameoka, Kunio Kashino |
| 2014 | Interspeech | A unified approach for underdetermined blind signal separation and source activity detection by multichannel factorial hidden Markov models. | Takuya Higuchi, Hirofumi Takeda, Tomohiko Nakamura, Hirokazu Kameoka |
| 2014 | Interspeech | Speech prosody generation for text-to-speech synthesis based on generative model of F | Kento Kadowaki, Tatsuma Ishihara, Nobukatsu Hojo, Hirokazu Kameoka |
| 2013 | ICASSP | Bayesian semi-supervised audio event transcription based on Markov indian buffet process. | Yasunori Ohishi, Daichi Mochihashi, Tomoko Matsui, Masahiro Nakano, Hirokazu Kameoka, Tomonori Izumitani, Kunio Kashino |
| 2013 | Interspeech | Probabilistic speech F | Tatsuma Ishihara, Hirokazu Kameoka, Kota Yoshizato, Daisuke Saito, Shigeki Sagayama |
| 2013 | Interspeech | Generative modeling of speech F | Hirokazu Kameoka, Kota Yoshizato, Tatsuma Ishihara, Yasunori Ohishi, Kunio Kashino, Shigeki Sagayama |
| 2012 | ICASSP | Constrained and regularized variants of non-negative matrix factorization incorporating music-specific constraints. | Hirokazu Kameoka, Masahiro Nakano, Kazuki Ochiai, Yutaka Imoto, Kunio Kashino, Shigeki Sagayama |
| 2012 | ICASSP | Bayesian nonparametric music parser. | Masahiro Nakano, Yasunori Ohishi, Hirokazu Kameoka, Ryo Mukai, Kunio Kashino |
| 2012 | ICASSP | Explicit beat structure modeling for non-negative matrix factorization-based multipitch analysis. | Kazuki Ochiai, Hirokazu Kameoka, Shigeki Sagayama |
| 2012 | ICASSP | Efficient algorithms for multichannel extensions of Itakura-Saito nonnegative matrix factorization. | Hiroshi Sawada, Hirokazu Kameoka, Shoko Araki, Naonori Ueda |
| 2012 | ICASSP | Comparative evaluations of various harmonic/percussive sound separation algorithms based on anisotropic continuity of spectrogram. | Hideyuki Tachibana, Hirokazu Kameoka, Nobutaka Ono, Shigeki Sagayama |
| 2012 | ICPR | Designing various component analysis at will. | Akisato Kimura, Hitoshi Sakano, Hirokazu Kameoka, Masashi Sugiyama |
| 2012 | Interspeech | A Stochastic Model of Singing Voice F0 Contours for Characterizing Expressive Dynamic Components. | Yasunori Ohishi, Hirokazu Kameoka, Daichi Mochihashi, Kunio Kashino |
| 2012 | Interspeech | Hidden Markov Convolutive Mixture Model for Pitch Contour Analysis of Speech. | Kota Yoshizato, Hirokazu Kameoka, Daisuke Saito, Shigeki Sagayama |
| 2011 | ICASSP | Automatic video annotation via Hierarchical Topic Trajectory Model considering cross-modal correlations. | Takuho Nakano, Akisato Kimura, Hirokazu Kameoka, Shigeki Miyabe, Shigeki Sagayama, Nobutaka Ono, Kunio Kashino, Takuya Nishimoto |
| 2011 | ICASSP | Infinite-state spectrum model for music signal analysis. | Masahiro Nakano, Jonathan Le Roux, Hirokazu Kameoka, Nobutaka Ono, Shigeki Sagayama |
| 2011 | ICASSP | Formulations and algorithms for multichannel complex NMF. | Hiroshi Sawada, Hirokazu Kameoka, Shoko Araki, Naonori Ueda |
| 2011 | ICASSP | Automatic audio tag classification via semi-supervised canonical density estimation. | Jun Takagi, Yasunori Ohishi, Akisato Kimura, Masashi Sugiyama, Makoto Yamada, Hirokazu Kameoka |
| 2011 | ICASSP | I-Divergence-based dereverberation method with auxiliary function approach. | Naoki Yasuraoka, Hirokazu Kameoka, Takuya Yoshioka, Hiroshi G. Okuno |
| 2010 | ICASSP | A sparse component model of source signals and its application to blind source separation. | Yu Kitano, Hirokazu Kameoka, Yosuke Izumi, Nobutaka Ono, Shigeki Sagayama |
| 2010 | ICPR | SemiCCA: Efficient Semi-supervised Learning of Canonical Correlations. | Akisato Kimura, Hirokazu Kameoka, Masashi Sugiyama, Takuho Nakano, Eisaku Maeda, Hitoshi Sakano, Katsuhiko Ishiguro |
| 2010 | Interspeech | A statistical model of speech F0 contours. | Hirokazu Kameoka, Jonathan Le Roux, Yasunori Ohishi |
| 2010 | Interspeech | Statistical modeling of F0 dynamics in singing voices based on Gaussian processes with multiple oscillation bases. | Yasunori Ohishi, Hirokazu Kameoka, Daichi Mochihashi, Hidehisa Nagano, Kunio Kashino |
| 2009 | ICASSP | Robust speech dereverberation based on non-negativity and sparse nature of speech spectrograms. | Hirokazu Kameoka, Tomohiro Nakatani, Takuya Yoshioka |
| 2009 | ICASSP | Complex NMF: A new sparse representation for acoustic signals. | Hirokazu Kameoka, Nobutaka Ono, Kunio Kashino, Shigeki Sagayama |
| 2009 | ISCAS | Composite Autoregressive System for Sparse Source-filter Representation of speech. | Hirokazu Kameoka, Kunio Kashino |
| 2008 | ICASSP | Auxiliary function approach to parameter estimation of constrained sinusoidal model for monaural speech separation. | Hirokazu Kameoka, Nobutaka Ono, Shigeki Sagayama |
| 2008 | ICASSP | Harmonic-Temporal-Timbral Clustering (HTTC) for the analysis of multi-instrument polyphonic music signals. | Kenichi Miyamoto, Hirokazu Kameoka, Takuya Nishimoto, Nobutaka Ono, Shigeki Sagayama |
| 2008 | ICASSP | Modulation analysis of speech through orthogonal FIR filterbank optimization. | Jonathan Le Roux, Hirokazu Kameoka, Nobutaka Ono, Shigeki Sagayama, Alain de Cheveign |
| 2008 | Interspeech | Parameter estimation method of F0 control model for singing voices. | Yasunori Ohishi, Hirokazu Kameoka, Kunio Kashino, Kazuya Takeda |
| 2008 | Interspeech | Computational auditory induction by missing-data non-negative matrix factorization. | Jonathan Le Roux, Hirokazu Kameoka, Nobutaka Ono, Alain de Cheveign, Shigeki Sagayama |
| 2007 | ICASSP | Probabilistic Approach to Automatic Music Transcription from Audio Signals. | Kenichi Miyamoto, Hirokazu Kameoka, Haruto Takeda, Takuya Nishimoto, Shigeki Sagayama |
| 2007 | ICASSP | Harmonic-Temporal Clustering of Speech for Single and Multiple F0 Contour Estimation in Noisy Environments. | Jonathan Le Roux, Hirokazu Kameoka, Nobutaka Ono, Alain de Cheveign, Shigeki Sagayama |
| 2007 | IJCAI | Automatic Decision of Piano Fingering Based on a Hidden Markov Models. | Yuichiro Yonebayashi, Hirokazu Kameoka, Shigeki Sagayama |
| 2006 | Interspeech | Speech analyzer using a joint estimation model of spectral envelope and fine structure. | Hirokazu Kameoka, Jonathan Le Roux, Nobutaka Ono, Shigeki Sagayama |
| 2005 | ICASSP | Audio stream segregation of multi-pitch music signal based on time-space clustering using Gaussian kernel 2-dimensional model. | Hirokazu Kameoka, Takuya Nishimoto, Shigeki Sagayama |
| 2004 | ICASSP | Separation of harmonic structures based on tied Gaussian mixture model and information criterion for concurrent sounds. | Hirokazu Kameoka, Takuya Nishimoto, Shigeki Sagayama |
| 2004 | Interspeech | Multi-pitch trajectory estimation of concurrent speech based on harmonic GMM and nonlinear kalman filtering. | Takuya Nishimoto, Shigeki Sagayama, Hirokazu Kameoka |
| 2004 | Interspeech | Specmurt anasylis: a piano-roll-visualization of polyphonic music signal by deconvolution of log-frequency spectrum. | Shigeki Sagayama, Keigo Takahashi, Hirokazu Kameoka, Takuya Nishimoto |