| 2026 | LREC | J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling. | Wataru Nakata, Kentaro Seki, Hitomi Yanaka, Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2026 | SIGdial | DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio. | Wataru Nakata, Yuki Saito, Kazuki Yamauchi, Emiru Tsunoo, Hiroshi Saruwatari |
| 2025 | ASRU | CAVIARES: Corpus for Audio-Visual Expressive Voice Agent. | Jinsheng Chen, Yuki Saito, Dong Yang, Naoko Tanji, Hironori Doi, Byeongseon Park, Yuma Shirahata, Kentaro Tachibana, Hiroshi Saruwatari |
| 2025 | ASRU | Multi-Sampling-Frequency Naturalness MOS Prediction Using Self-Supervised Learning Model with Sampling-Frequency-Independent Layer. | Go Nishikawa, Wataru Nakata, Yuki Saito, Kanami Imamura, Hiroshi Saruwatari, Tomohiko Nakamura |
| 2025 | ASRU | Analysing the Language of Neural Audio Codecs. | Joonyong Park, Shinnosuke Takamichi, David M. Chan, Shunsuke Kando, Yuki Saito, Hiroshi Saruwatari |
| 2025 | ICASSP | Causal Speech Enhancement with Predicting Semantics based on Quantized Self-supervised Learning Features. | Emiru Tsunoo, Yuki Saito, Wataru Nakata, Hiroshi Saruwatari |
| 2025 | Interspeech | RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio. | Yusuke Kanamori, Yuki Okamoto, Taisei Takano, Shinnosuke Takamichi, Yuki Saito, Hiroshi Saruwatari |
| 2024 | ICASSP | Real-Time Speech Extraction Using Spatially Regularized Independent Low-Rank Matrix Analysis and Rank-Constrained Spatial Covariance Matrix Estimation. | Yuto Ishikawa, Kohei Konaka, Tomohiko Nakamura, Norihiro Takamune, Hiroshi Saruwatari |
| 2024 | ICASSP | Diversity-Based Core-Set Selection for Text-to-Speech with Linguistic and Acoustic Features. | Kentaro Seki, Shinnosuke Takamichi, Takaaki Saeki, Hiroshi Saruwatari |
| 2024 | ICASSP | Do Learned Speech Symbols Follow Zipf's Law? | Shinnosuke Takamichi, Hiroki Maeda, Joonyong Park, Daisuke Saito, Hiroshi Saruwatari |
| 2024 | ICASSP | Localizing Acoustic Energy in Sound Field Synthesis by Directionally Weighted Exterior Radiation Suppression. | Yoshihide Tomita, Shoichi Koyama, Hiroshi Saruwatari |
| 2024 | Interspeech | Noise-Robust Voice Conversion by Conditional Denoising Training Using Latent Variables of Recording Quality and Environment. | Takuto Igarashi, Yuki Saito, Kentaro Seki, Shinnosuke Takamichi, Ryuichi Yamamoto, Kentaro Tachibana, Hiroshi Saruwatari |
| 2024 | Interspeech | SpeechBERTScore: Reference-Aware Automatic Evaluation of Speech Generation Leveraging NLP Evaluation Metrics. | Takaaki Saeki, Soumi Maiti, Shinnosuke Takamichi, Shinji Watanabe, Hiroshi Saruwatari |
| 2024 | Interspeech | SRC4VC: Smartphone-Recorded Corpus for Voice Conversion Benchmark. | Yuki Saito, Takuto Igarashi, Kentaro Seki, Shinnosuke Takamichi, Ryuichi Yamamoto, Kentaro Tachibana, Hiroshi Saruwatari |
| 2024 | Interspeech | Spatial Voice Conversion: Voice Conversion Preserving Spatial Information and Non-target Signals. | Kentaro Seki, Shinnosuke Takamichi, Norihiro Takamune, Yuki Saito, Kanami Imamura, Hiroshi Saruwatari |
| 2024 | Interspeech | SaSLaW: Dialogue Speech Corpus with Audio-visual Egocentric Information Toward Environment-adaptive Dialogue Speech Synthesis. | Osamu Take, Shinnosuke Takamichi, Kentaro Seki, Yoshiaki Bando, Hiroshi Saruwatari |
| 2023 | ASRU | COCO-NUT: Corpus of Japanese Utterance and Voice Characteristics Description for Prompt-Based Control. | Aya Watanabe, Shinnosuke Takamichi, Yuki Saito, Wataru Nakata, Detai Xin, Hiroshi Saruwatari |
| 2023 | ICASSP | Spatial Active Noise Control Method Based on Sound Field Interpolation from Reference Microphone Signals. | Kazuyuki Arikawa, Shoichi Koyama, Hiroshi Saruwatari |
| 2023 | ICASSP | jaCappella Corpus: A Japanese a Cappella Vocal Ensemble Corpus. | Tomohiko Nakamura, Shinnosuke Takamichi, Naoko Tanji, Satoru Fukayama, Hiroshi Saruwatari |
| 2023 | ICASSP | Visual Onoma-to-Wave: Environmental Sound Synthesis from Visual Onomatopoeias and Sound-Source Images. | Hien Ohnaka, Shinnosuke Takamichi, Keisuke Imoto, Yuki Okamoto, Kazuki Fujii, Hiroshi Saruwatari |
| 2023 | ICASSP | Kernel Interpolation of Acoustic Transfer Functions with Adaptive Kernel for Directed and Residual Reverberations. | Juliano G. C. Ribeiro, Shoichi Koyama, Hiroshi Saruwatari |
| 2023 | ICASSP | MID-Attribute Speaker Generation Using Optimal-Transport-Based Interpolation of Gaussian Mixture Models. | Aya Watanabe, Shinnosuke Takamichi, Yuki Saito, Detai Xin, Hiroshi Saruwatari |
| 2023 | ICASSP | Improving Speech Prosody of Audiobook Text-To-Speech Synthesis with Acoustic and Textual Contexts. | Detai Xin, Sharath Adavanne, Federico Ang, Ashish Kulkarni, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2023 | ICASSP | Duration-Aware Pause Insertion Using Pre-Trained Language Model for Multi-Speaker Text-To-Speech. | Dong Yang, Tomoki Koriyama, Yuki Saito, Takaaki Saeki, Detai Xin, Hiroshi Saruwatari |
| 2023 | IJCAI | Learning to Speak from Text: Zero-Shot Multilingual Text-to-Speech with Unsupervised Text Pretraining. | Takaaki Saeki, Soumi Maiti, Xinjian Li, Shinji Watanabe, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2023 | Interspeech | How Generative Spoken Language Modeling Encodes Noisy Speech: Investigation from Phonetics to Syntactics. | Joonyong Park, Shinnosuke Takamichi, Tomohiko Nakamura, Kentaro Seki, Detai Xin, Hiroshi Saruwatari |
| 2023 | Interspeech | CALLS: Japanese Empathetic Dialogue Speech Corpus of Complaint Handling and Attentive Listening in Customer Center. | Yuki Saito, Eiji Iimori, Shinnosuke Takamichi, Kentaro Tachibana, Hiroshi Saruwatari |
| 2023 | Interspeech | ChatGPT-EDSS: Empathetic Dialogue Speech Synthesis Trained from ChatGPT-derived Context Word Embeddings. | Yuki Saito, Shinnosuke Takamichi, Eiji Iimori, Kentaro Tachibana, Hiroshi Saruwatari |
| 2023 | Interspeech | HumanDiffusion: diffusion model using perceptual gradients. | Yota Ueda, Shinnosuke Takamichi, Yuki Saito, Norihiro Takamune, Hiroshi Saruwatari |
| 2023 | Interspeech | Laughter Synthesis using Pseudo Phonetic Tokens with a Large-scale In-the-wild Laughter Corpus. | Detai Xin, Shinnosuke Takamichi, Ai Morimatsu, Hiroshi Saruwatari |
| 2022 | ICASSP | Spatial Active Noise Control Based on Individual Kernel Interpolation of Primary and Secondary Sound Fields. | Kazuyuki Arikawa, Shoichi Koyama, Hiroshi Saruwatari |
| 2022 | ICASSP | Differentiable Digital Signal Processing Mixture Model for Synthesis Parameter Extraction from Mixture of Harmonic Sounds. | Masaya Kawamura, Tomohiko Nakamura, Daichi Kitamura, Hiroshi Saruwatari, Yu Takahashi, Kazunobu Kondo |
| 2022 | ICASSP | Region-to-Region Kernel Interpolation of Acoustic Transfer Function with Directional Weighting. | Juliano G. C. Ribeiro, Shoichi Koyama, Hiroshi Saruwatari |
| 2022 | Interspeech | Predicting VQVAE-based Character Acting Style from Quotation-Annotated Text for Audiobook Speech Synthesis. | Wataru Nakata, Tomoki Koriyama, Shinnosuke Takamichi, Yuki Saito, Yusuke Ijima, Ryo Masumura, Hiroshi Saruwatari |
| 2022 | Interspeech | Acoustic Modeling for End-to-End Empathetic Dialogue Speech Synthesis Using Linguistic and Prosodic Contexts of Dialogue History. | Yuto Nishimura, Yuki Saito, Shinnosuke Takamichi, Kentaro Tachibana, Hiroshi Saruwatari |
| 2022 | Interspeech | SelfRemaster: Self-Supervised Speech Restoration with Analysis-by-Synthesis Approach Using Channel Modeling. | Takaaki Saeki, Shinnosuke Takamichi, Tomohiko Nakamura, Naoko Tanji, Hiroshi Saruwatari |
| 2022 | Interspeech | UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022. | Takaaki Saeki, Detai Xin, Wataru Nakata, Tomoki Koriyama, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2022 | Interspeech | STUDIES: Corpus of Japanese Empathetic Dialogue Speech Towards Friendly Voice Agent. | Yuki Saito, Yuto Nishimura, Shinnosuke Takamichi, Kentaro Tachibana, Hiroshi Saruwatari |
| 2022 | Interspeech | J-MAC: Japanese multi-speaker audiobook corpus for speech synthesis. | Shinnosuke Takamichi, Wataru Nakata, Naoko Tanji, Hiroshi Saruwatari |
| 2022 | Interspeech | Human-in-the-loop Speaker Adaptation for DNN-based Multi-speaker TTS. | Kenta Udagawa, Yuki Saito, Hiroshi Saruwatari |
| 2022 | LREC | Personalized Filled-pause Generation with Group-wise Prediction Models. | Yuta Matsunaga, Takaaki Saeki, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2021 | ASRU | Low-Latency Incremental Text-to-Speech Synthesis with Distilled Context Prediction Network. | Takaaki Saeki, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2021 | ICASSP | Deficient Basis Estimation of Noise Spatial Covariance Matrix for Rank-Constrained Spatial Covariance Matrix Estimation Method in Blind Speech Extraction. | Yuto Kondo, Yuki Kubo, Norihiro Takamune, Daichi Kitamura, Hiroshi Saruwatari |
| 2021 | ICASSP | Amplitude Matching: Majorization-Minimization Algorithm for Sound Field Control Only with Amplitude Constraint. | Shoichi Koyama, Takashi Amakasu, Natsuki Ueno, Hiroshi Saruwatari |
| 2021 | ICASSP | Humanacgan: Conditional Generative Adversarial Network with Human-Based Auxiliary Classifier and its Evaluation in Phoneme Perception. | Yota Ueda, Kazuki Fujii, Yuki Saito, Shinnosuke Takamichi, Yukino Baba, Hiroshi Saruwatari |
| 2021 | ICASSP | Disentangled Speaker and Language Representations Using Mutual Information Minimization and Domain Adaptation for Cross-Lingual TTS. | Detai Xin, Tatsuya Komatsu, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2021 | Interspeech | Harmonic WaveGAN: GAN-Based Speech Waveform Generation Model with Harmonic Structure Discriminator. | Kazuki Mizuta, Tomoki Koriyama, Hiroshi Saruwatari |
| 2021 | Interspeech | Sequence-to-Sequence Learning for Deep Gaussian Process Based Speech Synthesis Using Self-Attention GP Layer. | Taiki Nakamura, Tomoki Koriyama, Hiroshi Saruwatari |
| 2021 | Interspeech | Cross-Lingual Speaker Adaptation Using Domain Adaptation and Speaker Consistency Loss for Text-To-Speech Synthesis. | Detai Xin, Yuki Saito, Shinnosuke Takamichi, Tomoki Koriyama, Hiroshi Saruwatari |
| 2020 | ICASSP | Mutual-Information-Based Sensor Placement for Spatial Sound Field Recording. | Kentaro Ariga, Tomoya Nishida, Shoichi Koyama, Natsuki Ueno, Hiroshi Saruwatari |
| 2020 | ICASSP | Humangan: Generative Adversarial Network With Human-Based Discriminator And Its Evaluation In Speech Perception Modeling. | Kazuki Fujii, Yuki Saito, Shinnosuke Takamichi, Yukino Baba, Hiroshi Saruwatari |
| 2020 | ICASSP | Spatial Active Noise Control Based on Kernel Interpolation with Directional Weighting. | Hayato Ito, Shoichi Koyama, Natsuki Ueno, Hiroshi Saruwatari |
| 2020 | ICASSP | Regularized Fast Multichannel Nonnegative Matrix Factorization with ILRMA-Based Prior Distribution of Joint-Diagonalization Process. | Keigo Kamo, Yuki Kubo, Norihiro Takamune, Daichi Kitamura, Hiroshi Saruwatari, Yu Takahashi, Kazunobu Kondo |
| 2020 | ICASSP | Convergence-Guaranteed Independent Positive Semidefinite Tensor Analysis Based on Student's T Distribution. | Tatsuki Kondo, Kanta Fukushige, Norihiro Takamune, Daichi Kitamura, Hiroshi Saruwatari, Rintaro Ikeshita, Tomohiro Nakatani |
| 2020 | ICASSP | Utterance-Level Sequential Modeling for Deep Gaussian Process Based Speech Synthesis Using Simple Recurrent Unit. | Tomoki Koriyama, Hiroshi Saruwatari |
| 2020 | ICASSP | Time-Domain Audio Source Separation Based on Wave-U-Net Combined with Discrete Wavelet Transform. | Tomohiko Nakamura, Hiroshi Saruwatari |
| 2020 | ICASSP | Lifter Training and Sub-Band Modeling for Computationally Efficient and High-Quality Voice Conversion Using Spectral Differentials. | Takaaki Saeki, Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2020 | Interspeech | End-to-End Text-to-Speech Synthesis with Unaligned Multiple Language Units Based on Attention. | Masashi Aso, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2020 | Interspeech | Multi-Speaker Text-to-Speech Synthesis Using Deep Gaussian Processes. | Kentaro Mitsui, Tomoki Koriyama, Hiroshi Saruwatari |
| 2020 | Interspeech | Real-Time, Full-Band, Online DNN-Based Voice Conversion System Using a Single CPU. | Takaaki Saeki, Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2020 | Interspeech | Harmonic Lowering for Accelerating Harmonic Convolution for Audio Signals. | Hirotoshi Takeuchi, Kunio Kashino, Yasunori Ohishi, Hiroshi Saruwatari |
| 2020 | Interspeech | Cross-Lingual Text-To-Speech Synthesis via Domain Adaptation and Perceptual Similarity Regression in Speaker Space. | Detai Xin, Yuki Saito, Shinnosuke Takamichi, Tomoki Koriyama, Hiroshi Saruwatari |
| 2020 | Interspeech | Investigating Effective Additional Contextual Factors in DNN-Based Spontaneous Speech Synthesis. | Yuki Yamashita, Tomoki Koriyama, Yuki Saito, Shinnosuke Takamichi, Yusuke Ijima, Ryo Masumura, Hiroshi Saruwatari |
| 2020 | LREC | SMASH Corpus: A Spontaneous Speech Corpus Recording Third-person Audio Commentaries on Gameplay. | Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2020 | LREC | DNN-based Speech Synthesis Using Abundant Tags of Spontaneous Speech Corpus. | Yuki Yamashita, Tomoki Koriyama, Yuki Saito, Shinnosuke Takamichi, Yusuke Ijima, Ryo Masumura, Hiroshi Saruwatari |
| 2020 | MMSP | Binaural Rendering From Distributed Microphone Signals Considering Loudspeaker Distance in Measurements. | Naoto Iijima, Shoichi Koyama, Hiroshi Saruwatari |
| 2019 | ICASSP | Feedforward Spatial Active Noise Control Based on Kernel Interpolation of Sound Field. | Hayato Ito, Shoichi Koyama, Natsuki Ueno, Hiroshi Saruwatari |
| 2019 | ICASSP | Robust Gridless Sound Field Decomposition Based on Structured Reciprocity Gap Functional in Spherical Harmonic Domain. | Yuhta Takida, Shoichi Koyama, Natsuki Ueno, Hiroshi Saruwatari |
| 2019 | ICASSP | Generative Moment Matching Network-based Random Modulation Post-filter for DNN-based Singing Voice Synthesis and Neural Double-tracking. | Hiroki Tamaru, Yuki Saito, Shinnosuke Takamichi, Tomoki Koriyama, Hiroshi Saruwatari |
| 2019 | UIST | TransVoice: Real-Time Voice Conversion for Augmenting Near-Field Speech Communication. | Riku Arakawa, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2018 | ICASSP | Vectorwise Coordinate Descent Algorithm for Spatially Regularized Independent Low-Rank Matrix Analysis. | Yoshiki Mitsui, Norihiro Takamune, Daichi Kitamura, Hiroshi Saruwatari, Yu Takahashi, Kazunobu Kondo |
| 2018 | ICASSP | Text-to-Speech Synthesis Using STFT Spectra Based on Low-/Multi-Resolution Generative Adversarial Networks. | Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2018 | ICASSP | Sound Field Reproduction with Exterior Cancellation Using Analytical Weighting of Harmonic Coefficients. | Natsuki Ueno, Shoichi Koyama, Hiroshi Saruwatari |
| 2018 | LREC | CPJD Corpus: Crowdsourced Parallel Speech Corpus of Japanese Dialects. | Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2017 | ICASSP | Blind source separation based on independent low-rank matrix analysis with sparse regularization for time-series activity. | Yoshiki Mitsui, Daichi Kitamura, Shinnosuke Takamichi, Nobutaka Ono, Hiroshi Saruwatari |
| 2017 | ICASSP | Spatio-temporal sparse sound field decomposition considering acoustic source signal characteristics. | Naoki Murata, Shoichi Koyama, Norihiro Takamune, Hiroshi Saruwatari |
| 2017 | ICASSP | Training algorithm to deceive Anti-Spoofing Verification for DNN-based speech synthesis. | Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2017 | ICASSP | Listening-area-informed sound field reproduction based on circular harmonic expansion. | Natsuki Ueno, Shoichi Koyama, Hiroshi Saruwatari |
| 2017 | Interspeech | Voice Conversion Using Sequence-to-Sequence Learning of Context Posterior Probabilities. | Hiroyuki Miyoshi, Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2017 | Interspeech | Sampling-Based Speech Parameter Generation Using Moment-Matching Networks. | Shinnosuke Takamichi, Tomoki Koriyama, Hiroshi Saruwatari |
| 2016 | ICASSP | Sound field decomposition in reverberant environment using sparse and low-rank signal models. | Shoichi Koyama, Hiroshi Saruwatari |
| 2016 | ICASSP | Multichannel blind source separation based on non-negative tensor factorization in wavenumber domain. | Yuki Mitsufuji, Shoichi Koyama, Hiroshi Saruwatari |
| 2016 | ICASSP | Sparse sound field decomposition with multichannel extension of complex NMF. | Naoki Murata, Shoichi Koyama, Hirokazu Kameoka, Norihiro Takamune, Hiroshi Saruwatari |
| 2016 | Interspeech | Semi-Supervised Joint Enhancement of Spectral and Cepstral Sequences of Noisy Speech. | Li Li, Hirokazu Kameoka, Takuya Higuchi, Hiroshi Saruwatari |
| 2015 | ICASSP | Efficient multichannel nonnegative matrix factorization exploiting rank-1 spatial model. | Daichi Kitamura, Nobutaka Ono, Hiroshi Sawada, Hirokazu Kameoka, Hiroshi Saruwatari |
| 2015 | ICASSP | Structured sparse signal models and decomposition algorithm for super-resolution in sound field recording and reproduction. | Shoichi Koyama, Naoki Murata, Hiroshi Saruwatari |
| 2015 | ICASSP | Statistical modeling of binaural signal and its application to binaural source separation. | Yuki Murota, Daichi Kitamura, Shoichi Koyama, Hiroshi Saruwatari, Satoshi Nakamura |
| 2014 | ICASSP | Music signal separation based on Bayesian spectral amplitude estimator with automatic target prior adaptation. | Yuki Murota, Daichi Kitamura, Shunsuke Nakai, Hiroshi Saruwatari, Satoshi Nakamura, Yu Takahashi, Kazunobu Kondo |
| 2013 | Interspeech | Musical noise analysis for Bayesian minimum mean-square error speech amplitude estimators based on higher-order statistics. | Hiroshi Saruwatari, Suzumi Kanehara, Ryoichi Miyazaki, Kiyohiro Shikano, Kazunobu Kondo |
| 2012 | ICASSP | Musical-noise-free speech enhancement: Theory and evaluation. | Ryoichi Miyazaki, Hiroshi Saruwatari, Takayuki Inoue, Kiyohiro Shikano, Kazunobu Kondo |
| 2012 | ICASSP | Speech kurtosis estimation from observed noisy signal based on generalized Gaussian distribution prior and additivity of cumulants. | Ryo Wakisaka, Hiroshi Saruwatari, Kiyohiro Shikano, Tomoya Takatani |
| 2012 | ICASSP | Statistical approach to voice quality control in esophageal speech enhancement. | Kenzo Yamamoto, Tomoki Toda, Hironori Doi, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2012 | Interspeech | Evaluation of Many-to-Many Alignment Algorithm by Automatic Pronunciation Annotation Using Web Text Mining. | Keigo Kubo, Hiromichi Kawanami, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2012 | Interspeech | Spoken Inquiry Discrimination Using Bag-of-Words for Speech-Oriented Guidance System. | Haruka Majima, Rafael Torres, Yoko Fujita, Hiromichi Kawanami, Tomoko Matsui, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2011 | ASRU | Blind noise suppression for Non-Audible Murmur recognition with stereo signal processing. | Shunta Ishii, Tomoki Toda, Hiroshi Saruwatari, Sakriani Sakti, Satoshi Nakamura |
| 2011 | ICASSP | Acoustic model training for non-audible murmur recognition using transformed normal speech data. | Denis Babani, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2011 | ICASSP | An evaluation of alaryngeal speech enhancement methods based on voice conversion techniques. | Hironori Doi, Keigo Nakamura, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2011 | ICASSP | Theoretical analysis of musical noise in Wiener filtering family via higher-order statistics. | Takayuki Inoue, Hiroshi Saruwatari, Kiyohiro Shikano, Kazunobu Kondo |
| 2011 | ICASSP | Robust sound field reproduction integrating multi-point sound field control and wave field synthesis. | Noriyoshi Kamado, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2011 | ICASSP | Automatic musical thumbnailing based on audio object localization and its evaluation. | Hiroyuki Nawata, Noriyoshi Kamado, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2011 | Interspeech | Speaker-Adaptive Speech Synthesis Based on Eigenvoice Conversion and Language-Dependent Prosodic Conversion in Speech-to-Speech Translation. | Nobuhiko Hattori, Tomoki Toda, Hisashi Kawai, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2011 | Interspeech | Theoretical Analysis of Musical Noise and Speech Distortion in Structure-Generalized Parametric Blind Spatial Subtraction Array. | Ryoichi Miyazaki, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2011 | Interspeech | Blind Speech Prior Estimation for Generalized Minimum Mean-Square Error Short-Time Spectral Amplitude Estimator. | Ryo Wakisaka, Hiroshi Saruwatari, Kiyohiro Shikano, Tomoya Takatani |
| 2010 | ICASSP | Statistical approach to enhancing esophageal speech based on Gaussian mixture models. | Hironori Doi, Keigo Nakamura, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2010 | ICASSP | Complex Newton algorithm for blind signal extraction of speech in diffuse noise. | Jani Even, Hiroshi Saruwatari, Kiyohiro Shikano, Tomoya Takatani |
| 2010 | ICASSP | Speech enhancement in presence of diffuse background noise: Why using blind signal extraction? | Jani Even, Hiroshi Saruwatari, Kiyohiro Shikano, Tomoya Takatani |
| 2010 | ICASSP | Non-parallel training for many-to-many eigenvoice conversion. | Yamato Ohtani, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2010 | ICASSP | MMSE STSA estimator with nonstationary noise estimation based on ICA for high-quality speech enhancement. | Ryoi Okamoto, Yu Takahashi, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2010 | ICASSP | Theoretical musical-noise analysis and its generalization for methods of integrating beamforming and spectral subtraction based on higher-order statistics. | Yu Takahashi, Hiroshi Saruwatari, Hiroshi Shikano, Kazunobu Kondo |
| 2010 | Interspeech | Close speaker cancellation for suppression of non-stationary background noise for hands-free speech interface. | Jani Even, Carlos Toshinori Ishi, Hiroshi Saruwatari, Norihiro Hagita |
| 2010 | Interspeech | The use of air-pressure sensor in electrolaryngeal speech enhancement based on statistical voice conversion. | Keigo Nakamura, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2010 | Interspeech | Adaptive voice-quality control based on one-to-many eigenvoice conversion. | Kumi Ohta, Tomoki Toda, Yamato Ohtani, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2010 | Interspeech | Comparison of methods for topic classification in a speech-oriented guidance system. | Rafael Torres, Shota Takeuchi, Hiromichi Kawanami, Tomoko Matsui, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2010 | IROS | Improvement of speech recognition performance for spoken-oriented robot dialog system using end-fire array. | Hiroshi Sawada, Jani Even, Hiroshi Saruwatari, Kiyohiro Shikano, Tomoya Takatani |
| 2009 | ICASSP | Multiple ICA-based real-time blind source extraction applied to handy size microphone. | Takashi Hiekata, Takashi Morita, Youhei Ikeda, Hiroshi Hashimoto, Ruoyu Zhang, Yu Takahashi, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2009 | ICASSP | Kernel-based nonlinear independent component analysis for underdetermined blind source separation. | Shigeki Miyabe, Biing-Hwang Juang, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2009 | ICASSP | Acoustic compensation methods for body transmitted speech conversion. | Daisuke Miyamoto, Keigo Nakamura, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2009 | ICASSP | Hands-free speech recognition challenge for real-world speech dialogue systems. | Hiroshi Saruwatari, Hiromichi Kawanami, Shota Takeuchi, Yu Takahashi, Tobias Cincarek, Kiyohiro Shikano |
| 2009 | ICASSP | Source adaptive blind signal extraction using closed-form ICA for hands-free robot spoken dialogue system. | Yu Takahashi, Hiroshi Saruwatari, Yuki Fujihara, Kentaro Tachibana, Yoshimitsu Mori, Shigeki Miyabe, Kiyohiro Shikano, Akira Tanaka |
| 2009 | ICASSP | Musical noise analysis based on higher order statistics for microphone array and nonlinear signal processing. | Yu Takahashi, Yoshihisa Uemura, Hiroshi Saruwatari, Kiyohiro Shikano, Kazunobu Kondo |
| 2009 | ICASSP | Musical noise generation analysis for noise reduction methods based on spectral subtraction and MMSE STSA estimation. | Yoshihisa Uemura, Yu Takahashi, Hiroshi Saruwatari, Kiyohiro Shikano, Kazunobu Kondo |
| 2009 | Interspeech | Electrolaryngeal speech enhancement based on statistical voice conversion. | Keigo Nakamura, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2009 | Interspeech | Many-to-many eigenvoice conversion with reference voice. | Yamato Ohtani, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2009 | IROS | Semi-blind suppression of internal noise for hands-free robot spoken dialog system. | Jani Even, Hiroshi Sawada, Hiroshi Saruwatari, Kiyohiro Shikano, Tomoya Takatani |
| 2009 | IDA | Target Speech Enhancement in Presence of Jammer and Diffuse Background Noise. | Jani Even, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2008 | ICASSP | Frequency domain semi-blind signal separation: application to the rejection of internal noises. | Jani Even, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2008 | ICASSP | Distant talking robust speech recognition using late reflection components of room impulse response. | Randy Gomez, Jani Even, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2008 | ICASSP | Source-oriented localization control of stereo audio signals based on blind source separation. | Yuuki Haraguchi, Shigeki Miyabe, Hiroshi Saruwatari, Kiyohiro Shikano, Toshiyuki Nomura |
| 2008 | ICASSP | Hybrid structure of inverse filtering and DOA-parameterized wavefront synthesis. | Yuuta Yuyama, Shigeki Miyabe, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2008 | Interspeech | Low-delay voice conversion based on maximum likelihood estimation of spectral parameter trajectory. | Takashi Muramatsu, Yamato Ohtani, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2008 | Interspeech | Evaluation of speaking-aid system with voice conversion for laryngectomees toward its use in practical environments. | Keigo Nakamura, Tomoki Toda, Yoshitaka Nakajima, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2008 | Interspeech | An improved one-to-many eigenvoice conversion system. | Yamato Ohtani, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2008 | Interspeech | Speaker verification with non-audible murmur segments by combining global alignment kernel and penalized logistic regression machine. | Hideki Okamoto, Tomoko Matsui, Hiromichi Kawanami, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2008 | Interspeech | Development and evaluation of hands-free spoken dialogue system for railway station guidance. | Hiroshi Saruwatari, Yu Takahashi, Hiroyuki Sakai, Shota Takeuchi, Tobias Cincarek, Hiromichi Kawanami, Kiyohiro Shikano |
| 2008 | Interspeech | Question and answer database optimization using speech recognition results. | Shota Takeuchi, Tobias Cincarek, Hiromichi Kawanami, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2008 | Interspeech | Maximum a posteriori adaptation for many-to-one eigenvoice conversion. | Daisuke Tani, Tomoki Toda, Yamato Ohtani, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2008 | IROS | An improved permutation solver for blind signal separation based front-ends in robot audition. | Jani Even, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2008 | IROS | Real-time implementation of blind spatial subtraction array for hands-free robot spoken dialogue system. | Yu Takahashi, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2007 | ASRU | Development and portability of ASR and Q&A modules for real-environment speech-oriented guidance systems. | Tobias Cincarek, Hiromichi Kawanami, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2007 | ICASSP | High-Presence Hearing-Aid System using DSP-Based Real-Time Blind Source Separation Module. | Yoshimitsu Mori, Tomoya Takatani, Hiroshi Saruwatari, Kiyohiro Shikano, Takashi Hiekata, Takashi Morita |
| 2007 | ICASSP | Efficient Blind Source Separation Combining Closed-Form Second-Order ICA and Nonclosed-Form Higher-Order ICA. | Kentaro Tachibana, Hiroshi Saruwatari, Yoshimitsu Mori, Shigeki Miyabe, Kiyohiro Shikano, Akira Tanaka |
| 2007 | ICASSP | Permutation-Robust Structure for ICA-Based Blind Source Extraction. | Yu Takahashi, Tomoya Takatani, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2007 | Interspeech | Development of preschool children subsystem for ASR and q&a in a real-environment speech-oriented guidance task. | Tobias Cincarek, Izumi Shindo, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2007 | Interspeech | Rapid unsupervised speaker adaptation using single utterance based on MLLR and speaker selection. | Randy Gomez, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2007 | Interspeech | Impact of various small sound source signals on voice conversion accuracy in speech communication aid for laryngectomees. | Keigo Nakamura, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2007 | Interspeech | Speaker adaptive training for one-to-many eigenvoice conversion based on Gaussian mixture model. | Yamato Ohtani, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2007 | Interspeech | Study on speaker verification with non-audible murmur segments. | Hideki Okamoto, Mariko Kojima, Tomoko Matsui, Hiromichi Kawanami, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2006 | ICASSP | Improving Rapid Unsupervised Speaker Adaptation Based On Hmm Sufficient Statistics. | Randy Gomez, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2006 | ICASSP | Double-Talk Free Spoken Dialogue Interface Combining Sound Field Control With Semi-Blind Source Separation. | Shigeki Miyabe, Tomoya Takatani, Yoshimitsu Mori, Hiroshi Saruwatari, Kiyohiro Shikano, Yosuke Tatekura |
| 2006 | ICASSP | Blind Source Separation Combining Simo-Ica and Simo-Model-Based Binary Masking. | Yoshimitsu Mori, Tomoya Takatani, Hiroshi Saruwatari, Takashi Hiekata, Takashi Morita |
| 2006 | Interspeech | Acoustic modeling for spoken dialogue systems based on unsupervised utterance-based selective training. | Tobias Cincarek, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2006 | Interspeech | Speaker verification with non-audible murmur segments. | Mariko Kojima, Tomoko Matsui, Hiromichi Kawanami, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2006 | Interspeech | Speaking aid system for total laryngectomees using voice conversion of body transmitted artificial speech. | Keigo Nakamura, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2006 | Interspeech | Maximum likelihood voice conversion based on GMM with STRAIGHT mixed excitation. | Yamato Ohtani, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2006 | LREC | Transcription Cost Reduction for Constructing Acoustic Models Using Acoustic Likelihood Selection Criteria. | Tomoyuki Kato, Tomiki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2005 | ICASSP | Blind source separation combining SIMO-model-based ICA and adaptive beamforming. | Satoshi Ukai, Tomoya Takatani, Tsuyoki Nishikawa, Hiroshi Saruwatari |
| 2005 | ICDE | Speech Enhancement Based on Blind Source Separation in Car Environments. | Hiroshi Saruwatari, Katsuyuki Sawai, Tsuyoki Nishikawa, Akinobu Lee, Kiyohiro Shikano, Atsunobu Kaminuma, Masao Sakata, Daisuke Saitoh |
| 2005 | Interspeech | Rapid unsupervised speaker adaptation based on multi-template HMM sufficient statistics in noisy environments. | Randy Gomez, Akinobu Lee, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2005 | Interspeech | Investigating the role of the Lombard reflex in non-audible murmur (NAM) recognition. | Panikos Heracleous, Tomomi Kaino, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2005 | Interspeech | Applications of NAM microphones in speech recognition for privacy in human-machine communication. | Panikos Heracleous, Tomomi Kaino, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2005 | Interspeech | Speech extraction in a car interior using frequency-domain ICA with rapid filter adaptations. | Daisuke Saitoh, Atsunobu Kaminuma, Hiroshi Saruwatari, Tsuyoki Nishikawa, Akinobu Lee |
| 2005 | IROS | Noise-robust hands-free speech recognition based on spatial subtraction array and known noise superimposition. | Yasuaki Ohashi, Tsuyoki Nishikawa, Hiroshi Saruwatari, Akinobu Lee, Kiyohiro Shikano |
| 2005 | IROS | Two-stage blind source separation based on ICA and binary masking for real-time robot audition system. | Hiroshi Saruwatari, Yoshimitsu Mori, Tomoya Takatani, Satoshi Ukai, Kiyohiro Shikano, Takashi Hiekata, Takashi Morita |
| 2005 | IROS | Blind sound scene decomposition for robot audition using SIMO-model-based ICA. | Tomoya Takatani, Satoshi Ukai, Tsuyoki Nishikawa, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2004 | ICASSP | Overdetermined blind separation for convolutive mixtures of speech based on multistage ICA using subarray processing. | Tsuyoki Nishikawa, Hiroshi Abe, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2004 | ICASSP | Public speech-oriented guidance system with adult and child discrimination capability. | Ryuichi Nisimura, Akinobu Lee, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2004 | ICASSP | Blind separation of binaural sound mixtures using SIMO-model-based independent component analysis. | Tomoya Takatani, Tsuyoki Nishikawa, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2004 | ICASSP | Multistage SIMO-model-based blind source separation combining frequency-domain ICA and time-domain ICA. | Satoshi Ukai, Hiroshi Saruwatari, Tomoya Takatani, Ryo Mukai, Hiroshi Sawada |
| 2004 | Interspeech | Interface for barge-in free spoken dialogue system using adaptive sound field control. | Tatsunori Asai, Shigeki Miyabe, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2004 | Interspeech | Robust speech recognition with spectral subtraction in low SNR. | Randy Gomez, Akinobu Lee, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2004 | Interspeech | Non-audible murmur (NAM) speech recognition using a stethoscopic NAM microphone. | Panikos Heracleous, Yoshitaka Nakajima, Akinobu Lee, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2004 | Interspeech | Noise robust real world spoken dialogue system using GMM based rejection of unintended inputs. | Akinobu Lee, Keisuke Nakamura, Ryuichi Nisimura, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2004 | Interspeech | MAP estimation of speech spectral component under GGD a priori. | Rajkishore Prasad, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2004 | LREC | Perceptual Evaluation of Quality Deterioration Owing to Prosody Modification. | Kazuki Adachi, Tomoki Toda, Hiromichi Kawanami, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2003 | ICASSP | Subband based blind source separation for convolutive mixtures of speech. | Shoko Araki, Shoji Makino, Robert Aichner, Tsuyoki Nishikawa, Hiroshi Saruwatari |
| 2003 | ICASSP | Interface for barge-in free spoken dialogue system based on sound field control and microphone array. | Yoichi Hinamoto, Kouichi Mino, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2003 | ICASSP | Blind source separation based on binaural ICA. | Tomoya Takatani, Tsuyoki Nishikawa, Hiroshi Saruwatari |
| 2003 | IJCNN | Parallel structured independent component analysis for SIMO-model-based blind separation and deconvolution of convolutive speech mixture. | Hiroshi Saruwatari, Hiroaki Yamajo, Tomoya Takatani, Tsuyoki Nishikawa, Kiyohiro Shikano |
| 2003 | Interspeech | GMM-based voice conversion applied to emotional speech synthesis. | Hiromichi Kawanami, Yohei Iwami, Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2003 | Interspeech | Simple designing methods of corpus-based visual speech synthesis. | Tatsuya Shiraishi, Tomoki Toda, Hiromichi Kawanami, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2003 | Interspeech | Unsupervised speaker adaptation based on HMM sufficient statistics in various noisy environments. | Shingo Yamade, Akinobu Lee, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2003 | Interspeech | Blind separation and deconvolution for convolutive mixture of speech using SIMO-model-based ICA and multichannel inverse filtering. | Hiroaki Yamajo, Hiroshi Saruwatari, Tomoya Takatani, Tsuyoki Nishikawa, Kiyohiro Shikano |
| 2002 | ICASSP | Equivalence between frequency domain blind source separation and frequency domain adaptive beamforming. | Shoko Araki, Yoichi Hinamoto, Shoji Makino, Tsuyoki Nishikawa, Ryo Mukai, Hiroshi Saruwatari |
| 2002 | ICASSP | Bund source separation based on Multi-Stage ICA combining frequency-domain ICA and time-domain ICA. | Tsuyoki Nishikawa, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2002 | ICASSP | Blind source separation based on fast-convergence algorithm using ICA and beamforming for real convolutive mixture. | Hiroshi Saruwatari, Toshiya Kawamura, Katsuyuki Sawai, Atsunobu Kaminuma, Masao Sakata |
| 2002 | Interspeech | Selective multi-path acoustic model based on database likelihoods. | Akinobu Lee, Yuichiro Mera, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2002 | Interspeech | Speech enhancement in car environment using blind source separation. | Hiroshi Saruwatari, Katsuyuki Sawai, Akinobu Lee, Kiyohiro Shikano, Atsunobu Kaminuma, Masao Sakata |
| 2002 | Interspeech | Spectral subtraction in noisy environments applied to speaker adaptation based on HMM sufficient statistics. | Shingo Yamade, Kanako Matsunami, Akira Baba, Akinobu Lee, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2002 | IROS | ASKA: receptionist robot with speech dialogue system. | Ryuichi Nisimura, Takashi Uchida, Akinobu Lee, Hiroshi Saruwatari, Kiyohiro Shikano, Yoshio Matsumoto |
| 2001 | ICASSP | Fundamental limitation of frequency domain blind source separation for convolutive mixture of speech. | Shoko Araki, Shoji Makino, Tsuyoki Nishikawa, Hiroshi Saruwatari |
| 2001 | ICASSP | Direction of arrival estimation based on nonlinear microphone array. | Hidekazu Kamiyanagida, Hiroshi Saruwatari, Kazuya Takeda, Fumitada Itakura |
| 2001 | ICASSP | Blind source separation combining frequency-domain ICA and beamforming. | Hiroshi Saruwatari, Satoshi Kurita, Kazuya Takeda |
| 2001 | ICASSP | Voice conversion algorithm based on Gaussian mixture model with dynamic frequency warping of STRAIGHT spectrum. | Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2001 | Interspeech | Equivalence between frequency domain blind source separation and frequency domain adaptive null beamformers. | Shoko Araki, Shoji Makino, Ryo Mukai, Hiroshi Saruwatari |
| 2001 | Interspeech | Automatic n-gram language model creation from web resources. | Ryuichi Nisimura, Kumiko Komatsu, Yuka Kuroda, Kentaro Nagatomo, Akinobu Lee, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2001 | Interspeech | Blind source separation for speech based on fast-convergence algorithm with ICA and beamforming. | Hiroshi Saruwatari, Toshiya Kawamura, Kiyohiro Shikano |
| 2001 | Interspeech | High quality voice conversion based on Gaussian mixture model with dynamic frequency warping. | Tomoki Toda, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2001 | Interspeech | Unsupervised noisy environment adaptation algorithm using MLLR and speaker selection. | Miichi Yamada, Akira Baba, Shinichi Yoshizawa, Yuichiro Mera, Akinobu Lee, Hiroshi Saruwatari, Kiyohiro Shikano |
| 2000 | ICASSP | Evaluation of blind signal separation method using directivity pattern under reverberant conditions. | Satoshi Kurita, Hiroshi Saruwatari, Shoji Kajita, Kazuya Takeda, Fumitada Itakura |
| 2000 | ICASSP | Speech enhancement using nonlinear microphone array with noise adaptive complementary beamforming. | Hiroshi Saruwatari, Shoji Kajita, Kazuya Takeda, Fumitada Itakura |
| 2000 | Interspeech | Blind source separation based on subband ICA and beamforming. | Hiroshi Saruwatari, Satoshi Kurita, Kazuya Takeda, Fumitada Itakura, Kiyohiro Shikano |
| 2000 | Interspeech | Straight-based voice conversion algorithm based on Gaussian mixture model. | Tomoki Toda, Jinlin Lu, Hiroshi Saruwatari, Kiyohiro Shikano |
| 1999 | ICASSP | Compensating of room acoustic transfer functions affected by change of room temperature. | Michiaki Omura, Motohiko Yada, Hiroshi Saruwatari, Shoji Kajita, Kazuya Takeda, Fumitada Itakura |
| 1999 | ICASSP | Speech enhancement using nonlinear microphone array with complementary beamforming. | Hiroshi Saruwatari, Shoji Kajita, Kazuya Takeda, Fumitada Itakura |
| 1999 | Interspeech | Speech enhancement using nonlinear microphone array under nonstationary noise conditions. | Hiroshi Saruwatari, Shoji Kajita, Kazuya Takeda, Fumitada Itakura |