| 2025 | ICASSP | SoundBeam meets M2D: Target Sound Extraction with Audio Foundation Model. | Carlos Hernandez-Olivan, Marc Delcroix, Tsubasa Ochiai, Daisuke Niizumi, Naohiro Tawara, Tomohiro Nakatani, Shoko Araki |
| 2025 | ICASSP | A Hybrid Probabilistic-Deterministic Model Recursively Enhancing Speech. | Tomohiro Nakatani, Naoyuki Kamo, Marc Delcroix, Shoko Araki |
| 2025 | Interspeech | MOVER: Combining Multiple Meeting Recognition Systems. | Naoyuki Kamo, Tsubasa Ochiai, Marc Delcroix, Tomohiro Nakatani |
| 2024 | ICASSP | Diffusion Model-Based MIMO Speech Denoising and Dereverberation. | Rino Kimura, Tomohiro Nakatani, Naoyuki Kamo, Marc Delcroix, Shoko Araki, Tetsuya Ueda, Shoji Makino |
| 2024 | ICASSP | Neural Network-Based Virtual Microphone Estimation with Virtual Microphone and Beamformer-Level Multi-Task Loss. | Hanako Segawa, Tsubasa Ochiai, Marc Delcroix, Tomohiro Nakatani, Rintaro Ikeshita, Shoko Araki, Takeshi Yamada, Shoji Makino |
| 2024 | ICASSP | Ensemble Inference for Diffusion Model-Based Speech Enhancement. | Hao Shi, Naoyuki Kamo, Marc Delcroix, Tomohiro Nakatani, Shoko Araki |
| 2024 | Interspeech | Array Geometry-Robust Attention-Based Neural Beamformer for Moving Speakers. | Marvin Tammen, Tsubasa Ochiai, Marc Delcroix, Tomohiro Nakatani, Shoko Araki, Simon Doclo |
| 2023 | ICASSP | Fast Online Source Steering Algorithm for Tracking Single Moving Source Using Online Independent Vector Analysis. | Taishi Nakashima, Rintaro Ikeshita, Nobutaka Ono, Shoko Araki, Tomohiro Nakatani |
| 2023 | Interspeech | Impact of Residual Noise and Artifacts in Speech Enhancement Errors on Intelligibility of Human and Machine. | Shoko Araki, Ayako Yamamoto, Tsubasa Ochiai, Kenichi Arai, Atsunori Ogawa, Tomohiro Nakatani, Toshio Irino |
| 2023 | Interspeech | Multi-Stream Extension of Variational Bayesian HMM Clustering (MS-VBx) for Combined End-to-End and Vector Clustering-based Diarization. | Marc Delcroix, Naohiro Tawara, Mireia Dez, Federico Landini, Anna Silnova, Atsunori Ogawa, Tomohiro Nakatani, Luks Burget, Shoko Araki |
| 2023 | Interspeech | Target Speech Extraction with Conditional Diffusion Model. | Naoyuki Kamo, Marc Delcroix, Tomohiro Nakatani |
| 2022 | ICASSP | Importance of Switch Optimization Criterion in Switching WPE Dereverberation. | Naoyuki Kamo, Rintaro Ikeshita, Keisuke Kinoshita, Tomohiro Nakatani |
| 2022 | ICASSP | Multi-Frame Full-Rank Spatial Covariance Analysis for Underdetermined BSS in Reverberant Environments. | Hiroshi Sawada, Rintaro Ikeshita, Keisuke Kinoshita, Tomohiro Nakatani |
| 2022 | Interspeech | Listen only to me! How well can target speech extraction handle false alarms? | Marc Delcroix, Keisuke Kinoshita, Tsubasa Ochiai, Katerina Zmolkov, Hiroshi Sato, Tomohiro Nakatani |
| 2021 | ICASSP | Convolutive Transfer Function Invariant SDR Training Criteria for Multi-Channel Reverberant Speech Separation. | Christoph Bddeker, Wangyou Zhang, Tomohiro Nakatani, Keisuke Kinoshita, Tsubasa Ochiai, Marc Delcroix, Naoyuki Kamo, Yanmin Qian, Reinhold Haeb-Umbach |
| 2021 | ICASSP | Speaker Activity Driven Neural Speech Extraction. | Marc Delcroix, Katerina Zmolkov, Tsubasa Ochiai, Keisuke Kinoshita, Tomohiro Nakatani |
| 2021 | ICASSP | Blind and Neural Network-Guided Convolutional Beamformer for Joint Denoising, Dereverberation, and Source Separation. | Tomohiro Nakatani, Rintaro Ikeshita, Keisuke Kinoshita, Hiroshi Sawada, Shoko Araki |
| 2021 | ICASSP | Neural Network-Based Virtual Microphone Estimator. | Tsubasa Ochiai, Marc Delcroix, Tomohiro Nakatani, Rintaro Ikeshita, Keisuke Kinoshita, Shoko Araki |
| 2021 | ICASSP | Low Latency Online Blind Source Separation Based on Joint Optimization with Blind Dereverberation. | Tetsuya Ueda, Tomohiro Nakatani, Rintaro Ikeshita, Keisuke Kinoshita, Shoko Araki, Shoji Makino |
| 2021 | ICASSP | Data Fusion for Audiovisual Speaker Localization: Extending Dynamic Stream Weights to the Spatial Domain. | Julio Wissing, Benedikt T. Boenninghoff, Dorothea Kolossa, Tsubasa Ochiai, Marc Delcroix, Keisuke Kinoshita, Tomohiro Nakatani, Shoko Araki, Christopher Schymura |
| 2021 | ICASSP | End-to-End Dereverberation, Beamforming, and Speech Recognition with Improved Numerical Stability and Advanced Frontend. | Wangyou Zhang, Christoph Bddeker, Shinji Watanabe, Tomohiro Nakatani, Marc Delcroix, Keisuke Kinoshita, Tsubasa Ochiai, Naoyuki Kamo, Reinhold Haeb-Umbach, Yanmin Qian |
| 2021 | Interspeech | PILOT: Introducing Transformers for Probabilistic Sound Event Localization. | Christopher Schymura, Benedikt T. Bnninghoff, Tsubasa Ochiai, Marc Delcroix, Keisuke Kinoshita, Tomohiro Nakatani, Shoko Araki, Dorothea Kolossa |
| 2021 | Interspeech | Comparison of Remote Experiments Using Crowdsourcing and Laboratory Experiments on Speech Intelligibility. | Ayako Yamamoto, Toshio Irino, Kenichi Arai, Shoko Araki, Atsunori Ogawa, Keisuke Kinoshita, Tomohiro Nakatani |
| 2020 | ICASSP | Jointly Optimal Dereverberation and Beamforming. | Christoph Bddeker, Tomohiro Nakatani, Keisuke Kinoshita, Reinhold Haeb-Umbach |
| 2020 | ICASSP | Improving Speaker Discrimination of Target Speech Extraction With Time-Domain Speakerbeam. | Marc Delcroix, Tsubasa Ochiai, Katerina Zmolkov, Keisuke Kinoshita, Naohiro Tawara, Tomohiro Nakatani, Shoko Araki |
| 2020 | ICASSP | Overdetermined Independent Vector Analysis. | Rintaro Ikeshita, Tomohiro Nakatani, Shoko Araki |
| 2020 | ICASSP | Tackling Real Noisy Reverberant Meetings with All-Neural Source Separation, Counting, and Diarization System. | Keisuke Kinoshita, Marc Delcroix, Shoko Araki, Tomohiro Nakatani |
| 2020 | ICASSP | Improving Noise Robust Automatic Speech Recognition with Single-Channel Time-Domain Enhancement Network. | Keisuke Kinoshita, Tsubasa Ochiai, Marc Delcroix, Tomohiro Nakatani |
| 2020 | ICASSP | Convergence-Guaranteed Independent Positive Semidefinite Tensor Analysis Based on Student's T Distribution. | Tatsuki Kondo, Kanta Fukushige, Norihiro Takamune, Daichi Kitamura, Hiroshi Saruwatari, Rintaro Ikeshita, Tomohiro Nakatani |
| 2020 | ICASSP | DNN-supported Mask-based Convolutional Beamforming for Simultaneous Denoising, Dereverberation, and Source Separation. | Tomohiro Nakatani, Riki Takahashi, Tsubasa Ochiai, Keisuke Kinoshita, Rintaro Ikeshita, Marc Delcroix, Shoko Araki |
| 2020 | ICASSP | End-to-End Training of Time Domain Audio Separation and Recognition. | Thilo von Neumann, Keisuke Kinoshita, Lukas Drude, Christoph Bddeker, Marc Delcroix, Tomohiro Nakatani, Reinhold Haeb-Umbach |
| 2020 | ICASSP | Beam-TasNet: Time-domain Audio Separation Network Meets Frequency-domain Beamformer. | Tsubasa Ochiai, Marc Delcroix, Rintaro Ikeshita, Keisuke Kinoshita, Tomohiro Nakatani, Shoko Araki |
| 2020 | ICASSP | A Dynamic Stream Weight Backprop Kalman Filter for Audiovisual Speaker Tracking. | Christopher Schymura, Tsubasa Ochiai, Marc Delcroix, Keisuke Kinoshita, Tomohiro Nakatani, Shoko Araki, Dorothea Kolossa |
| 2020 | Interspeech | Predicting Intelligibility of Enhanced Speech Using Posteriors Derived from DNN-Based ASR System. | Kenichi Arai, Shoko Araki, Atsunori Ogawa, Keisuke Kinoshita, Tomohiro Nakatani, Toshio Irino |
| 2020 | Interspeech | Multi-Path RNN for Hierarchical Modeling of Long Sequential Data and its Application to Speaker Stream Separation. | Keisuke Kinoshita, Thilo von Neumann, Marc Delcroix, Tomohiro Nakatani, Reinhold Haeb-Umbach |
| 2020 | Interspeech | Computationally Efficient and Versatile Framework for Joint Optimization of Blind Speech Separation and Dereverberation. | Tomohiro Nakatani, Rintaro Ikeshita, Keisuke Kinoshita, Hiroshi Sawada, Shoko Araki |
| 2020 | Interspeech | Multi-Talker ASR for an Unknown Number of Sources: Joint Training of Source Counting, Separation and ASR. | Thilo von Neumann, Christoph Bddeker, Lukas Drude, Keisuke Kinoshita, Marc Delcroix, Tomohiro Nakatani, Reinhold Haeb-Umbach |
| 2019 | ICASSP | Compact Network for Speakerbeam Target Speaker Extraction. | Marc Delcroix, Katerina Zmolkov, Tsubasa Ochiai, Keisuke Kinoshita, Shoko Araki, Tomohiro Nakatani |
| 2019 | ICASSP | A Unified Framework for Feature-based Domain Adaptation of Neural Network Language Models. | Michael Hentschel, Marc Delcroix, Atsunori Ogawa, Tomoharu Iwata, Tomohiro Nakatani |
| 2019 | ICASSP | Joint Optimization of Neural Network-based WPE Dereverberation and Acoustic Model for Robust Online ASR. | Jahn Heymann, Lukas Drude, Reinhold Haeb-Umbach, Keisuke Kinoshita, Tomohiro Nakatani |
| 2019 | ICASSP | FastMNMF: Joint Diagonalization Based Accelerated Algorithms for Multichannel Nonnegative Matrix Factorization. | Nobutaka Ito, Tomohiro Nakatani |
| 2019 | ICASSP | Semi-supervised End-to-end Speech Recognition Using Text-to-speech and Autoencoders. | Shigeki Karita, Shinji Watanabe, Tomoharu Iwata, Marc Delcroix, Atsunori Ogawa, Tomohiro Nakatani |
| 2019 | ICASSP | Mask-based MVDR Beamformer for Noisy Multisource Environments: Introduction of Time-varying Spatial Covariance Model. | Yuki Kubo, Tomohiro Nakatani, Marc Delcroix, Keisuke Kinoshita, Shoko Araki |
| 2019 | ICASSP | All-neural Online Source Separation, Counting, and Diarization for Meeting Analysis. | Thilo von Neumann, Keisuke Kinoshita, Marc Delcroix, Shoko Araki, Tomohiro Nakatani, Reinhold Haeb-Umbach |
| 2019 | ICASSP | A Unified Framework for Neural Speech Separation and Extraction. | Tsubasa Ochiai, Marc Delcroix, Keisuke Kinoshita, Atsunori Ogawa, Tomohiro Nakatani |
| 2019 | ICASSP | ILP-based Compressive Speech Summarization with Content Word Coverage Maximization and Its Oracle Performance Analysis. | Atsunori Ogawa, Tsutomu Hirao, Tomohiro Nakatani, Masaaki Nagata |
| 2019 | Interspeech | Predicting Speech Intelligibility of Enhanced Speech Using Phone Accuracy of DNN-Based ASR System. | Kenichi Arai, Shoko Araki, Atsunori Ogawa, Keisuke Kinoshita, Tomohiro Nakatani, Katsuhiko Yamamoto, Toshio Irino |
| 2019 | Interspeech | End-to-End SpeakerBeam for Single Channel Target Speech Recognition. | Marc Delcroix, Shinji Watanabe, Tsubasa Ochiai, Keisuke Kinoshita, Shigeki Karita, Atsunori Ogawa, Tomohiro Nakatani |
| 2019 | Interspeech | Improving Transformer-Based End-to-End Speech Recognition with Connectionist Temporal Classification and Language Model Integration. | Shigeki Karita, Nelson Enrique Yalta Soplin, Shinji Watanabe, Marc Delcroix, Atsunori Ogawa, Tomohiro Nakatani |
| 2019 | Interspeech | Simultaneous Denoising and Dereverberation for Low-Latency Applications Using Frame-by-Frame Online Unified Convolutional Beamformer. | Tomohiro Nakatani, Keisuke Kinoshita |
| 2019 | Interspeech | Multimodal SpeakerBeam: Single Channel Target Speech Extraction with Audio-Visual Speaker Clues. | Tsubasa Ochiai, Marc Delcroix, Keisuke Kinoshita, Atsunori Ogawa, Tomohiro Nakatani |
| 2019 | Interspeech | Improved Deep Duel Model for Rescoring N-Best Speech Recognition List Using Backward LSTMLM and Ensemble Encoders. | Atsunori Ogawa, Marc Delcroix, Shigeki Karita, Tomohiro Nakatani |
| 2018 | ICASSP | Permutation-Free Cgmm: Complex Gaussian Mixture Model with Inverse Wishart Mixture Model Based Spatial Prior for Permutation-Free Source Separation and Source Counting. | Juan Azcarreta, Nobutaka Ito, Shoko Araki, Tomohiro Nakatani |
| 2018 | ICASSP | Single Channel Target Speaker Extraction and Recognition with Speaker Beam. | Marc Delcroix, Katerina Zmolkov, Keisuke Kinoshita, Atsunori Ogawa, Tomohiro Nakatani |
| 2018 | ICASSP | Dual Frequency- and Block-Permutation Alignment for Deep Learning Based Block-Online Blind Source Separation. | Lukas Drude, Takuya Higuchi, Keisuke Kinoshita, Tomohiro Nakatani, Reinhold Haeb-Umbach |
| 2018 | ICASSP | Frame-by-Frame Closed-Form Update for Mask-Based Adaptive MVDR Beamforming. | Takuya Higuchi, Keisuke Kinoshita, Nobutaka Ito, Shigeki Karita, Tomohiro Nakatani |
| 2018 | ICASSP | Maximum-Likelihood Online Speaker Diarization in Noisy Meetings Based on Categorical Mixture Model and Probabilistic Spatial Dictionary. | Nobutaka Ito, Takashi Makino, Shoko Araki, Tomohiro Nakatani |
| 2018 | ICASSP | Sequence Training of Encoder-Decoder Model Using Policy Gradient for End-to-End Speech Recognition. | Shigeki Karita, Atsunori Ogawa, Marc Delcroix, Tomohiro Nakatani |
| 2018 | ICASSP | Listening to Each Speaker One by One with Recurrent Selective Hearing Networks. | Keisuke Kinoshita, Lukas Drude, Marc Delcroix, Tomohiro Nakatani |
| 2018 | ICASSP | Rescoring N-Best Speech Recognition List Based on One-on-One Hypothesis Comparison Using Encoder-Classifier Model. | Atsunori Ogawa, Marc Delcroix, Shigeki Karita, Tomohiro Nakatani |
| 2018 | ICASSP | Optimization of Speaker-Aware Multichannel Speech Extraction with ASR Criterion. | Katerina Zmolkov, Marc Delcroix, Keisuke Kinoshita, Takuya Higuchi, Tomohiro Nakatani, Jan Cernock |
| 2018 | Interspeech | Auxiliary Feature Based Adaptation of End-to-end ASR Systems. | Marc Delcroix, Shinji Watanabe, Atsunori Ogawa, Shigeki Karita, Tomohiro Nakatani |
| 2018 | Interspeech | Integrating Neural Network Based Beamforming and Weighted Prediction Error Dereverberation. | Lukas Drude, Christoph Bddeker, Jahn Heymann, Reinhold Haeb-Umbach, Keisuke Kinoshita, Marc Delcroix, Tomohiro Nakatani |
| 2018 | Interspeech | Multi-resolution Gammachirp Envelope Distortion Index for Intelligibility Prediction of Noisy Speech. | Katsuhiko Yamamoto, Toshio Irino, Narumi Ohashi, Shoko Araki, Keisuke Kinoshita, Tomohiro Nakatani |
| 2017 | ASRU | Adversarial training for data-driven speech enhancement without parallel corpus. | Takuya Higuchi, Keisuke Kinoshita, Marc Delcroix, Tomohiro Nakatani |
| 2017 | ASRU | Learning speaker representation for neural network based multichannel speaker extraction. | Katerina Zmolkov, Marc Delcroix, Keisuke Kinoshita, Takuya Higuchi, Atsunori Ogawa, Tomohiro Nakatani |
| 2017 | ICASSP | Unsupervised utterance-wise beamformer estimation with speech recognition-level criterion. | Takuya Higuchi, Takuya Yoshioka, Keisuke Kinoshita, Tomohiro Nakatani |
| 2017 | ICASSP | Online environmental adaptation of CNN-based acoustic models using spatial diffuseness features. | Christian Huemmer, Marc Delcroix, Atsunori Ogawa, Keisuke Kinoshita, Tomohiro Nakatani, Walter Kellermann |
| 2017 | ICASSP | Probabilistic spatial dictionary based online adaptive beamforming for meeting recognition in noisy and reverberant environments. | Nobutaka Ito, Shoko Araki, Marc Delcroix, Tomohiro Nakatani |
| 2017 | ICASSP | Deep mixture density network for statistical model-based feature enhancement. | Keisuke Kinoshita, Marc Delcroix, Atsunori Ogawa, Takuya Higuchi, Tomohiro Nakatani |
| 2017 | ICASSP | Integrating DNN-based and spatial clustering-based mask estimation for robust MVDR beamforming. | Tomohiro Nakatani, Nobutaka Ito, Takuya Higuchi, Shoko Araki, Keisuke Kinoshita |
| 2017 | ICASSP | Cumulative moving averaged bottleneck speaker vectors for online speaker adaptation of CNN-based acoustic models. | Tsubasa Ochiai, Marc Delcroix, Keisuke Kinoshita, Atsunori Ogawa, Taichi Asami, Shigeru Katagiri, Tomohiro Nakatani |
| 2017 | ICASSP | Feedback connection for deep neural network-based acoustic modeling. | Dung T. Tran, Marc Delcroix, Atsunori Ogawa, Christian Huemmer, Tomohiro Nakatani |
| 2017 | Interspeech | Deep Clustering-Based Beamforming for Separation with Unknown Number of Sources. | Takuya Higuchi, Keisuke Kinoshita, Marc Delcroix, Katerina Zmolkov, Tomohiro Nakatani |
| 2017 | Interspeech | Forward-Backward Convolutional LSTM for Acoustic Modeling. | Shigeki Karita, Atsunori Ogawa, Marc Delcroix, Tomohiro Nakatani |
| 2017 | Interspeech | Neural Network-Based Spectrum Estimation for Online WPE Dereverberation. | Keisuke Kinoshita, Marc Delcroix, Haeyong Kwon, Takuma Mori, Tomohiro Nakatani |
| 2017 | Interspeech | Improved Example-Based Speech Enhancement by Using Deep Neural Network Acoustic Model for Noise Robust Example Search. | Atsunori Ogawa, Keisuke Kinoshita, Marc Delcroix, Tomohiro Nakatani |
| 2017 | Interspeech | Unfolded Deep Recurrent Convolutional Neural Network with Jump Ahead Connections for Acoustic Modeling. | Dung T. Tran, Marc Delcroix, Shigeki Karita, Michael Hentschel, Atsunori Ogawa, Tomohiro Nakatani |
| 2017 | Interspeech | Uncertainty Decoding with Adaptive Sampling for Noise Robust DNN-Based Acoustic Modeling. | Dung T. Tran, Marc Delcroix, Atsunori Ogawa, Tomohiro Nakatani |
| 2017 | Interspeech | Predicting Speech Intelligibility Using a Gammachirp Envelope Distortion Index Based on the Signal-to-Distortion Ratio. | Katsuhiko Yamamoto, Toshio Irino, Toshie Matsui, Shoko Araki, Keisuke Kinoshita, Tomohiro Nakatani |
| 2017 | Interspeech | Speaker-Aware Neural Network Based Beamformer for Speaker Extraction in Speech Mixtures. | Katerina Zmolkov, Marc Delcroix, Keisuke Kinoshita, Takuya Higuchi, Atsunori Ogawa, Tomohiro Nakatani |
| 2016 | ICASSP | Spatial correlation model based observation vector clustering and MVDR beamforming for meeting recognition. | Shoko Araki, Masahiro Okada, Takuya Higuchi, Atsunori Ogawa, Tomohiro Nakatani |
| 2016 | ICASSP | Context adaptive deep neural networks for fast acoustic model adaptation in noisy conditions. | Marc Delcroix, Keisuke Kinoshita, Chengzhu Yu, Atsunori Ogawa, Takuya Yoshioka, Tomohiro Nakatani |
| 2016 | ICASSP | Multi-pass feature enhancement based on generative-discriminative hybrid approach for noise robust speech recognition. | Masakiyo Fujimoto, Tomohiro Nakatani |
| 2016 | ICASSP | Robust MVDR beamforming using time-frequency masks for online/offline ASR in noise. | Takuya Higuchi, Nobutaka Ito, Takuya Yoshioka, Tomohiro Nakatani |
| 2016 | ICASSP | Modeling audio directional statistics using a complex bingham mixture model for blind source extraction from diffuse noise. | Nobutaka Ito, Shoko Araki, Tomohiro Nakatani |
| 2016 | ICASSP | Real-time integration of statistical model-based speech enhancement with unsupervised noise PSD estimation using microphone array. | Tomoko Kawase, Kenta Niwa, Masakiyo Fujimoto, Noriyoshi Kamado, Kazunori Kobayashi, Shoko Araki, Tomohiro Nakatani |
| 2016 | ICASSP | A generative-discriminative hybrid approach to multi-channel noise reduction for robust automatic speech recognition. | Hendrik Meutzner, Shoko Araki, Masakiyo Fujimoto, Tomohiro Nakatani |
| 2016 | ICASSP | Noise robust speech recognition using recent developments in neural networks for computer vision. | Takuya Yoshioka, Katsunori Ohnishi, Fuming Fang, Tomohiro Nakatani |
| 2016 | Interspeech | Context Adaptive Neural Network for Rapid Adaptation of Deep CNN Based Acoustic Models. | Marc Delcroix, Keisuke Kinoshita, Atsunori Ogawa, Takuya Yoshioka, Dung T. Tran, Tomohiro Nakatani |
| 2016 | Interspeech | Optimization of Speech Enhancement Front-End with Speech Recognition-Level Criterion. | Takuya Higuchi, Takuya Yoshioka, Tomohiro Nakatani |
| 2016 | Interspeech | Robust Example Search Using Bottleneck Features for Example-Based Speech Enhancement. | Atsunori Ogawa, Shogo Seki, Keisuke Kinoshita, Marc Delcroix, Takuya Yoshioka, Tomohiro Nakatani, Kazuya Takeda |
| 2016 | Interspeech | Factorized Linear Input Network for Acoustic Model Adaptation in Noisy Conditions. | Dung T. Tran, Marc Delcroix, Atsunori Ogawa, Tomohiro Nakatani |
| 2016 | Interspeech | Speech Intelligibility Prediction Based on the Envelope Power Spectrum Model with the Dynamic Compressive Gammachirp Auditory Filterbank. | Katsuhiko Yamamoto, Toshio Irino, Toshie Matsui, Shoko Araki, Keisuke Kinoshita, Tomohiro Nakatani |
| 2015 | ASRU | The NTT CHiME-3 system: Advances in speech enhancement and recognition for mobile multi-microphone devices. | Takuya Yoshioka, Nobutaka Ito, Marc Delcroix, Atsunori Ogawa, Keisuke Kinoshita, Masakiyo Fujimoto, Chengzhu Yu, Wojciech J. Fabian, Miquel Espi, Takuya Higuchi, Shoko Araki, Tomohiro Nakatani |
| 2015 | ICASSP | Exploring multi-channel features for denoising-autoencoder-based speech enhancement. | Shoko Araki, Tomoki Hayashi, Marc Delcroix, Masakiyo Fujimoto, Kazuya Takeda, Tomohiro Nakatani |
| 2015 | ICASSP | Context adaptive deep neural networks for fast acoustic model adaptation. | Marc Delcroix, Keisuke Kinoshita, Takaaki Hori, Tomohiro Nakatani |
| 2015 | ICASSP | Feature enhancement based on generative-discriminative hybrid approach with gmms and DNNS for noise robust speech recognition. | Masakiyo Fujimoto, Tomohiro Nakatani |
| 2015 | ICASSP | Modeling inter-node acoustic dependencies with Restricted Boltzmann Machine for distributed microphone array based BSS. | Keisuke Kinoshita, Tomohiro Nakatani |
| 2015 | ICASSP | Far-field speech recognition using CNN-DNN-HMM with convolution in time. | Takuya Yoshioka, Shigeki Karita, Tomohiro Nakatani |
| 2015 | Interspeech | Feature extraction strategies in deep learning based acoustic event detection. | Miquel Espi, Masakiyo Fujimoto, Keisuke Kinoshita, Tomohiro Nakatani |
| 2015 | Interspeech | Text-informed speech enhancement with deep neural networks. | Keisuke Kinoshita, Marc Delcroix, Atsunori Ogawa, Tomohiro Nakatani |
| 2015 | Interspeech | Robust i-vector extraction for neural network adaptation in noisy environment. | Chengzhu Yu, Atsunori Ogawa, Marc Delcroix, Takuya Yoshioka, Tomohiro Nakatani, John H. L. Hansen |
| 2014 | ICASSP | Unsupervised non-parametric Bayesian modeling of non-stationary noise for model-based noise suppression. | Masakiyo Fujimoto, Yotaro Kubo, Tomohiro Nakatani |
| 2014 | ICASSP | Probabilistic integration of diffuse noise suppression and dereverberation. | Nobutaka Ito, Shoko Araki, Tomohiro Nakatani |
| 2014 | ICASSP | Fast segment search for corpus-based speech enhancement based on speech recognition technology. | Atsunori Ogawa, Keisuke Kinoshita, Takaaki Hori, Tomohiro Nakatani, Atsushi Nakamura |
| 2013 | ICASSP | Unsupervised discriminative adaptation using differenced maximum mutual information based linear regression. | Marc Delcroix, Atsunori Ogawa, Seong-Jun Hahm, Tomohiro Nakatani, Atsushi Nakamura |
| 2013 | ICASSP | Permutation-free convolutive blind source separation via full-band clustering based on frequency-independent source presence priors. | Nobutaka Ito, Shoko Araki, Tomohiro Nakatani |
| 2013 | ICASSP | Coupling beamforming with spatial and spectral feature based spectral enhancement and its application to meeting recognition. | Tomohiro Nakatani, Mehrez Souden, Shoko Araki, Takuya Yoshioka, Takaaki Hori, Atsunori Ogawa |
| 2013 | ICASSP | An integration of source location cues for speech clustering in distributed microphone arrays. | Mehrez Souden, Keisuke Kinoshita, Tomohiro Nakatani |
| 2013 | ICASSP | Noise model transfer using affine transformation with application to large vocabulary reverberant speech recognition. | Takuya Yoshioka, Tomohiro Nakatani |
| 2013 | Interspeech | Is speech enhancement pre-processing still relevant when using deep neural networks for acoustic modeling? | Marc Delcroix, Yotaro Kubo, Tomohiro Nakatani, Atsushi Nakamura |
| 2013 | Interspeech | Model-based noise suppression using unsupervised estimation of hidden Markov model for non-stationary noise. | Masakiyo Fujimoto, Tomohiro Nakatani |
| 2013 | Interspeech | Blind source separation using spatially distributed microphones based on microphone-location dependent source activities. | Keisuke Kinoshita, Mehrez Souden, Tomohiro Nakatani |
| 2013 | Interspeech | Conditional emission densities for combining speech enhancement and recognition systems. | Armin Sehr, Takuya Yoshioka, Marc Delcroix, Keisuke Kinoshita, Tomohiro Nakatani, Roland Maas, Walter Kellermann |
| 2013 | Interspeech | On the robustness of distributed EM based BSS in asynchronous distributed microphone array scenarios. | Yasufumi Uezu, Keisuke Kinoshita, Mehrez Souden, Tomohiro Nakatani |
| 2012 | ICASSP | Sparse vector factorization for underdetermined BSS using wrapped-phase GMM and source log-spectral prior. | Shoko Araki, Tomohiro Nakatani |
| 2012 | ICASSP | Discriminative feature transforms using differenced maximum mutual information. | Marc Delcroix, Atsunori Ogawa, Shinji Watanabe, Tomohiro Nakatani, Atsushi Nakamura |
| 2012 | ICASSP | Noise suppression with unsupervised joint speaker adaptation and noise mixture model estimation. | Masakiyo Fujimoto, Shinji Watanabe, Tomohiro Nakatani |
| 2012 | ICASSP | Introduction of speech log-spectral priors into dereverberation based on Itakura-Saito distance minimization. | Yasuaki Iwata, Tomohiro Nakatani |
| 2012 | ICASSP | New analytical update rule for TDOA inference for underdetermined BSS in noisy environments. | Takuro Maruyama, Shoko Araki, Tomohiro Nakatani, Shigeki Miyabe, Takeshi Yamada, Shoji Makino, Atsushi Nakamura |
| 2012 | ICASSP | LogMax observation model with MFCC-based spectral prior for reduction of highly nonstationary ambient noise. | Tomohiro Nakatani, Takuya Yoshioka, Shoko Araki, Marc Delcroix, Masakiyo Fujimoto |
| 2012 | ICASSP | A multichannel MMSE-based framework for joint blind source separation and noise reduction. | Mehrez Souden, Shoko Araki, Keisuke Kinoshita, Tomohiro Nakatani, Hiroshi Sawada |
| 2012 | ICASSP | Time-varying residual noise feature model estimation for multi-microphone speech recognition. | Takuya Yoshioka, Emmanuel Ternon, Tomohiro Nakatani |
| 2012 | Interspeech | Example-based speech enhancement with joint utilization of spatial, spectral & temporal cues of speech and noise. | Keisuke Kinoshita, Marc Delcroix, Mehrez Souden, Tomohiro Nakatani |
| 2011 | ICASSP | Hybrid approach for multichannel source separation combining time-frequency mask with multi-channel Wiener filter. | Shoko Araki, Tomohiro Nakatani |
| 2011 | ICASSP | Non-stationary noise estimation method based on bias-residual component decomposition for robust speech recognition. | Masakiyo Fujimoto, Shinji Watanabe, Tomohiro Nakatani |
| 2011 | ICASSP | Joint unsupervised learning of hidden Markov source models and source location models for multichannel source separation. | Tomohiro Nakatani, Shoko Araki, Takuya Yoshioka, Masakiyo Fujimoto |
| 2011 | ICASSP | Speech enhancement based on log spectral envelope model and harmonicity-derived spectral mask, and its coupling with feature compensation. | Takuya Yoshioka, Tomohiro Nakatani |
| 2011 | Interspeech | A Robust Estimation Method of Noise Mixture Model for Noise Suppression. | Masakiyo Fujimoto, Shinji Watanabe, Tomohiro Nakatani |
| 2011 | Interspeech | Single Channel Dereverberation Using Example-Based Speech Enhancement with Uncertainty Decoding Technique. | Keisuke Kinoshita, Mehrez Souden, Marc Delcroix, Tomohiro Nakatani |
| 2011 | Interspeech | Reduction of Highly Nonstationary Ambient Noise by Integrating Spectral and Locational Characteristics of Speech and Noise for Robust ASR. | Tomohiro Nakatani, Shoko Araki, Marc Delcroix, Takuya Yoshioka, Masakiyo Fujimoto |
| 2011 | Interspeech | A Multichannel Feature-Based Processing for Robust Speech Recognition. | Mehrez Souden, Keisuke Kinoshita, Marc Delcroix, Tomohiro Nakatani |
| 2010 | ICASSP | Simultaneous clustering of mixing and spectral model parameters for blind sparse source separation. | Shoko Araki, Tomohiro Nakatani, Hiroshi Sawada |
| 2010 | ICASSP | Blind upmix of stereo music signals using multi-step linear prediction based reverberation extraction. | Keisuke Kinoshita, Tomohiro Nakatani, Masato Miyoshi |
| 2010 | ICASSP | Single channel source separation based on sparse source observation model with harmonic constraint. | Tomohiro Nakatani, Shoko Araki |
| 2010 | ICASSP | Music dereverberation using harmonic structure source model and Wiener filter. | Naoki Yasuraoka, Takuya Yoshioka, Tomohiro Nakatani, Atsushi Nakamura, Hiroshi G. Okuno |
| 2010 | ICASSP | Noisy speech enhancement based on prior knowledge about spectral envelope and harmonic structure. | Takuya Yoshioka, Tomohiro Nakatani, Hiroshi G. Okuno |
| 2010 | Interspeech | Voice activity detection using frame-wise model re-estimation method based on Gaussian pruning with weight normalization. | Masakiyo Fujimoto, Shinji Watanabe, Tomohiro Nakatani |
| 2010 | Interspeech | Multichannel source separation based on source location cue with log-spectral shaping by hidden Markov source model. | Tomohiro Nakatani, Shoko Araki, Takuya Yoshioka, Masakiyo Fujimoto |
| 2010 | ISCAS | Cepstral smoothing of separated signals for underdetermined speech separation. | Yumi Ansa, Shoko Araki, Shoji Makino, Tomohiro Nakatani, Takeshi Yamada, Atsushi Nakamura, Nobuhiko Kitawaki |
| 2009 | ICASSP | Blind sparse source separation for unknown number of sources using Gaussian mixture model fitting with Dirichlet prior. | Shoko Araki, Tomohiro Nakatani, Hiroshi Sawada, Shoji Makino |
| 2009 | ICASSP | Robust speech dereverberation based on non-negativity and sparse nature of speech spectrograms. | Hirokazu Kameoka, Tomohiro Nakatani, Takuya Yoshioka |
| 2009 | ICASSP | Real-time speech enhancement in noisy reverberant multi-talker environments based on a location-independent room acoustics model. | Tomohiro Nakatani, Takuya Yoshioka, Keisuke Kinoshita, Masato Miyoshi, Biing-Hwang Juang |
| 2009 | ICASSP | Adaptive dereverberation of speech signals with speaker-position change detection. | Takuya Yoshioka, Hideyuki Tachibana, Tomohiro Nakatani, Masato Miyoshi |
| 2009 | ICMI | A speaker diarization method based on the probabilistic fusion of audio-visual location information. | Kentaro Ishizuka, Shoko Araki, Kazuhiro Otsuka, Tomohiro Nakatani, Masakiyo Fujimoto |
| 2009 | Interspeech | A study of mutual front-end processing method based on statistical model for noise robust speech recognition. | Masakiyo Fujimoto, Kentaro Ishizuka, Tomohiro Nakatani |
| 2009 | IDA | Stereo Source Separation and Source Counting with MAP Estimation with Dirichlet Prior Considering Spatial Aliasing Problem. | Shoko Araki, Tomohiro Nakatani, Hiroshi Sawada, Shoji Makino |
| 2008 | ACSSC | Principles and applications of dereverberation for noisy and reverberant audio signals. | Masato Miyoshi, Keisuke Kinoshita, Takuya Yoshioka, Tomohiro Nakatani |
| 2008 | ICASSP | Combined static and dynamic variance adaptation for efficient interconnection of speech enhancement pre-processor with speech recognizer. | Marc Delcroix, Tomohiro Nakatani, Shinji Watanabe |
| 2008 | ICASSP | A voice activity detection based on the adaptive integration of multiple speech features and a signal decision scheme. | Masakiyo Fujimoto, Kentaro Ishizuka, Tomohiro Nakatani |
| 2008 | ICASSP | Blind speech dereverberation with multi-channel linear prediction based on short time fourier transform representation. | Tomohiro Nakatani, Takuya Yoshioka, Keisuke Kinoshita, Masato Miyoshi, Biing-Hwang Juang |
| 2008 | ICASSP | Maximum likelihood approach to speech enhancement for noisy reverberant signals. | Takuya Yoshioka, Tomohiro Nakatani, Takafumi Hikichi, Masato Miyoshi |
| 2008 | Interspeech | Study of integration of statistical model-based voice activity detection and noise suppression. | Masakiyo Fujimoto, Kentaro Ishizuka, Tomohiro Nakatani |
| 2008 | ISCAS | Missing feature speech recognition in a meeting situation with maximum SNR beamforming. | Dorothea Kolossa, Shoko Araki, Marc Delcroix, Tomohiro Nakatani, Reinhold Orglmeister, Shoji Makino |
| 2007 | ICASSP | Study on Speech Dereverberation with Autocorrelation Codebook. | Tomohiro Nakatani, Biing-Hwang Juang, Takafumi Hikichi, Takuya Yoshioka, Keisuke Kinoshita, Marc Delcroix, Masato Miyoshi |
| 2007 | ICASSP | Two-Microphone Voice Activity Detection Based on the Homogeneity of the Direction of Arrival Estimates. | Juan E. Rubio, Kentaro Ishizuka, Hiroshi Sawada, Shoko Araki, Tomohiro Nakatani, Masakiyo Fujimoto |
| 2007 | Interspeech | Noise robust front-end processing with voice activity detection based on periodic to aperiodic component ratio. | Kentaro Ishizuka, Tomohiro Nakatani, Masakiyo Fujimoto, Noboru Miyazaki |
| 2007 | Interspeech | Multi-step linear prediction based speech dereverberation in noisy reverberant environment. | Keisuke Kinoshita, Marc Delcroix, Tomohiro Nakatani, Masato Miyoshi |
| 2007 | ISCAS | Joint Source-Channel Modeling and Estimation for Speech Dereverberation. | Biing-Hwang Juang, Tomohiro Nakatani |
| 2007 | ISCAS | Robust blind dereverberation of speech signals based on characteristics of short-time speech segments. | Tomohiro Nakatani, Takafumi Hikichi, Keisuke Kinoshita, Takuya Yoshioka, Marc Delcroix, Masato Miyoshi, Biing-Hwang Juang |
| 2006 | ICASSP | Spectral Subtraction Steered by Multi-Step Forward Linear Prediction For Single Channel Speech Dereverberation. | Keisuke Kinoshita, Tomohiro Nakatani, Masato Miyoshi |
| 2006 | ICASSP | Speech Dereverberation Based on Probabilistic Models of Source and Room Acoustics. | Tomohiro Nakatani, Biing-Hwang Juang, Keisuke Kinoshita, Masato Miyoshi |
| 2006 | Interspeech | Study of noise robust voice activity detection based on periodic component to aperiodic component ratio. | Kentaro Ishizuka, Tomohiro Nakatani |
| 2005 | ICASSP | Speech Signal Analysis with Exponential Autoregressive Model. | Kentaro Ishizuka, Hiroko Kato Solvang, Tomohiro Nakatani |
| 2005 | ICASSP | Fast Estimation of a Precise Dereverberation Filter based on Speech Harmonicity. | Keisuke Kinoshita, Tomohiro Nakatani, Masato Miyoshi |
| 2005 | Interspeech | Efficient blind dereverberation framework for automatic speech recognition. | Keisuke Kinoshita, Tomohiro Nakatani, Masato Miyoshi |
| 2004 | Interspeech | Developmental changes in voiced-segment ratio for Japanese infants and parents. | Shigeaki Amano, Tomohiro Nakatani, Tadahisa Kondo |
| 2004 | Interspeech | Disambiguation in determining phonemes of sound-imitation words for environmental sound recognition. | Kazushi Ishihara, Yuya Hattori, Tomohiro Nakatani, Kazunori Komatani, Tetsuya Ogata, Hiroshi G. Okuno |
| 2004 | Interspeech | Improvement in robustness of speech feature extraction method using sub-band based periodicity and aperiodicity decomposition. | Kentaro Ishizuka, Noboru Miyazaki, Tomohiro Nakatani, Yasuhiro Minami |
| 2004 | Interspeech | Improving automatic speech recognition performance and speech inteligibility with harmonicity based dereverberation. | Keisuke Kinoshita, Tomohiro Nakatani, Masato Miyoshi |
| 2004 | Interspeech | Harmonicity based monaural speech dereverberation with time warping and F0 adaptive window. | Tomohiro Nakatani, Keisuke Kinoshita, Masato Miyoshi, Parham Zolfaghari |
| 2004 | Interspeech | Harmonicity based blind dereverberation with time warping. | Tomohiro Nakatani, Keisuke Kinoshita, Masato Miyoshi, Parham Zolfaghari |
| 2004 | PRICAI | Automatic Sound-Imitation Word Recognition from Environmental Sounds Focusing on Ambiguity Problem in Determining Phonemes. | Kazushi Ishihara, Tomohiro Nakatani, Tetsuya Ogata, Hiroshi G. Okuno |
| 2003 | ICASSP | Blind dereverberation of single channel speech signal based on harmonic structure. | Tomohiro Nakatani, Masato Miyoshi |
| 2003 | Interspeech | Dominance spectrum based v/UV classification and f_0 estimation. | Tomohiro Nakatani, Toshio Irino, Parham Zolfaghari |
| 2003 | Interspeech | Glottal closure instant synchronous sinusoidal model for high quality speech analysis/synthesis. | Parham Zolfaghari, Tomohiro Nakatani, Toshio Irino, Hideki Kawahara, Fumitada Itakura |
| 2002 | Interspeech | Evaluation of a speech recognition / generation method based on HMM and straight. | Toshio Irino, Yasuhiro Minami, Tomohiro Nakatani, Minoru Tsuzaki, H. Tagawa |
| 2002 | Interspeech | Robust fundamental frequency estimation against background noise and spectral distortion. | Tomohiro Nakatani, Toshio Irino |
| 1998 | AAAI | Sound Ontology for Computational Auditory Scence Analysis. | Tomohiro Nakatani, Hiroshi G. Okuno |
| 1997 | IJCAI | Understanding Three Simultaneous Speeches. | Hiroshi G. Okuno, Tomohiro Nakatani, Takeshi Kawabata |
| 1996 | AAAI | Interfacing Sound Stream Segregation to Automatic Speech Recognition - Preliminary Results on Listening to Several Sounds Simultaneously. | Hiroshi G. Okuno, Tomohiro Nakatani, Takeshi Kawabata |
| 1996 | ICASSP | Localization by harmonic structure and its application to harmonic sound stream segregation. | Tomohiro Nakatani, Masataka Goto, Hiroshi G. Okuno |
| 1996 | Interspeech | A new speech enhancement: speech stream segregation. | Hiroshi G. Okuno, Tomohiro Nakatani, Takeshi Kawabata |
| 1995 | ICASSP | A computational model of sound stream segregation with multi-agent paradigm. | Tomohiro Nakatani, Takeshi Kawabata, Hiroshi G. Okuno |
| 1995 | IJCAI | Residue-Driven Architecture for Computational Auditory Scene Analysis. | Tomohiro Nakatani, Hiroshi G. Okuno, Takeshi Kawabata |
| 1994 | AAAI | Auditory Stream Segregation in Auditory Scene Analysis with a Multi-Agent System. | Tomohiro Nakatani, Hiroshi G. Okuno, Takeshi Kawabata |
| 1994 | Interspeech | Unified architecture for auditory scene analysis and spoken language processing. | Tomohiro Nakatani, Takeshi Kawabata, Hiroshi G. Okuno |