| 2025 | ASRU | Predictive ASR and Turn-taking Prediction at Once: Towards More Responsive Spoken Dialog System. | Ryo Fukuda, Takatomo Kano, Naohiro Tawara, Marc Delcroix, Atsunori Ogawa, Yuya Chiba, Atsushi Ando |
| 2025 | ASRU | Can We Really Repurpose Multi-Speaker ASR Corpus for Speaker Diarization? | Shota Horiguchi, Naohiro Tawara, Takanori Ashihara, Atsushi Ando, Marc Delcroix |
| 2025 | ICASSP | SoundBeam meets M2D: Target Sound Extraction with Audio Foundation Model. | Carlos Hernandez-Olivan, Marc Delcroix, Tsubasa Ochiai, Daisuke Niizumi, Naohiro Tawara, Tomohiro Nakatani, Shoko Araki |
| 2025 | ICASSP | Guided Speaker Embedding. | Shota Horiguchi, Takafumi Moriya, Atsushi Ando, Takanori Ashihara, Hiroshi Sato, Naohiro Tawara, Marc Delcroix |
| 2025 | ICASSP | Bridging Speech and Text Foundation Models with ReShape Attention. | Takatomo Kano, Atsunori Ogawa, Marc Delcroix, William Chen, Ryo Fukuda, Kohei Matsuura, Takanori Ashihara, Shinji Watanabe |
| 2025 | ICASSP | Alignment-Free Training for Transducer-based Multi-Talker ASR. | Takafumi Moriya, Shota Horiguchi, Marc Delcroix, Ryo Masumura, Takanori Ashihara, Hiroshi Sato, Kohei Matsuura, Masato Mimura |
| 2025 | ICASSP | A Hybrid Probabilistic-Deterministic Model Recursively Enhancing Speech. | Tomohiro Nakatani, Naoyuki Kamo, Marc Delcroix, Shoko Araki |
| 2025 | ICASSP | TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models. | Junyi Peng, Takanori Ashihara, Marc Delcroix, Tsubasa Ochiai, Oldrich Plchot, Shoko Araki, Jan Cernock |
| 2025 | ICASSP | Mamba-based Segmentation Model for Speaker Diarization. | Alexis Plaquet, Naohiro Tawara, Marc Delcroix, Shota Horiguchi, Atsushi Ando, Shoko Araki |
| 2025 | ICASSP | Multi-channel Speaker Counting for EEND-VC-based Speaker Diarization on Multi-domain Conversation. | Naohiro Tawara, Atsushi Ando, Shota Horiguchi, Marc Delcroix |
| 2025 | Interspeech | Analysis of Semantic and Acoustic Token Variability Across Speech, Music, and Audio Domains. | Takanori Ashihara, Marc Delcroix, Tsubasa Ochiai, Kohei Matsuura, Shota Horiguchi |
| 2025 | Interspeech | Mitigating Non-Target Speaker Bias in Guided Speaker Embedding. | Shota Horiguchi, Takanori Ashihara, Marc Delcroix, Atsushi Ando, Naohiro Tawara |
| 2025 | Interspeech | Pretraining Multi-Speaker Identification for Neural Speaker Diarization. | Shota Horiguchi, Atsushi Ando, Naohiro Tawara, Marc Delcroix |
| 2025 | Interspeech | MOVER: Combining Multiple Meeting Recognition Systems. | Naoyuki Kamo, Tsubasa Ochiai, Marc Delcroix, Tomohiro Nakatani |
| 2025 | Interspeech | Pick and Summarize: Integrating Extractive and Abstractive Speech Summarization. | Takatomo Kano, Atsunori Ogawa, Marc Delcroix, Ryo Fukuda, William Chen, Shinji Watanabe |
| 2025 | Interspeech | Real-time TSE demonstration via SoundBeam with KD. | Keigo Wakayama, Tomoko Kawase, Takafumi Moriya, Marc Delcroix, Hiroshi Sato, Tsubasa Ochiai, Masahiro Yasuda, Shoko Araki |
| 2024 | ICASSP | What Do Self-Supervised Speech and Speaker Models Learn? New Findings from a Cross Model Layer-Wise Analysis. | Takanori Ashihara, Marc Delcroix, Takafumi Moriya, Kohei Matsuura, Taichi Asami, Yusuke Ijima |
| 2024 | ICASSP | Train Long and Test Long: Leveraging Full Document Contexts in Speech Processing. | William Chen, Takatomo Kano, Atsunori Ogawa, Marc Delcroix, Shinji Watanabe |
| 2024 | ICASSP | Noise-Robust Zero-Shot Text-to-Speech Synthesis Conditioned on Self-Supervised Speech-Representation Model with Adapters. | Kenichi Fujita, Hiroshi Sato, Takanori Ashihara, Hiroki Kanagawa, Marc Delcroix, Takafumi Moriya, Yusuke Ijima |
| 2024 | ICASSP | How Does End-To-End Speech Recognition Training Impact Speech Enhancement Artifacts? | Kazuma Iwamoto, Tsubasa Ochiai, Marc Delcroix, Rintaro Ikeshita, Hiroshi Sato, Shoko Araki, Shigeru Katagiri |
| 2024 | ICASSP | Diffusion Model-Based MIMO Speech Denoising and Dereverberation. | Rino Kimura, Tomohiro Nakatani, Naoyuki Kamo, Marc Delcroix, Shoko Araki, Tetsuya Ueda, Shoji Makino |
| 2024 | ICASSP | Discriminative Training of VBx Diarization. | Dominik Klement, Mireia Dez, Federico Landini, Luks Burget, Anna Silnova, Marc Delcroix, Naohiro Tawara |
| 2024 | ICASSP | Meeting Recognition with Continuous Speech Separation and Transcription-Supported Diarization. | Thilo von Neumann, Christoph Bddeker, Tobias Cord-Landwehr, Marc Delcroix, Reinhold Haeb-Umbach |
| 2024 | ICASSP | Probing Self-Supervised Learning Models With Target Speech Extraction. | Junyi Peng, Marc Delcroix, Tsubasa Ochiai, Oldrich Plchot, Takanori Ashihara, Shoko Araki, Jan Cernock |
| 2024 | ICASSP | Target Speech Extraction with Pre-Trained Self-Supervised Learning Models. | Junyi Peng, Marc Delcroix, Tsubasa Ochiai, Oldrich Plchot, Shoko Araki, Jan Cernock |
| 2024 | ICASSP | Neural Network-Based Virtual Microphone Estimation with Virtual Microphone and Beamformer-Level Multi-Task Loss. | Hanako Segawa, Tsubasa Ochiai, Marc Delcroix, Tomohiro Nakatani, Rintaro Ikeshita, Shoko Araki, Takeshi Yamada, Shoji Makino |
| 2024 | ICASSP | Ensemble Inference for Diffusion Model-Based Speech Enhancement. | Hao Shi, Naoyuki Kamo, Marc Delcroix, Tomohiro Nakatani, Shoko Araki |
| 2024 | ICASSP | NTT Speaker Diarization System for Chime-7: Multi-Domain, Multi-Microphone end-to-end and Vector Clustering Diarization. | Naohiro Tawara, Marc Delcroix, Atsushi Ando, Atsunori Ogawa |
| 2024 | ICASSP | Online Target Sound Extraction with Knowledge Distillation from Partially Non-Causal Teacher. | Keigo Wakayama, Tsubasa Ochiai, Marc Delcroix, Masahiro Yasuda, Shoichiro Saito, Shoko Araki, Akira Nakayama |
| 2024 | Interspeech | Lightweight Zero-shot Text-to-Speech with Mixture of Adapters. | Kenichi Fujita, Takanori Ashihara, Marc Delcroix, Yusuke Ijima |
| 2024 | Interspeech | Sentence-wise Speech Summarization: Task, Datasets, and End-to-End Modeling with LM Knowledge Distillation. | Kohei Matsuura, Takanori Ashihara, Takafumi Moriya, Masato Mimura, Takatomo Kano, Atsunori Ogawa, Marc Delcroix |
| 2024 | Interspeech | SpeakerBeam-SS: Real-time Target Speaker Extraction with Lightweight Conv-TasNet and State Space Modeling. | Hiroshi Sato, Takafumi Moriya, Masato Mimura, Shota Horiguchi, Tsubasa Ochiai, Takanori Ashihara, Atsushi Ando, Kentaro Shinayama, Marc Delcroix |
| 2024 | Interspeech | Array Geometry-Robust Attention-Based Neural Beamformer for Moving Speakers. | Marvin Tammen, Tsubasa Ochiai, Marc Delcroix, Tomohiro Nakatani, Shoko Araki, Simon Doclo |
| 2023 | ASRU | Summarize While Translating: Universal Model With Parallel Decoding for Summarization and Translation. | Takatomo Kano, Atsunori Ogawa, Marc Delcroix, Kohei Matsuura, Takanori Ashihara, William Chen, Shinji Watanabe |
| 2023 | ASRU | Espnet-Summ: Introducing a Novel Large Dataset, Toolkit, and a Cross-Corpora Evaluation of Speech Summarization Systems. | Roshan S. Sharma, William Chen, Takatomo Kano, Ruchira Sharma, Siddhant Arora, Shinji Watanabe, Atsunori Ogawa, Marc Delcroix, Rita Singh, Bhiksha Raj |
| 2023 | ICASSP | Speech Summarization of Long Spoken Document: Improving Memory Efficiency of Speech/Text Encoders. | Takatomo Kano, Atsunori Ogawa, Marc Delcroix, Roshan S. Sharma, Kohei Matsuura, Shinji Watanabe |
| 2023 | ICASSP | Leveraging Large Text Corpora For End-To-End Speech Summarization. | Kohei Matsuura, Takanori Ashihara, Takafumi Moriya, Tomohiro Tanaka, Atsunori Ogawa, Marc Delcroix, Ryo Masumura |
| 2023 | ICASSP | On Word Error Rate Definitions and Their Efficient Computation for Multi-Speaker Speech Recognition Systems. | Thilo von Neumann, Christoph Bddeker, Keisuke Kinoshita, Marc Delcroix, Reinhold Haeb-Umbach |
| 2023 | ICASSP | Iterative Shallow Fusion of Backward Language Model for End-To-End Speech Recognition. | Atsunori Ogawa, Takafumi Moriya, Naoyuki Kamo, Naohiro Tawara, Marc Delcroix |
| 2023 | Interspeech | SpeechGLUE: How Well Can Self-Supervised Speech Models Capture Linguistic Knowledge? | Takanori Ashihara, Takafumi Moriya, Kohei Matsuura, Tomohiro Tanaka, Yusuke Ijima, Taichi Asami, Marc Delcroix, Yukinori Honma |
| 2023 | Interspeech | Multi-Stream Extension of Variational Bayesian HMM Clustering (MS-VBx) for Combined End-to-End and Vector Clustering-based Diarization. | Marc Delcroix, Naohiro Tawara, Mireia Dez, Federico Landini, Anna Silnova, Atsunori Ogawa, Tomohiro Nakatani, Luks Burget, Shoko Araki |
| 2023 | Interspeech | Target Speech Extraction with Conditional Diffusion Model. | Naoyuki Kamo, Marc Delcroix, Tomohiro Nakatani |
| 2023 | Interspeech | Transfer Learning from Pre-trained Language Models Improves End-to-End Speech Summarization. | Kohei Matsuura, Takanori Ashihara, Takafumi Moriya, Tomohiro Tanaka, Takatomo Kano, Atsunori Ogawa, Marc Delcroix |
| 2023 | Interspeech | Knowledge Distillation for Neural Transducer-based Target-Speaker ASR: Exploiting Parallel Mixture/Single-Talker Speech Data. | Takafumi Moriya, Hiroshi Sato, Tsubasa Ochiai, Marc Delcroix, Takanori Ashihara, Kohei Matsuura, Tomohiro Tanaka, Ryo Masumura, Atsunori Ogawa, Taichi Asami |
| 2023 | Interspeech | Downstream Task Agnostic Speech Enhancement with Self-Supervised Representation Loss. | Hiroshi Sato, Ryo Masumura, Tsubasa Ochiai, Marc Delcroix, Takafumi Moriya, Takanori Ashihara, Kentaro Shinayama, Saki Mizuno, Mana Ihori, Tomohiro Tanaka, Nobukatsu Hojo |
| 2022 | ICASSP | Integrating Multiple ASR Systems into NLP Backend with Attention Fusion. | Takatomo Kano, Atsunori Ogawa, Marc Delcroix, Shinji Watanabe |
| 2022 | ICASSP | Tight Integration Of Neural- And Clustering-Based Diarization Through Deep Unfolding Of Infinite Gaussian Mixture Model. | Keisuke Kinoshita, Marc Delcroix, Tomoharu Iwata |
| 2022 | ICASSP | Hybrid RNN-T/Attention-Based Streaming ASR with Triggered Chunkwise Attention and Dual Internal Language Model Integration. | Takafumi Moriya, Takanori Ashihara, Atsushi Ando, Hiroshi Sato, Tomohiro Tanaka, Kohei Matsuura, Ryo Masumura, Marc Delcroix, Takahiro Shinozaki |
| 2022 | ICASSP | SA-SDR: A Novel Loss Function for Separation of Meeting Style Data. | Thilo von Neumann, Keisuke Kinoshita, Christoph Bddeker, Marc Delcroix, Reinhold Haeb-Umbach |
| 2022 | ICASSP | Lattice Rescoring Based on Large Ensemble of Complementary Neural Language Models. | Atsunori Ogawa, Naohiro Tawara, Marc Delcroix, Shoko Araki |
| 2022 | ICASSP | Learning to Enhance or Not: Neural Network-Based Switching of Enhanced and Observed Signals for Overlapping Speech Recognition. | Hiroshi Sato, Tsubasa Ochiai, Marc Delcroix, Keisuke Kinoshita, Naoyuki Kamo, Takafumi Moriya |
| 2022 | Interspeech | Listen only to me! How well can target speech extraction handle false alarms? | Marc Delcroix, Keisuke Kinoshita, Tsubasa Ochiai, Katerina Zmolkov, Hiroshi Sato, Tomohiro Nakatani |
| 2022 | Interspeech | How bad are artifacts?: Analyzing the impact of speech enhancement errors on ASR. | Kazuma Iwamoto, Tsubasa Ochiai, Marc Delcroix, Rintaro Ikeshita, Hiroshi Sato, Shoko Araki, Shigeru Katagiri |
| 2022 | Interspeech | Utterance-by-utterance overlap-aware neural diarization with Graph-PIT. | Keisuke Kinoshita, Thilo von Neumann, Marc Delcroix, Christoph Bddeker, Reinhold Haeb-Umbach |
| 2022 | Interspeech | Revisiting joint decoding based multi-talker speech recognition with DNN acoustic model. | Martin Kocour, Katerina Zmolkov, Lucas Ondel, Jan Svec, Marc Delcroix, Tsubasa Ochiai, Luks Burget, Jan Cernock |
| 2022 | Interspeech | Streaming Target-Speaker ASR with Neural Transducer. | Takafumi Moriya, Hiroshi Sato, Tsubasa Ochiai, Marc Delcroix, Takahiro Shinozaki |
| 2022 | Interspeech | Strategies to Improve Robustness of Target Speech Extraction to Enrollment Variations. | Hiroshi Sato, Tsubasa Ochiai, Marc Delcroix, Keisuke Kinoshita, Takafumi Moriya, Naoki Makishima, Mana Ihori, Tomohiro Tanaka, Ryo Masumura |
| 2021 | ASRU | Attention-Based Multi-Hypothesis Fusion for Speech Summarization. | Takatomo Kano, Atsunori Ogawa, Marc Delcroix, Shinji Watanabe |
| 2021 | ICASSP | Convolutive Transfer Function Invariant SDR Training Criteria for Multi-Channel Reverberant Speech Separation. | Christoph Bddeker, Wangyou Zhang, Tomohiro Nakatani, Keisuke Kinoshita, Tsubasa Ochiai, Marc Delcroix, Naoyuki Kamo, Yanmin Qian, Reinhold Haeb-Umbach |
| 2021 | ICASSP | Speaker Activity Driven Neural Speech Extraction. | Marc Delcroix, Katerina Zmolkov, Tsubasa Ochiai, Keisuke Kinoshita, Tomohiro Nakatani |
| 2021 | ICASSP | Integrating End-to-End Neural and Clustering-Based Diarization: Getting the Best of Both Worlds. | Keisuke Kinoshita, Marc Delcroix, Naohiro Tawara |
| 2021 | ICASSP | Dual-Path Modeling for Long Recording Speech Separation in Meetings. | Chenda Li, Zhuo Chen, Yi Luo, Cong Han, Tianyan Zhou, Keisuke Kinoshita, Marc Delcroix, Shinji Watanabe, Yanmin Qian |
| 2021 | ICASSP | Neural Network-Based Virtual Microphone Estimator. | Tsubasa Ochiai, Marc Delcroix, Tomohiro Nakatani, Rintaro Ikeshita, Keisuke Kinoshita, Shoko Araki |
| 2021 | ICASSP | BLSTM-Based Confidence Estimation for End-to-End Speech Recognition. | Atsunori Ogawa, Naohiro Tawara, Takatomo Kano, Marc Delcroix |
| 2021 | ICASSP | Data Fusion for Audiovisual Speaker Localization: Extending Dynamic Stream Weights to the Spatial Domain. | Julio Wissing, Benedikt T. Boenninghoff, Dorothea Kolossa, Tsubasa Ochiai, Marc Delcroix, Keisuke Kinoshita, Tomohiro Nakatani, Shoko Araki, Christopher Schymura |
| 2021 | ICASSP | End-to-End Dereverberation, Beamforming, and Speech Recognition with Improved Numerical Stability and Advanced Frontend. | Wangyou Zhang, Christoph Bddeker, Shinji Watanabe, Tomohiro Nakatani, Marc Delcroix, Keisuke Kinoshita, Tsubasa Ochiai, Naoyuki Kamo, Reinhold Haeb-Umbach, Yanmin Qian |
| 2021 | Interspeech | Few-Shot Learning of New Sound Classes for Target Sound Extraction. | Marc Delcroix, Jorge Bennasar Vzquez, Tsubasa Ochiai, Keisuke Kinoshita, Shoko Araki |
| 2021 | Interspeech | Continuous Speech Separation Using Speaker Inventory for Long Recording. | Cong Han, Yi Luo, Chenda Li, Tianyan Zhou, Keisuke Kinoshita, Shinji Watanabe, Marc Delcroix, Hakan Erdogan, John R. Hershey, Nima Mesgarani, Zhuo Chen |
| 2021 | Interspeech | Advances in Integration of End-to-End Neural and Clustering-Based Diarization for Real Conversational Speech. | Keisuke Kinoshita, Marc Delcroix, Naohiro Tawara |
| 2021 | Interspeech | Streaming End-to-End Speech Recognition for Hybrid RNN-T/Attention Architecture. | Takafumi Moriya, Tomohiro Tanaka, Takanori Ashihara, Tsubasa Ochiai, Hiroshi Sato, Atsushi Ando, Ryo Masumura, Marc Delcroix, Taichi Asami |
| 2021 | Interspeech | Graph-PIT: Generalized Permutation Invariant Training for Continuous Separation of Arbitrary Numbers of Speakers. | Thilo von Neumann, Keisuke Kinoshita, Christoph Bddeker, Marc Delcroix, Reinhold Haeb-Umbach |
| 2021 | Interspeech | Should We Always Separate?: Switching Between Enhanced and Observed Signals for Overlapping Speech Recognition. | Hiroshi Sato, Tsubasa Ochiai, Marc Delcroix, Keisuke Kinoshita, Takafumi Moriya, Naoyuki Kamo |
| 2021 | Interspeech | PILOT: Introducing Transformers for Probabilistic Sound Event Localization. | Christopher Schymura, Benedikt T. Bnninghoff, Tsubasa Ochiai, Marc Delcroix, Keisuke Kinoshita, Tomohiro Nakatani, Shoko Araki, Dorothea Kolossa |
| 2021 | Interspeech | Auxiliary Loss Function for Target Speech Extraction and Recognition with Weak Supervision Based on Speaker Characteristics. | Katerina Zmolkov, Marc Delcroix, Desh Raj, Shinji Watanabe, Jan Cernock |
| 2020 | ICASSP | Improving Speaker Discrimination of Target Speech Extraction With Time-Domain Speakerbeam. | Marc Delcroix, Tsubasa Ochiai, Katerina Zmolkov, Keisuke Kinoshita, Naohiro Tawara, Tomohiro Nakatani, Shoko Araki |
| 2020 | ICASSP | Tackling Real Noisy Reverberant Meetings with All-Neural Source Separation, Counting, and Diarization System. | Keisuke Kinoshita, Marc Delcroix, Shoko Araki, Tomohiro Nakatani |
| 2020 | ICASSP | Improving Noise Robust Automatic Speech Recognition with Single-Channel Time-Domain Enhancement Network. | Keisuke Kinoshita, Tsubasa Ochiai, Marc Delcroix, Tomohiro Nakatani |
| 2020 | ICASSP | Speech Enhancement Using Self-Adaptation and Multi-Head Self-Attention. | Yuma Koizumi, Kohei Yatabe, Marc Delcroix, Yoshiki Masuyama, Daiki Takeuchi |
| 2020 | ICASSP | DNN-supported Mask-based Convolutional Beamforming for Simultaneous Denoising, Dereverberation, and Source Separation. | Tomohiro Nakatani, Riki Takahashi, Tsubasa Ochiai, Keisuke Kinoshita, Rintaro Ikeshita, Marc Delcroix, Shoko Araki |
| 2020 | ICASSP | End-to-End Training of Time Domain Audio Separation and Recognition. | Thilo von Neumann, Keisuke Kinoshita, Lukas Drude, Christoph Bddeker, Marc Delcroix, Tomohiro Nakatani, Reinhold Haeb-Umbach |
| 2020 | ICASSP | Beam-TasNet: Time-domain Audio Separation Network Meets Frequency-domain Beamformer. | Tsubasa Ochiai, Marc Delcroix, Rintaro Ikeshita, Keisuke Kinoshita, Tomohiro Nakatani, Shoko Araki |
| 2020 | ICASSP | A Dynamic Stream Weight Backprop Kalman Filter for Audiovisual Speaker Tracking. | Christopher Schymura, Tsubasa Ochiai, Marc Delcroix, Keisuke Kinoshita, Tomohiro Nakatani, Shoko Araki, Dorothea Kolossa |
| 2020 | ICASSP | Frame-Level Phoneme-Invariant Speaker Embedding for Text-Independent Speaker Recognition on Extremely Short Utterances. | Naohiro Tawara, Atsunori Ogawa, Tomoharu Iwata, Marc Delcroix, Tetsuji Ogawa |
| 2020 | Interspeech | Multi-Path RNN for Hierarchical Modeling of Long Sequential Data and its Application to Speaker Stream Separation. | Keisuke Kinoshita, Thilo von Neumann, Marc Delcroix, Tomohiro Nakatani, Reinhold Haeb-Umbach |
| 2020 | Interspeech | Self-Distillation for Improving CTC-Transformer-Based ASR Systems. | Takafumi Moriya, Tsubasa Ochiai, Shigeki Karita, Hiroshi Sato, Tomohiro Tanaka, Takanori Ashihara, Ryo Masumura, Yusuke Shinohara, Marc Delcroix |
| 2020 | Interspeech | Multi-Talker ASR for an Unknown Number of Sources: Joint Training of Source Counting, Separation and ASR. | Thilo von Neumann, Christoph Bddeker, Lukas Drude, Keisuke Kinoshita, Marc Delcroix, Tomohiro Nakatani, Reinhold Haeb-Umbach |
| 2020 | Interspeech | Listen to What You Want: Neural Network-Based Universal Sound Selector. | Tsubasa Ochiai, Marc Delcroix, Yuma Koizumi, Hiroaki Ito, Keisuke Kinoshita, Shoko Araki |
| 2020 | Interspeech | Language Model Data Augmentation Based on Text Domain Transfer. | Atsunori Ogawa, Naohiro Tawara, Marc Delcroix |
| 2019 | ICASSP | Estimation of Sampling Frequency Mismatch between Distributed Asynchronous Microphones under Existence of Source Movements with Stationary Time Periods Detection. | Shoko Araki, Nobutaka Ono, Keisuke Kinoshita, Marc Delcroix |
| 2019 | ICASSP | Compact Network for Speakerbeam Target Speaker Extraction. | Marc Delcroix, Katerina Zmolkov, Tsubasa Ochiai, Keisuke Kinoshita, Shoko Araki, Tomohiro Nakatani |
| 2019 | ICASSP | A Unified Framework for Feature-based Domain Adaptation of Neural Network Language Models. | Michael Hentschel, Marc Delcroix, Atsunori Ogawa, Tomoharu Iwata, Tomohiro Nakatani |
| 2019 | ICASSP | Semi-supervised End-to-end Speech Recognition Using Text-to-speech and Autoencoders. | Shigeki Karita, Shinji Watanabe, Tomoharu Iwata, Marc Delcroix, Atsunori Ogawa, Tomohiro Nakatani |
| 2019 | ICASSP | Mask-based MVDR Beamformer for Noisy Multisource Environments: Introduction of Time-varying Spatial Covariance Model. | Yuki Kubo, Tomohiro Nakatani, Marc Delcroix, Keisuke Kinoshita, Shoko Araki |
| 2019 | ICASSP | All-neural Online Source Separation, Counting, and Diarization for Meeting Analysis. | Thilo von Neumann, Keisuke Kinoshita, Marc Delcroix, Shoko Araki, Tomohiro Nakatani, Reinhold Haeb-Umbach |
| 2019 | ICASSP | A Unified Framework for Neural Speech Separation and Extraction. | Tsubasa Ochiai, Marc Delcroix, Keisuke Kinoshita, Atsunori Ogawa, Tomohiro Nakatani |
| 2019 | Interspeech | End-to-End SpeakerBeam for Single Channel Target Speech Recognition. | Marc Delcroix, Shinji Watanabe, Tsubasa Ochiai, Keisuke Kinoshita, Shigeki Karita, Atsunori Ogawa, Tomohiro Nakatani |
| 2019 | Interspeech | Improving Transformer-Based End-to-End Speech Recognition with Connectionist Temporal Classification and Language Model Integration. | Shigeki Karita, Nelson Enrique Yalta Soplin, Shinji Watanabe, Marc Delcroix, Atsunori Ogawa, Tomohiro Nakatani |
| 2019 | Interspeech | Multimodal SpeakerBeam: Single Channel Target Speech Extraction with Audio-Visual Speaker Clues. | Tsubasa Ochiai, Marc Delcroix, Keisuke Kinoshita, Atsunori Ogawa, Tomohiro Nakatani |
| 2019 | Interspeech | Improved Deep Duel Model for Rescoring N-Best Speech Recognition List Using Backward LSTMLM and Ensemble Encoders. | Atsunori Ogawa, Marc Delcroix, Shigeki Karita, Tomohiro Nakatani |
| 2018 | ICASSP | Meeting Recognition with Asynchronous Distributed Microphone Array Using Block-Wise Refinement of Mask-Based MVDR Beamformer. | Shoko Araki, Nobutaka Ono, Keisuke Kinoshita, Marc Delcroix |
| 2018 | ICASSP | Single Channel Target Speaker Extraction and Recognition with Speaker Beam. | Marc Delcroix, Katerina Zmolkov, Keisuke Kinoshita, Atsunori Ogawa, Tomohiro Nakatani |
| 2018 | ICASSP | Sequence Training of Encoder-Decoder Model Using Policy Gradient for End-to-End Speech Recognition. | Shigeki Karita, Atsunori Ogawa, Marc Delcroix, Tomohiro Nakatani |
| 2018 | ICASSP | Listening to Each Speaker One by One with Recurrent Selective Hearing Networks. | Keisuke Kinoshita, Lukas Drude, Marc Delcroix, Tomohiro Nakatani |
| 2018 | ICASSP | Rescoring N-Best Speech Recognition List Based on One-on-One Hypothesis Comparison Using Encoder-Classifier Model. | Atsunori Ogawa, Marc Delcroix, Shigeki Karita, Tomohiro Nakatani |
| 2018 | ICASSP | Optimization of Speaker-Aware Multichannel Speech Extraction with ASR Criterion. | Katerina Zmolkov, Marc Delcroix, Keisuke Kinoshita, Takuya Higuchi, Tomohiro Nakatani, Jan Cernock |
| 2018 | Interspeech | Auxiliary Feature Based Adaptation of End-to-end ASR Systems. | Marc Delcroix, Shinji Watanabe, Atsunori Ogawa, Shigeki Karita, Tomohiro Nakatani |
| 2018 | Interspeech | Integrating Neural Network Based Beamforming and Weighted Prediction Error Dereverberation. | Lukas Drude, Christoph Bddeker, Jahn Heymann, Reinhold Haeb-Umbach, Keisuke Kinoshita, Marc Delcroix, Tomohiro Nakatani |
| 2018 | Interspeech | Semi-Supervised End-to-End Speech Recognition. | Shigeki Karita, Shinji Watanabe, Tomoharu Iwata, Atsunori Ogawa, Marc Delcroix |
| 2018 | Interspeech | Multi-task Learning with Augmentation Strategy for Acoustic-to-word Attention-based Encoder-decoder Speech Recognition. | Takafumi Moriya, Sei Ueno, Yusuke Shinohara, Marc Delcroix, Yoshikazu Yamaguchi, Yushi Aono |
| 2017 | ASRU | Meeting recognition with asynchronous distributed microphone array. | Shoko Araki, Nobutaka Ono, Keisuke Kinoshita, Marc Delcroix |
| 2017 | ASRU | Adversarial training for data-driven speech enhancement without parallel corpus. | Takuya Higuchi, Keisuke Kinoshita, Marc Delcroix, Tomohiro Nakatani |
| 2017 | ASRU | Learning speaker representation for neural network based multichannel speaker extraction. | Katerina Zmolkov, Marc Delcroix, Keisuke Kinoshita, Takuya Higuchi, Atsunori Ogawa, Tomohiro Nakatani |
| 2017 | ICASSP | Online environmental adaptation of CNN-based acoustic models using spatial diffuseness features. | Christian Huemmer, Marc Delcroix, Atsunori Ogawa, Keisuke Kinoshita, Tomohiro Nakatani, Walter Kellermann |
| 2017 | ICASSP | Probabilistic spatial dictionary based online adaptive beamforming for meeting recognition in noisy and reverberant environments. | Nobutaka Ito, Shoko Araki, Marc Delcroix, Tomohiro Nakatani |
| 2017 | ICASSP | Deep mixture density network for statistical model-based feature enhancement. | Keisuke Kinoshita, Marc Delcroix, Atsunori Ogawa, Takuya Higuchi, Tomohiro Nakatani |
| 2017 | ICASSP | Cumulative moving averaged bottleneck speaker vectors for online speaker adaptation of CNN-based acoustic models. | Tsubasa Ochiai, Marc Delcroix, Keisuke Kinoshita, Atsunori Ogawa, Taichi Asami, Shigeru Katagiri, Tomohiro Nakatani |
| 2017 | ICASSP | Feedback connection for deep neural network-based acoustic modeling. | Dung T. Tran, Marc Delcroix, Atsunori Ogawa, Christian Huemmer, Tomohiro Nakatani |
| 2017 | Interspeech | Deep Clustering-Based Beamforming for Separation with Unknown Number of Sources. | Takuya Higuchi, Keisuke Kinoshita, Marc Delcroix, Katerina Zmolkov, Tomohiro Nakatani |
| 2017 | Interspeech | Forward-Backward Convolutional LSTM for Acoustic Modeling. | Shigeki Karita, Atsunori Ogawa, Marc Delcroix, Tomohiro Nakatani |
| 2017 | Interspeech | Neural Network-Based Spectrum Estimation for Online WPE Dereverberation. | Keisuke Kinoshita, Marc Delcroix, Haeyong Kwon, Takuma Mori, Tomohiro Nakatani |
| 2017 | Interspeech | Improved Example-Based Speech Enhancement by Using Deep Neural Network Acoustic Model for Noise Robust Example Search. | Atsunori Ogawa, Keisuke Kinoshita, Marc Delcroix, Tomohiro Nakatani |
| 2017 | Interspeech | Unfolded Deep Recurrent Convolutional Neural Network with Jump Ahead Connections for Acoustic Modeling. | Dung T. Tran, Marc Delcroix, Shigeki Karita, Michael Hentschel, Atsunori Ogawa, Tomohiro Nakatani |
| 2017 | Interspeech | Uncertainty Decoding with Adaptive Sampling for Noise Robust DNN-Based Acoustic Modeling. | Dung T. Tran, Marc Delcroix, Atsunori Ogawa, Tomohiro Nakatani |
| 2017 | Interspeech | Speaker-Aware Neural Network Based Beamformer for Speaker Extraction in Speech Mixtures. | Katerina Zmolkov, Marc Delcroix, Keisuke Kinoshita, Takuya Higuchi, Atsunori Ogawa, Tomohiro Nakatani |
| 2016 | ICASSP | Context adaptive deep neural networks for fast acoustic model adaptation in noisy conditions. | Marc Delcroix, Keisuke Kinoshita, Chengzhu Yu, Atsunori Ogawa, Takuya Yoshioka, Tomohiro Nakatani |
| 2016 | ICASSP | Joint acoustic factor learning for robust deep neural network based automatic speech recognition. | Souvik Kundu, Gautam Mantena, Yanmin Qian, Tian Tan, Marc Delcroix, Khe Chai Sim |
| 2016 | Interspeech | Context Adaptive Neural Network for Rapid Adaptation of Deep CNN Based Acoustic Models. | Marc Delcroix, Keisuke Kinoshita, Atsunori Ogawa, Takuya Yoshioka, Dung T. Tran, Tomohiro Nakatani |
| 2016 | Interspeech | Robust Example Search Using Bottleneck Features for Example-Based Speech Enhancement. | Atsunori Ogawa, Shogo Seki, Keisuke Kinoshita, Marc Delcroix, Takuya Yoshioka, Tomohiro Nakatani, Kazuya Takeda |
| 2016 | Interspeech | Factorized Linear Input Network for Acoustic Model Adaptation in Noisy Conditions. | Dung T. Tran, Marc Delcroix, Atsunori Ogawa, Tomohiro Nakatani |
| 2016 | Interspeech | Data Selection by Sequence Summarizing Neural Network in Mismatch Condition Training. | Katerina Zmolkov, Martin Karafit, Karel Vesel, Marc Delcroix, Shinji Watanabe, Luks Burget, Jan Cernock |
| 2015 | ASRU | The NTT CHiME-3 system: Advances in speech enhancement and recognition for mobile multi-microphone devices. | Takuya Yoshioka, Nobutaka Ito, Marc Delcroix, Atsunori Ogawa, Keisuke Kinoshita, Masakiyo Fujimoto, Chengzhu Yu, Wojciech J. Fabian, Miquel Espi, Takuya Higuchi, Shoko Araki, Tomohiro Nakatani |
| 2015 | ICASSP | Exploring multi-channel features for denoising-autoencoder-based speech enhancement. | Shoko Araki, Tomoki Hayashi, Marc Delcroix, Masakiyo Fujimoto, Kazuya Takeda, Tomohiro Nakatani |
| 2015 | ICASSP | Context adaptive deep neural networks for fast acoustic model adaptation. | Marc Delcroix, Keisuke Kinoshita, Takaaki Hori, Tomohiro Nakatani |
| 2015 | ICASSP | WFST-based structural classification integrating dnn acoustic features and RNN language features for speech recognition. | Quoc Truong Do, Satoshi Nakamura, Marc Delcroix, Takaaki Hori |
| 2015 | Interspeech | Text-informed speech enhancement with deep neural networks. | Keisuke Kinoshita, Marc Delcroix, Atsunori Ogawa, Tomohiro Nakatani |
| 2015 | Interspeech | Robust i-vector extraction for neural network adaptation in noisy environment. | Chengzhu Yu, Atsunori Ogawa, Marc Delcroix, Takuya Yoshioka, Tomohiro Nakatani, John H. L. Hansen |
| 2013 | ICASSP | Unsupervised discriminative adaptation using differenced maximum mutual information based linear regression. | Marc Delcroix, Atsunori Ogawa, Seong-Jun Hahm, Tomohiro Nakatani, Atsushi Nakamura |
| 2013 | ICASSP | Feature space variational Bayesian linear regression and its combination with model space VBLR. | Seong-Jun Hahm, Atsunori Ogawa, Marc Delcroix, Masakiyo Fujimoto, Takaaki Hori, Atsushi Nakamura |
| 2013 | Interspeech | Is speech enhancement pre-processing still relevant when using deep neural networks for acoustic modeling? | Marc Delcroix, Yotaro Kubo, Tomohiro Nakatani, Atsushi Nakamura |
| 2013 | Interspeech | Conditional emission densities for combining speech enhancement and recognition systems. | Armin Sehr, Takuya Yoshioka, Marc Delcroix, Keisuke Kinoshita, Tomohiro Nakatani, Roland Maas, Walter Kellermann |
| 2012 | ICASSP | Discriminative feature transforms using differenced maximum mutual information. | Marc Delcroix, Atsunori Ogawa, Shinji Watanabe, Tomohiro Nakatani, Atsushi Nakamura |
| 2012 | ICASSP | LogMax observation model with MFCC-based spectral prior for reduction of highly nonstationary ambient noise. | Tomohiro Nakatani, Takuya Yoshioka, Shoko Araki, Marc Delcroix, Masakiyo Fujimoto |
| 2012 | Interspeech | Example-based speech enhancement with joint utilization of spatial, spectral & temporal cues of speech and noise. | Keisuke Kinoshita, Marc Delcroix, Mehrez Souden, Tomohiro Nakatani |
| 2011 | Interspeech | Single Channel Dereverberation Using Example-Based Speech Enhancement with Uncertainty Decoding Technique. | Keisuke Kinoshita, Mehrez Souden, Marc Delcroix, Tomohiro Nakatani |
| 2011 | Interspeech | Reduction of Highly Nonstationary Ambient Noise by Integrating Spectral and Locational Characteristics of Speech and Noise for Robust ASR. | Tomohiro Nakatani, Shoko Araki, Marc Delcroix, Takuya Yoshioka, Masakiyo Fujimoto |
| 2011 | Interspeech | A Multichannel Feature-Based Processing for Robust Speech Recognition. | Mehrez Souden, Keisuke Kinoshita, Marc Delcroix, Tomohiro Nakatani |
| 2008 | ICASSP | Combined static and dynamic variance adaptation for efficient interconnection of speech enhancement pre-processor with speech recognizer. | Marc Delcroix, Tomohiro Nakatani, Shinji Watanabe |
| 2008 | ISCAS | Missing feature speech recognition in a meeting situation with maximum SNR beamforming. | Dorothea Kolossa, Shoko Araki, Marc Delcroix, Tomohiro Nakatani, Reinhold Orglmeister, Shoji Makino |
| 2007 | ICASSP | Study on Speech Dereverberation with Autocorrelation Codebook. | Tomohiro Nakatani, Biing-Hwang Juang, Takafumi Hikichi, Takuya Yoshioka, Keisuke Kinoshita, Marc Delcroix, Masato Miyoshi |
| 2007 | Interspeech | Multi-step linear prediction based speech dereverberation in noisy reverberant environment. | Keisuke Kinoshita, Marc Delcroix, Tomohiro Nakatani, Masato Miyoshi |
| 2007 | ISCAS | Robust blind dereverberation of speech signals based on characteristics of short-time speech segments. | Tomohiro Nakatani, Takafumi Hikichi, Keisuke Kinoshita, Takuya Yoshioka, Marc Delcroix, Masato Miyoshi, Biing-Hwang Juang |
| 2006 | ICASSP | On the Use of Lime Dereverberation Algorithm in an Acoustic Environment With a Noise Source. | Marc Delcroix, Takafumi Hikichi, Masato Miyoshi |
| 2005 | ICASSP | Blind Dereverberation based on Estimates of Signal Transmission Channels without Precise Information of Channel Order. | Takafumi Hikichi, Marc Delcroix, Masato Miyoshi |
| 2005 | Interspeech | Improved blind dereverberation performance by using spatial information. | Marc Delcroix, Takafumi Hikichi, Masato Miyoshi |
| 2004 | Interspeech | Dereverberation of speech signals based on linear prediction. | Marc Delcroix, Takafumi Hikichi, Masato Miyoshi |