Naoyuki Kanda
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
64
Venues
8
Active years
2005–2025
Best venue rank
A*
Where they publish
Papers
64 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2025 | Interspeech | Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios. | Aswin Shanmugam Subramanian, Amit Das, Naoyuki Kanda, Jinyu Li, Xiaofei Wang, Yifan Gong |
| 2025 | Interspeech | TS3-Codec: Transformer-Based Simple Streaming Single Codec. | Haibin Wu, Naoyuki Kanda, Sefik Emre Eskimez, Jinyu Li |
| 2024 | ICASSP | Leveraging Timestamp Information for Serialized Joint Streaming Recognition and Translation. | Sara Papi, Peidong Wang, Jun-Kun Chen, Jian Xue, Naoyuki Kanda, Jinyu Li, Yashesh Gaur |
| 2024 | ICASSP | Profile-Error-Tolerant Target-Speaker Voice Activity Detection. | Dongmei Wang, Xiong Xiao, Naoyuki Kanda, Midia Yousefi, Takuya Yoshioka, Jian Wu |
| 2024 | ICASSP | T-SOT FNT: Streaming Multi-Talker ASR with Text-Only Domain Adaptation Capability. | Jian Wu, Naoyuki Kanda, Takuya Yoshioka, Rui Zhao, Zhuo Chen, Jinyu Li |
| 2024 | ICASSP | Diarist: Streaming Speech Translation with Speaker Diarization. | Mu Yang, Naoyuki Kanda, Xiaofei Wang, Jun-Kun Chen, Peidong Wang, Jian Xue, Jinyu Li, Takuya Yoshioka |
| 2024 | Interspeech | An Investigation of Noise Robustness for Flow-Matching-Based Zero-Shot TTS. | Xiaofei Wang, Sefik Emre Eskimez, Manthan Thakker, Hemin Yang, Zirun Zhu, Min Tang, Yufei Xia, Jinzhu Li, Sheng Zhao, Jinyu Li, Naoyuki Kanda |
| 2024 | Interspeech | Total-Duration-Aware Duration Modeling for Text-to-Speech Systems. | Sefik Emre Eskimez, Xiaofei Wang, Manthan Thakker, Chung-Hsien Tsai, Canrun Li, Zhen Xiao, Hemin Yang, Zirun Zhu, Min Tang, Jinyu Li, Sheng Zhao, Naoyuki Kanda |
| 2024 | Interspeech | NOTSOFAR-1 Challenge: New Datasets, Baseline, and Tasks for Distant Meeting Transcription. | Alon Vinnikov, Amir Ivry, Aviv Hurvitz, Igor Abramovski, Sharon Koubi, Ilya Gurvich, Shai Peer, Xiong Xiao, Benjamin Martinez Elizalde, Naoyuki Kanda, Xiaofei Wang, Shalev Shaer, Stav Yagev, Yossi Asher, Sunit Sivasankaran, Yifan Gong, Min Tang, Huaming Wang, Eyal Krupka |
| 2024 | NAACL | i-Code V2: An Autoregressive Generation Framework over Vision, Language, and Speech Data. | Ziyi Yang, Mahmoud Khademi, Yichong Xu, Reid Pryzant, Yuwei Fang, Chenguang Zhu, Dongdong Chen, Yao Qian, Xuemei Gao, Yi-Ling Chen, Robert Gmyr, Naoyuki Kanda, Noel Codella, Bin Xiao, Yu Shi, Lu Yuan, Takuya Yoshioka, Michael Zeng, Xuedong Huang |
| 2023 | AAAI | i-Code: An Integrative and Composable Multimodal Learning Framework. | Ziyi Yang, Yuwei Fang, Chenguang Zhu, Reid Pryzant, Dongdong Chen, Yu Shi, Yichong Xu, Yao Qian, Mei Gao, Yi-Ling Chen, Liyang Lu, Yujia Xie, Robert Gmyr, Noel Codella, Naoyuki Kanda, Bin Xiao, Lu Yuan, Takuya Yoshioka, Michael Zeng, Xuedong Huang |
| 2023 | ICASSP | Speech Separation with Large-Scale Self-Supervised Learning. | Zhuo Chen, Naoyuki Kanda, Jian Wu, Yu Wu, Xiaofei Wang, Takuya Yoshioka, Jinyu Li, Sunit Sivasankaran, Sefik Emre Eskimez |
| 2023 | ICASSP | Self-Supervised Learning with Bi-Label Masked Speech Prediction for Streaming Multi-Talker Speech Recognition. | Zili Huang, Zhuo Chen, Naoyuki Kanda, Jian Wu, Yiming Wang, Jinyu Li, Takuya Yoshioka, Xiaofei Wang, Peidong Wang |
| 2023 | ICASSP | Vararray Meets T-Sot: Advancing the State of the Art of Streaming Distant Conversational Speech Recognition. | Naoyuki Kanda, Jian Wu, Xiaofei Wang, Zhuo Chen, Jinyu Li, Takuya Yoshioka |
| 2023 | ICASSP | DATA2VEC-SG: Improving Self-Supervised Learning Representations for Speech Generation Tasks. | Heming Wang, Yao Qian, Hemin Yang, Naoyuki Kanda, Peidong Wang, Takuya Yoshioka, Xiaofei Wang, Yiming Wang, Shujie Liu, Zhuo Chen, DeLiang Wang, Michael Zeng |
| 2023 | ICASSP | Target Speaker Voice Activity Detection with Transformers and Its Integration with End-To-End Neural Diarization. | Dongmei Wang, Xiong Xiao, Naoyuki Kanda, Takuya Yoshioka, Jian Wu |
| 2023 | ICASSP | Simulating Realistic Speech Overlaps Improves Multi-Talker ASR. | Muqiao Yang, Naoyuki Kanda, Xiaofei Wang, Jian Wu, Sunit Sivasankaran, Zhuo Chen, Jinyu Li, Takuya Yoshioka |
| 2023 | Interspeech | Factual Consistency Oriented Speech Recognition. | Naoyuki Kanda, Takuya Yoshioka, Yang Liu |
| 2023 | Interspeech | Adapting Multi-Lingual ASR Models for Handling Multiple Talkers. | Chenda Li, Yao Qian, Zhuo Chen, Naoyuki Kanda, Dongmei Wang, Takuya Yoshioka, Yanmin Qian, Michael Zeng |
| 2023 | Interspeech | Speaker Diarization for ASR Output with T-vectors: A Sequence Classification Approach. | Midia Yousefi, Naoyuki Kanda, Dongmei Wang, Zhuo Chen, Xiaofei Wang, Takuya Yoshioka |
| 2022 | ICASSP | Transcribe-to-Diarize: Neural Speaker Diarization for Unlimited Number of Speakers Using End-to-End Speaker-Attributed ASR. | Naoyuki Kanda, Xiong Xiao, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Takuya Yoshioka |
| 2022 | ICASSP | VarArray: Array-Geometry-Agnostic Continuous Speech Separation. | Takuya Yoshioka, Xiaofei Wang, Dongmei Wang, Min Tang, Zirun Zhu, Zhuo Chen, Naoyuki Kanda |
| 2022 | ICASSP | All-Neural Beamformer for Continuous Speech Separation. | Zhuohuang Zhang, Takuya Yoshioka, Naoyuki Kanda, Zhuo Chen, Xiaofei Wang, Dongmei Wang, Sefik Emre Eskimez |
| 2022 | Interspeech | Streaming Speaker-Attributed ASR with Token-Level Speaker Embeddings. | Naoyuki Kanda, Jian Wu, Yu Wu, Xiong Xiao, Zhong Meng, Xiaofei Wang, Yashesh Gaur, Zhuo Chen, Jinyu Li, Takuya Yoshioka |
| 2022 | Interspeech | Streaming Multi-Talker ASR with Token-Level Serialized Output Training. | Naoyuki Kanda, Jian Wu, Yu Wu, Xiong Xiao, Zhong Meng, Xiaofei Wang, Yashesh Gaur, Zhuo Chen, Jinyu Li, Takuya Yoshioka |
| 2022 | Interspeech | Internal Language Model Adaptation with Text-Only Data for End-to-End Speech Recognition. | Zhong Meng, Yashesh Gaur, Naoyuki Kanda, Jinyu Li, Xie Chen, Yu Wu, Yifan Gong |
| 2022 | Interspeech | Leveraging Real Conversational Data for Multi-Channel Continuous Speech Separation. | Xiaofei Wang, Dongmei Wang, Naoyuki Kanda, Sefik Emre Eskimez, Takuya Yoshioka |
| 2022 | Interspeech | Separating Long-Form Speech with Group-wise Permutation Invariant Training. | Wangyou Zhang, Zhuo Chen, Naoyuki Kanda, Shujie Liu, Jinyu Li, Sefik Emre Eskimez, Takuya Yoshioka, Xiong Xiao, Zhong Meng, Yanmin Qian, Furu Wei |
| 2021 | ASRU | A Comparative Study of Modular and Joint Approaches for Speaker-Attributed ASR on Monaural Long-Form Audio. | Naoyuki Kanda, Xiong Xiao, Jian Wu, Tianyan Zhou, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Takuya Yoshioka |
| 2021 | ICASSP | Hypothesis Stitcher for End-to-End Speaker-Attributed ASR on Long-Form Multi-Talker Recordings. | Xuankai Chang, Naoyuki Kanda, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Takuya Yoshioka |
| 2021 | ICASSP | Minimum Bayes Risk Training for End-to-End Speaker-Attributed ASR. | Naoyuki Kanda, Zhong Meng, Liang Lu, Yashesh Gaur, Xiaofei Wang, Zhuo Chen, Takuya Yoshioka |
| 2021 | ICASSP | Internal Language Model Training for Domain-Adaptive End-To-End Speech Recognition. | Zhong Meng, Naoyuki Kanda, Yashesh Gaur, Sarangarajan Parthasarathy, Eric Sun, Liang Lu, Xie Chen, Jinyu Li, Yifan Gong |
| 2021 | ICASSP | Speech-Language Pre-Training for End-to-End Spoken Language Understanding. | Yao Qian, Ximo Bian, Yu Shi, Naoyuki Kanda, Leo Shen, Zhen Xiao, Michael Zeng |
| 2021 | ICASSP | Microsoft Speaker Diarization System for the Voxceleb Speaker Recognition Challenge 2020. | Xiong Xiao, Naoyuki Kanda, Zhuo Chen, Tianyan Zhou, Takuya Yoshioka, Sanyuan Chen, Yong Zhao, Gang Liu, Yu Wu, Jian Wu, Shujie Liu, Jinyu Li, Yifan Gong |
| 2021 | Interspeech | Streaming Multi-Talker Speech Recognition with Joint Speaker Identification. | Liang Lu, Naoyuki Kanda, Jinyu Li, Yifan Gong |
| 2021 | Interspeech | On Minimum Word Error Rate Training of the Hybrid Autoregressive Transducer. | Liang Lu, Zhong Meng, Naoyuki Kanda, Jinyu Li, Yifan Gong |
| 2021 | Interspeech | End-to-End Speaker-Attributed ASR with Transformer. | Naoyuki Kanda, Guoli Ye, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Takuya Yoshioka |
| 2021 | Interspeech | Large-Scale Pre-Training of End-to-End Multi-Talker ASR for Meeting Transcription with Single Distant Microphone. | Naoyuki Kanda, Guoli Ye, Yu Wu, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Takuya Yoshioka |
| 2021 | Interspeech | Minimum Word Error Rate Training with Language Model Fusion for End-to-End Speech Recognition. | Zhong Meng, Yu Wu, Naoyuki Kanda, Liang Lu, Xie Chen, Guoli Ye, Eric Sun, Jinyu Li, Yifan Gong |
| 2021 | Interspeech | Investigation of Practical Aspects of Single Channel Speech Separation for ASR. | Jian Wu, Zhuo Chen, Sanyuan Chen, Yu Wu, Takuya Yoshioka, Naoyuki Kanda, Shujie Liu, Jinyu Li |
| 2020 | Interspeech | Joint Speaker Counting, Speech Recognition, and Speaker Identification for Overlapped Speech of any Number of Speakers. | Naoyuki Kanda, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Tianyan Zhou, Takuya Yoshioka |
| 2020 | Interspeech | Serialized Output Training for End-to-End Overlapped Speech Recognition. | Naoyuki Kanda, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Takuya Yoshioka |
| 2019 | ASRU | End-to-End Neural Speaker Diarization with Self-Attention. | Yusuke Fujita, Naoyuki Kanda, Shota Horiguchi, Yawen Xue, Kenji Nagamatsu, Shinji Watanabe |
| 2019 | ASRU | Simultaneous Speech Recognition and Speaker Diarization for Monaural Dialogue Recordings with Target-Speaker Acoustic Models. | Naoyuki Kanda, Shota Horiguchi, Yusuke Fujita, Yawen Xue, Kenji Nagamatsu, Shinji Watanabe |
| 2019 | ICASSP | Acoustic Modeling for Distant Multi-talker Speech Recognition with Single- and Multi-channel Branches. | Naoyuki Kanda, Yusuke Fujita, Shota Horiguchi, Rintaro Ikeshita, Kenji Nagamatsu, Shinji Watanabe |
| 2019 | Interspeech | End-to-End Neural Speaker Diarization with Permutation-Free Objectives. | Yusuke Fujita, Naoyuki Kanda, Shota Horiguchi, Kenji Nagamatsu, Shinji Watanabe |
| 2019 | Interspeech | Multimodal Response Obligation Detection with Unsupervised Online Domain Adaptation. | Shota Horiguchi, Naoyuki Kanda, Kenji Nagamatsu |
| 2019 | Interspeech | Guided Source Separation Meets a Strong ASR Backend: Hitachi/Paderborn University Joint Investigation for Dinner Party ASR. | Naoyuki Kanda, Christoph Bddeker, Jens Heitkaemper, Yusuke Fujita, Shota Horiguchi, Kenji Nagamatsu, Reinhold Haeb-Umbach |
| 2019 | Interspeech | Auxiliary Interference Speaker Loss for Target-Speaker Speech Recognition. | Naoyuki Kanda, Shota Horiguchi, Ryoichi Takashima, Yusuke Fujita, Kenji Nagamatsu, Shinji Watanabe |
| 2018 | ICASSP | Sequence Distillation for Purely Sequence Trained Acoustic Models. | Naoyuki Kanda, Yusuke Fujita, Kenji Nagamatsu |
| 2018 | Interspeech | Lattice-free State-level Minimum Bayes Risk Training of Acoustic Models. | Naoyuki Kanda, Yusuke Fujita, Kenji Nagamatsu |
| 2017 | ASRU | Investigation of lattice-free maximum mutual information-based acoustic models with sequence-level Kullback-Leibler divergence. | Naoyuki Kanda, Yusuke Fujita, Kenji Nagamatsu |
| 2017 | ICASSP | Minimum Bayes risk training of CTC acoustic models in maximum a posteriori based decoding framework. | Naoyuki Kanda, Xugang Lu, Hisashi Kawai |
| 2016 | Interspeech | Investigation of Semi-Supervised Acoustic Model Training Based on the Committee of Heterogeneous Neural Networks. | Naoyuki Kanda, Shoji Harada, Xugang Lu, Hisashi Kawai |
| 2016 | Interspeech | Maximum a posteriori Based Decoding for CTC Acoustic Models. | Naoyuki Kanda, Xugang Lu, Hisashi Kawai |
| 2015 | ASRU | Training data pseudo-shuffling and direct decoding framework for recurrent neural network based acoustic modeling. | Naoyuki Kanda, Mitsuyoshi Tachimori, Xugang Lu, Hisashi Kawai |
| 2014 | Interspeech | Boundary contraction training for acoustic models based on discrete deep neural networks. | Ryu Takeda, Naoyuki Kanda, Nobuo Nukaga |
| 2013 | ASRU | Elastic spectral distortion for low resource speech recognition with deep neural networks. | Naoyuki Kanda, Ryu Takeda, Yasunari Obuchi |
| 2013 | ICASSP | Multiple index combination for Japanese spoken term detection with optimum index selection based on OOV-region classifier. | Naoyuki Kanda, Katsutoshi Itoyama, Hiroshi G. Okuno |
| 2013 | Interspeech | Noise robust speaker verification with delta cepstrum normalization. | Naoyuki Kanda, Ryu Takeda, Yasunari Obuchi |
| 2008 | MMSP | Open-vocabulary keyword detection from super-large scale speech database. | Naoyuki Kanda, Hirohiko Sagawa, Takashi Sumiyoshi, Yasunari Obuchi |
| 2006 | SIGdial | Multi-Domain Spoken Dialogue System with Extensibility and Robustness against Speech Recognition Errors. | Kazunori Komatani, Naoyuki Kanda, Mikio Nakano, Kazuhiro Nakadai, Hiroshi Tsujino, Tetsuya Ogata, Hiroshi G. Okuno |
| 2005 | Interspeech | Contextual constraints based on dialogue models in database search task for spoken dialogue systems. | Kazunori Komatani, Naoyuki Kanda, Tetsuya Ogata, Hiroshi G. Okuno |
| 2005 | IROS | A two-layer model for behavior and dialogue planning in conversational service robots. | Mikio Nakano, Yuji Hasegawa, Kazuhiro Nakadai, Takahiro Nakamura, Johane Takeuchi, Toyotaka Torii, Hiroshi Tsujino, Naoyuki Kanda, Hiroshi G. Okuno |