Skip to content

Naoyuki Kanda

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

64

Venues

8

Active years

2005–2025

Best venue rank

A*

Where they publish

Papers

64 indexed papers, newest first.

YearVenueTitleAuthors
2025InterspeechImproving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios.Aswin Shanmugam Subramanian, Amit Das, Naoyuki Kanda, Jinyu Li, Xiaofei Wang, Yifan Gong
2025InterspeechTS3-Codec: Transformer-Based Simple Streaming Single Codec.Haibin Wu, Naoyuki Kanda, Sefik Emre Eskimez, Jinyu Li
2024ICASSPLeveraging Timestamp Information for Serialized Joint Streaming Recognition and Translation.Sara Papi, Peidong Wang, Jun-Kun Chen, Jian Xue, Naoyuki Kanda, Jinyu Li, Yashesh Gaur
2024ICASSPProfile-Error-Tolerant Target-Speaker Voice Activity Detection.Dongmei Wang, Xiong Xiao, Naoyuki Kanda, Midia Yousefi, Takuya Yoshioka, Jian Wu
2024ICASSPT-SOT FNT: Streaming Multi-Talker ASR with Text-Only Domain Adaptation Capability.Jian Wu, Naoyuki Kanda, Takuya Yoshioka, Rui Zhao, Zhuo Chen, Jinyu Li
2024ICASSPDiarist: Streaming Speech Translation with Speaker Diarization.Mu Yang, Naoyuki Kanda, Xiaofei Wang, Jun-Kun Chen, Peidong Wang, Jian Xue, Jinyu Li, Takuya Yoshioka
2024InterspeechAn Investigation of Noise Robustness for Flow-Matching-Based Zero-Shot TTS.Xiaofei Wang, Sefik Emre Eskimez, Manthan Thakker, Hemin Yang, Zirun Zhu, Min Tang, Yufei Xia, Jinzhu Li, Sheng Zhao, Jinyu Li, Naoyuki Kanda
2024InterspeechTotal-Duration-Aware Duration Modeling for Text-to-Speech Systems.Sefik Emre Eskimez, Xiaofei Wang, Manthan Thakker, Chung-Hsien Tsai, Canrun Li, Zhen Xiao, Hemin Yang, Zirun Zhu, Min Tang, Jinyu Li, Sheng Zhao, Naoyuki Kanda
2024InterspeechNOTSOFAR-1 Challenge: New Datasets, Baseline, and Tasks for Distant Meeting Transcription.Alon Vinnikov, Amir Ivry, Aviv Hurvitz, Igor Abramovski, Sharon Koubi, Ilya Gurvich, Shai Peer, Xiong Xiao, Benjamin Martinez Elizalde, Naoyuki Kanda, Xiaofei Wang, Shalev Shaer, Stav Yagev, Yossi Asher, Sunit Sivasankaran, Yifan Gong, Min Tang, Huaming Wang, Eyal Krupka
2024NAACLi-Code V2: An Autoregressive Generation Framework over Vision, Language, and Speech Data.Ziyi Yang, Mahmoud Khademi, Yichong Xu, Reid Pryzant, Yuwei Fang, Chenguang Zhu, Dongdong Chen, Yao Qian, Xuemei Gao, Yi-Ling Chen, Robert Gmyr, Naoyuki Kanda, Noel Codella, Bin Xiao, Yu Shi, Lu Yuan, Takuya Yoshioka, Michael Zeng, Xuedong Huang
2023AAAIi-Code: An Integrative and Composable Multimodal Learning Framework.Ziyi Yang, Yuwei Fang, Chenguang Zhu, Reid Pryzant, Dongdong Chen, Yu Shi, Yichong Xu, Yao Qian, Mei Gao, Yi-Ling Chen, Liyang Lu, Yujia Xie, Robert Gmyr, Noel Codella, Naoyuki Kanda, Bin Xiao, Lu Yuan, Takuya Yoshioka, Michael Zeng, Xuedong Huang
2023ICASSPSpeech Separation with Large-Scale Self-Supervised Learning.Zhuo Chen, Naoyuki Kanda, Jian Wu, Yu Wu, Xiaofei Wang, Takuya Yoshioka, Jinyu Li, Sunit Sivasankaran, Sefik Emre Eskimez
2023ICASSPSelf-Supervised Learning with Bi-Label Masked Speech Prediction for Streaming Multi-Talker Speech Recognition.Zili Huang, Zhuo Chen, Naoyuki Kanda, Jian Wu, Yiming Wang, Jinyu Li, Takuya Yoshioka, Xiaofei Wang, Peidong Wang
2023ICASSPVararray Meets T-Sot: Advancing the State of the Art of Streaming Distant Conversational Speech Recognition.Naoyuki Kanda, Jian Wu, Xiaofei Wang, Zhuo Chen, Jinyu Li, Takuya Yoshioka
2023ICASSPDATA2VEC-SG: Improving Self-Supervised Learning Representations for Speech Generation Tasks.Heming Wang, Yao Qian, Hemin Yang, Naoyuki Kanda, Peidong Wang, Takuya Yoshioka, Xiaofei Wang, Yiming Wang, Shujie Liu, Zhuo Chen, DeLiang Wang, Michael Zeng
2023ICASSPTarget Speaker Voice Activity Detection with Transformers and Its Integration with End-To-End Neural Diarization.Dongmei Wang, Xiong Xiao, Naoyuki Kanda, Takuya Yoshioka, Jian Wu
2023ICASSPSimulating Realistic Speech Overlaps Improves Multi-Talker ASR.Muqiao Yang, Naoyuki Kanda, Xiaofei Wang, Jian Wu, Sunit Sivasankaran, Zhuo Chen, Jinyu Li, Takuya Yoshioka
2023InterspeechFactual Consistency Oriented Speech Recognition.Naoyuki Kanda, Takuya Yoshioka, Yang Liu
2023InterspeechAdapting Multi-Lingual ASR Models for Handling Multiple Talkers.Chenda Li, Yao Qian, Zhuo Chen, Naoyuki Kanda, Dongmei Wang, Takuya Yoshioka, Yanmin Qian, Michael Zeng
2023InterspeechSpeaker Diarization for ASR Output with T-vectors: A Sequence Classification Approach.Midia Yousefi, Naoyuki Kanda, Dongmei Wang, Zhuo Chen, Xiaofei Wang, Takuya Yoshioka
2022ICASSPTranscribe-to-Diarize: Neural Speaker Diarization for Unlimited Number of Speakers Using End-to-End Speaker-Attributed ASR.Naoyuki Kanda, Xiong Xiao, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Takuya Yoshioka
2022ICASSPVarArray: Array-Geometry-Agnostic Continuous Speech Separation.Takuya Yoshioka, Xiaofei Wang, Dongmei Wang, Min Tang, Zirun Zhu, Zhuo Chen, Naoyuki Kanda
2022ICASSPAll-Neural Beamformer for Continuous Speech Separation.Zhuohuang Zhang, Takuya Yoshioka, Naoyuki Kanda, Zhuo Chen, Xiaofei Wang, Dongmei Wang, Sefik Emre Eskimez
2022InterspeechStreaming Speaker-Attributed ASR with Token-Level Speaker Embeddings.Naoyuki Kanda, Jian Wu, Yu Wu, Xiong Xiao, Zhong Meng, Xiaofei Wang, Yashesh Gaur, Zhuo Chen, Jinyu Li, Takuya Yoshioka
2022InterspeechStreaming Multi-Talker ASR with Token-Level Serialized Output Training.Naoyuki Kanda, Jian Wu, Yu Wu, Xiong Xiao, Zhong Meng, Xiaofei Wang, Yashesh Gaur, Zhuo Chen, Jinyu Li, Takuya Yoshioka
2022InterspeechInternal Language Model Adaptation with Text-Only Data for End-to-End Speech Recognition.Zhong Meng, Yashesh Gaur, Naoyuki Kanda, Jinyu Li, Xie Chen, Yu Wu, Yifan Gong
2022InterspeechLeveraging Real Conversational Data for Multi-Channel Continuous Speech Separation.Xiaofei Wang, Dongmei Wang, Naoyuki Kanda, Sefik Emre Eskimez, Takuya Yoshioka
2022InterspeechSeparating Long-Form Speech with Group-wise Permutation Invariant Training.Wangyou Zhang, Zhuo Chen, Naoyuki Kanda, Shujie Liu, Jinyu Li, Sefik Emre Eskimez, Takuya Yoshioka, Xiong Xiao, Zhong Meng, Yanmin Qian, Furu Wei
2021ASRUA Comparative Study of Modular and Joint Approaches for Speaker-Attributed ASR on Monaural Long-Form Audio.Naoyuki Kanda, Xiong Xiao, Jian Wu, Tianyan Zhou, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Takuya Yoshioka
2021ICASSPHypothesis Stitcher for End-to-End Speaker-Attributed ASR on Long-Form Multi-Talker Recordings.Xuankai Chang, Naoyuki Kanda, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Takuya Yoshioka
2021ICASSPMinimum Bayes Risk Training for End-to-End Speaker-Attributed ASR.Naoyuki Kanda, Zhong Meng, Liang Lu, Yashesh Gaur, Xiaofei Wang, Zhuo Chen, Takuya Yoshioka
2021ICASSPInternal Language Model Training for Domain-Adaptive End-To-End Speech Recognition.Zhong Meng, Naoyuki Kanda, Yashesh Gaur, Sarangarajan Parthasarathy, Eric Sun, Liang Lu, Xie Chen, Jinyu Li, Yifan Gong
2021ICASSPSpeech-Language Pre-Training for End-to-End Spoken Language Understanding.Yao Qian, Ximo Bian, Yu Shi, Naoyuki Kanda, Leo Shen, Zhen Xiao, Michael Zeng
2021ICASSPMicrosoft Speaker Diarization System for the Voxceleb Speaker Recognition Challenge 2020.Xiong Xiao, Naoyuki Kanda, Zhuo Chen, Tianyan Zhou, Takuya Yoshioka, Sanyuan Chen, Yong Zhao, Gang Liu, Yu Wu, Jian Wu, Shujie Liu, Jinyu Li, Yifan Gong
2021InterspeechStreaming Multi-Talker Speech Recognition with Joint Speaker Identification.Liang Lu, Naoyuki Kanda, Jinyu Li, Yifan Gong
2021InterspeechOn Minimum Word Error Rate Training of the Hybrid Autoregressive Transducer.Liang Lu, Zhong Meng, Naoyuki Kanda, Jinyu Li, Yifan Gong
2021InterspeechEnd-to-End Speaker-Attributed ASR with Transformer.Naoyuki Kanda, Guoli Ye, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Takuya Yoshioka
2021InterspeechLarge-Scale Pre-Training of End-to-End Multi-Talker ASR for Meeting Transcription with Single Distant Microphone.Naoyuki Kanda, Guoli Ye, Yu Wu, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Takuya Yoshioka
2021InterspeechMinimum Word Error Rate Training with Language Model Fusion for End-to-End Speech Recognition.Zhong Meng, Yu Wu, Naoyuki Kanda, Liang Lu, Xie Chen, Guoli Ye, Eric Sun, Jinyu Li, Yifan Gong
2021InterspeechInvestigation of Practical Aspects of Single Channel Speech Separation for ASR.Jian Wu, Zhuo Chen, Sanyuan Chen, Yu Wu, Takuya Yoshioka, Naoyuki Kanda, Shujie Liu, Jinyu Li
2020InterspeechJoint Speaker Counting, Speech Recognition, and Speaker Identification for Overlapped Speech of any Number of Speakers.Naoyuki Kanda, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Tianyan Zhou, Takuya Yoshioka
2020InterspeechSerialized Output Training for End-to-End Overlapped Speech Recognition.Naoyuki Kanda, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Takuya Yoshioka
2019ASRUEnd-to-End Neural Speaker Diarization with Self-Attention.Yusuke Fujita, Naoyuki Kanda, Shota Horiguchi, Yawen Xue, Kenji Nagamatsu, Shinji Watanabe
2019ASRUSimultaneous Speech Recognition and Speaker Diarization for Monaural Dialogue Recordings with Target-Speaker Acoustic Models.Naoyuki Kanda, Shota Horiguchi, Yusuke Fujita, Yawen Xue, Kenji Nagamatsu, Shinji Watanabe
2019ICASSPAcoustic Modeling for Distant Multi-talker Speech Recognition with Single- and Multi-channel Branches.Naoyuki Kanda, Yusuke Fujita, Shota Horiguchi, Rintaro Ikeshita, Kenji Nagamatsu, Shinji Watanabe
2019InterspeechEnd-to-End Neural Speaker Diarization with Permutation-Free Objectives.Yusuke Fujita, Naoyuki Kanda, Shota Horiguchi, Kenji Nagamatsu, Shinji Watanabe
2019InterspeechMultimodal Response Obligation Detection with Unsupervised Online Domain Adaptation.Shota Horiguchi, Naoyuki Kanda, Kenji Nagamatsu
2019InterspeechGuided Source Separation Meets a Strong ASR Backend: Hitachi/Paderborn University Joint Investigation for Dinner Party ASR.Naoyuki Kanda, Christoph Bddeker, Jens Heitkaemper, Yusuke Fujita, Shota Horiguchi, Kenji Nagamatsu, Reinhold Haeb-Umbach
2019InterspeechAuxiliary Interference Speaker Loss for Target-Speaker Speech Recognition.Naoyuki Kanda, Shota Horiguchi, Ryoichi Takashima, Yusuke Fujita, Kenji Nagamatsu, Shinji Watanabe
2018ICASSPSequence Distillation for Purely Sequence Trained Acoustic Models.Naoyuki Kanda, Yusuke Fujita, Kenji Nagamatsu
2018InterspeechLattice-free State-level Minimum Bayes Risk Training of Acoustic Models.Naoyuki Kanda, Yusuke Fujita, Kenji Nagamatsu
2017ASRUInvestigation of lattice-free maximum mutual information-based acoustic models with sequence-level Kullback-Leibler divergence.Naoyuki Kanda, Yusuke Fujita, Kenji Nagamatsu
2017ICASSPMinimum Bayes risk training of CTC acoustic models in maximum a posteriori based decoding framework.Naoyuki Kanda, Xugang Lu, Hisashi Kawai
2016InterspeechInvestigation of Semi-Supervised Acoustic Model Training Based on the Committee of Heterogeneous Neural Networks.Naoyuki Kanda, Shoji Harada, Xugang Lu, Hisashi Kawai
2016InterspeechMaximum a posteriori Based Decoding for CTC Acoustic Models.Naoyuki Kanda, Xugang Lu, Hisashi Kawai
2015ASRUTraining data pseudo-shuffling and direct decoding framework for recurrent neural network based acoustic modeling.Naoyuki Kanda, Mitsuyoshi Tachimori, Xugang Lu, Hisashi Kawai
2014InterspeechBoundary contraction training for acoustic models based on discrete deep neural networks.Ryu Takeda, Naoyuki Kanda, Nobuo Nukaga
2013ASRUElastic spectral distortion for low resource speech recognition with deep neural networks.Naoyuki Kanda, Ryu Takeda, Yasunari Obuchi
2013ICASSPMultiple index combination for Japanese spoken term detection with optimum index selection based on OOV-region classifier.Naoyuki Kanda, Katsutoshi Itoyama, Hiroshi G. Okuno
2013InterspeechNoise robust speaker verification with delta cepstrum normalization.Naoyuki Kanda, Ryu Takeda, Yasunari Obuchi
2008MMSPOpen-vocabulary keyword detection from super-large scale speech database.Naoyuki Kanda, Hirohiko Sagawa, Takashi Sumiyoshi, Yasunari Obuchi
2006SIGdialMulti-Domain Spoken Dialogue System with Extensibility and Robustness against Speech Recognition Errors.Kazunori Komatani, Naoyuki Kanda, Mikio Nakano, Kazuhiro Nakadai, Hiroshi Tsujino, Tetsuya Ogata, Hiroshi G. Okuno
2005InterspeechContextual constraints based on dialogue models in database search task for spoken dialogue systems.Kazunori Komatani, Naoyuki Kanda, Tetsuya Ogata, Hiroshi G. Okuno
2005IROSA two-layer model for behavior and dialogue planning in conversational service robots.Mikio Nakano, Yuji Hasegawa, Kazuhiro Nakadai, Takahiro Nakamura, Johane Takeuchi, Toyotaka Torii, Hiroshi Tsujino, Naoyuki Kanda, Hiroshi G. Okuno