Skip to content

Shinji Watanabe

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

445

Venues

14

Active years

1995–2026

Best venue rank

A*

Where they publish

Papers

Showing the 300 most recent indexed papers.

YearVenueTitleAuthors
2026ACLOptimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback.Siddhant Arora, Jinchuan Tian, Jiatong Shi, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe
2026ACLPRiSM: Benchmarking Phone Realization in Speech Models.Shikhar Bharadwaj, Chin-Jou Li, Yoonjae Kim, Kwanghee Choi, Eunjung Yeo, Ryan Soh-Eun Shim, Hanyu Zhou, Brendon Boldt, Karen Rosero, Kalvin Chang, Darsh Agrawal, Keer Xu, Chao-Han Huck Yang, Jian Zhu, Shinji Watanabe, David R. Mortensen
2026ACLPOWSM: A Phonetic Open Whisper-Style Speech Foundation Model.Chin-Jou Li, Kalvin Chang, Shikhar Bharadwaj, Eunjung Yeo, Kwanghee Choi, Jian Zhu, David R. Mortensen, Shinji Watanabe
2026ACLFull-Duplex-Bench-v2: A Multi-Turn Evaluation Framework for Duplex Dialogue Systems with an Automated Examiner.Guan-Ting Lin, Shih-Yun Shan Kuan, Jiatong Shi, Kai-Wei Chang, Siddhant Arora, Shinji Watanabe, Hung-Yi Lee
2026ACLPlanRAG-Audio: Planning and Retrieval Augmented Generation for Long-form Audio Understanding.Masao Someki, Chien-Yu Huang, Siddhant Arora, Samuele Cornell, Markus Mller, Nathan Susanj, Rupak Vignesh Swaminathan, Grant P. Strimel, Jing Liu, Shinji Watanabe
2026ACLSpeech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception.Zhen Wan, Chao-Han Huck Yang, Jinchuan Tian, Hanrong Ye, Ankita Pasad, Szu-Wei Fu, Arushi Goel, Ryo Hachiuma, Shizhe Diao, Kunal Dhawan, Sreyan Ghosh, Yusuke Hirota, Zhehuai Chen, Rafael Valle, Chenhui Chu, Shinji Watanabe, Boris Ginsburg, Yu-Chiang Frank Wang
2026EACLCSPB: Conversational Speech Processing Benchmark for Self-supervised Speech Models.Zili Huang, Matthew Maciejewski, Leibny Paola Garca-Perera, Shinji Watanabe, Sanjeev Khudanpur
2026EACLBSCodec: A Band-Split Neural Codec for High-Quality Universal Audio Reconstruction.Haoran Wang, Jiatong Shi, Jinchuan Tian, Bohan Li, Kai Yu, Shinji Watanabe
2025AAAIEnhancing Audiovisual Speech Recognition Through Bifocal Preference Optimization.Yihan Wu, Yichen Lu, Yifan Peng, Xihua Wang, Ruihua Song, Shinji Watanabe
2025ACLSpeechIQ: Speech-Agentic Intelligence Quotient Across Cognitive Levels in Voice Understanding by Large Language Models.Zhen Wan, Chao-Han Huck Yang, Yahan Yu, Jinchuan Tian, Sheng Li, Ke Hu, Zhehuai Chen, Shinji Watanabe, Fei Cheng, Chenhui Chu, Sadao Kurohashi
2025ASRULess is More: Data Curation Matters in Scaling Speech Enhancement.Chenda Li, Wangyou Zhang, Wei Wang, Robin Scheibler, Kohei Saijo, Samuele Cornell, Yihui Fu, Marvin Sach, Zhaoheng Ni, Anurag Kumar, Tim Fingscheidt, Shinji Watanabe, Yanmin Qian
2025ASRUAURA: Agent for Understanding, Reasoning, and Automated Tool Use in Voice-Driven Tasks.Leander Melroy Maben, Gayathri Ganesh Lakshmy, Srijith Radhakrishnan, Siddhant Arora, Shinji Watanabe
2025ASRUEvaluating Self-Supervised Speech Models Via Text-Based LLMs.Takashi Maekaku, Keita Goto, Jinchuan Tian, Yusuke Shinohara, Shinji Watanabe
2025ASRUUnifying Diarization, Separation, and ASR with Multi-Speaker Encoder.Muhammad Shakeel, Yui Sudo, Yifan Peng, Chyi-Jiunn Lin, Shinji Watanabe
2025ASRUVERSA-v2: A Modular and Scalable Toolkit for Speech and Audio Evaluation with Expanded Metrics, Visualization, and LLM Integration.Jiatong Shi, Bo-Hao Su, Shikhar Bharadwaj, Yiwen Zhao, Shih-Heng Wang, Jionghao Hang, Haoran Wang, Wei Wang, Wenhao Feng, Yuxun Tang, Nezih Topaloglu, Siddhant Arora, Jinchuan Tian, William Chen, Hye-jin Shim, Wangyou Zhang, Wen-Chin Huang, Shinji Watanabe
2025ASRUPURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning.Jiatong Shi, Haoran Wang, William Chen, Chenda Li, Wangyou Zhang, Jinchuan Tian, Shinji Watanabe
2025ASRUContinual Pre-training for Codec-Based Speech LLMs: Balancing Understanding and Generation.Jiatong Shi, Chunlei Zhang, Jinchuan Tian, Junrui Ni, Hao Zhang, Shinji Watanabe, Dong Yu
2025ASRUSpiralformer: Low Latency Encoder for Streaming Speech Recognition with Circular Layer Skipping and Early Exiting.Emiru Tsunoo, Hayato Futami, Yosuke Kashiwagi, Siddhant Arora, Shinji Watanabe
2025ASRUStreaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training.Sathvik Udupa, Shinji Watanabe, Petr Schwarz, Jan Cernock
2025ASRUURGENT-PK: Perceptually-Aligned Ranking Model Designed for Speech Enhancement Competition.Jiahe Wang, Chenda Li, Wei Wang, Wangyou Zhang, Samuele Cornell, Marvin Sach, Robin Scheibler, Kohei Saijo, Yihui Fu, Zhaoheng Ni, Anurag Kumar, Tim Fingscheidt, Shinji Watanabe, Yanmin Qian
2025ASRUGeolocation-Aware Robust Spoken Language Identification.Qingzheng Wang, Hye-Jin Shim, Jiancheng Sun, Shinji Watanabe
2025ASRUSSVD: Structured SVD for Parameter-Efficient Fine-Tuning and Benchmarking under Domain Shift in ASR.Pu Wang, Shinji Watanabe, Hugo Van hamme
2025ASRUImproving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment.Wei Wang, Wangyou Zhang, Chenda Li, Jaitong Shi, Shinji Watanabe, Yanmin Qian
2025ASRURobust Training of Singing Voice Synthesis Using Prior and Posterior Uncertainty.Yiwen Zhao, Jiatong Shi, Yuxun Tang, William Chen, Shinji Watanabe
2025EMNLPSummarizing Speech: A Comprehensive Survey.Fabian Retkowski, Maike Zfle, Andreas Sudmann, Dinah Pfau, Shinji Watanabe, Jan Niehues, Alexander Waibel
2025ICASSPSpeaker-IPL: Unsupervised Learning of Speaker Characteristics with i-Vector based Pseudo-Labels.Zakaria Aldeneh, Takuya Higuchi, Jee-Weon Jung, Li-Wei Chen, Stephen Shum, Ahmed Hussen Abdelaziz, Shinji Watanabe, Tatiana Likhomanenko, Barry-John Theobald
2025ICASSPInvestigation of Spatial Self-Supervised Learning and Its Application to Target Speaker Speech Recognition.Yoshiaki Bando, Samuele Cornell, Satoru Fukayama, Shinji Watanabe
2025ICASSPExploring Prediction Targets in Masked Pre-Training for Speech Foundation Models.Li-Wei Chen, Takuya Higuchi, He Bai, Ahmed Hussen Abdelaziz, Shinji Watanabe, Alexander Rudnicky, Tatiana Likhomanenko, Barry-John Theobald, Zakaria Aldeneh
2025ICASSPBridging Speech and Text Foundation Models with ReShape Attention.Takatomo Kano, Atsunori Ogawa, Marc Delcroix, William Chen, Ryo Fukuda, Kohei Matsuura, Takanori Ashihara, Shinji Watanabe
2025ICASSPHypothesis Clustering and Merging: Novel MultiTalker Speech Recognition with Speaker Tokens.Yosuke Kashiwagi, Hayato Futami, Emiru Tsunoo, Siddhant Arora, Shinji Watanabe
2025ICASSPDiscrete Speech Unit Extraction via Independent Component Analysis.Tomohiko Nakamura, Kwanghee Choi, Keigo Hojo, Yoshiaki Bando, Satoru Fukayama, Shinji Watanabe
2025ICASSPLIMMITS'25: Multilingual Streaming TTS With Neural Codecs for Indian Languages.Philipp Olbrich, Hema A. Murthy, Pranaw Kumar, Shinji Watanabe, Sheng Zhao, Mark Hasegawa-Johnson
2025ICASSPPreference Alignment Improves Language Model-Based TTS.Jinchuan Tian, Chunlei Zhang, Jiatong Shi, Hao Zhang, Jianwei Yu, Shinji Watanabe, Dong Yu
2025ICASSPImproving Multilingual ASR in the Wild Using Simple N-best Re-ranking.Brian Yan, Vineel Pratap, Shinji Watanabe, Michael Auli
2025ICLRTalking Turns: Benchmarking Audio Foundation Models on Turn-Taking Dynamics.Siddhant Arora, Zhiyun Lu, Chung-Cheng Chiu, Ruoming Pang, Shinji Watanabe
2025ICLRContext-aware Dynamic Pruning for Speech Foundation Models.Masao Someki, Yifan Peng, Siddhant Arora, Markus Mller, Athanasios Mouchtaris, Grant P. Strimel, Jing Liu, Shinji Watanabe
2025ICMLOWLS: Scaling Laws for Multilingual Speech Recognition and Translation Models.William Chen, Jinchuan Tian, Yifan Peng, Brian Yan, Chao-Han Huck Yang, Shinji Watanabe
2025InterspeechOWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning.Yifan Peng, Muhammad Shakeel, Yui Sudo, William Chen, Jinchuan Tian, Chyi-Jiunn Lin, Shinji Watanabe
2025InterspeechChain-of-Thought Training for Open E2E Spoken Dialogue Systems.Siddhant Arora, Jinchuan Tian, Hayato Futami, Jee-weon Jung, Jiatong Shi, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe
2025InterspeechExploring Linear Variant Transformers and k-NN Memory Inference for Long-Form ASR.Carlos Carvalho, Jinchuan Tian, William Chen, Yifan Peng, Alberto Abad, Shinji Watanabe
2025InterspeechThe ML-SUPERB 2.0 Challenge: Towards Inclusive ASR Benchmarking for All Language Varieties.William Chen, Chutong Meng, Jiatong Shi, Martijn Bartelds, Shih-Heng Wang, Hsiu-Hsuan Wang, Rafael Mosquera, Sara Hincapie, Dan Jurafsky, Antonis Anastasopoulos, Hung-yi Lee, Karen Livescu, Shinji Watanabe
2025InterspeechDiceHuBERT: Distilling HuBERT with a Self-Supervised Learning Objective.Hyung-Gun Chi, Zakaria Aldeneh, Tatiana Likhomanenko, Oggi Rudovic, Takuya Higuchi, Li-Wei Chen, Shinji Watanabe, Ahmed Hussen Abdelaziz
2025InterspeechOn-device Streaming Discrete Speech Units.Kwanghee Choi, Masao Someki, Emma Strubell, Shinji Watanabe
2024AAAIAudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head.Rongjie Huang, Mingze Li, Dongchao Yang, Jiatong Shi, Xuankai Chang, Zhenhui Ye, Yuning Wu, Zhiqing Hong, Jiawei Huang, Jinglin Liu, Yi Ren, Yuexian Zou, Zhou Zhao, Shinji Watanabe
2024ACLOn the Evaluation of Speech Foundation Models for Spoken Language Understanding.Siddhant Arora, Ankita Pasad, Chung-Ming Chien, Jionghao Han, Roshan S. Sharma, Jee-weon Jung, Hira Dhamyal, William Chen, Suwon Shon, Hung-yi Lee, Karen Livescu, Shinji Watanabe
2024ACLWav2Gloss: Generating Interlinear Glossed Text from Speech.Taiqi He, Kwanghee Choi, Lindia Tjuatja, Nathaniel R. Robinson, Jiatong Shi, Shinji Watanabe, Graham Neubig, David R. Mortensen, Lori S. Levin
2024ACLOWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification.Yifan Peng, Yui Sudo, Muhammad Shakeel, Shinji Watanabe
2024EMNLPTowards Robust Speech Representation Learning for Thousands of Languages.William Chen, Wangyou Zhang, Yifan Peng, Xinjian Li, Jinchuan Tian, Jiatong Shi, Xuankai Chang, Soumi Maiti, Karen Livescu, Shinji Watanabe
2024EMNLPFastAdaSP: Multitask-Adapted Efficient Inference for Large Speech Language Model.Yichen Lu, Jiaqi Song, Chao-Han Huck Yang, Shinji Watanabe
2024ICASSPSemi-Autoregressive Streaming ASR with Label Context.Siddhant Arora, George Saon, Shinji Watanabe, Brian Kingsbury
2024ICASSPExploring Speech Recognition, Translation, and Understanding with Discrete Speech Units: A Comparative Study.Xuankai Chang, Brian Yan, Kwanghee Choi, Jee-Weon Jung, Yichen Lu, Soumi Maiti, Roshan S. Sharma, Jiatong Shi, Jinchuan Tian, Shinji Watanabe, Yuya Fujita, Takashi Maekaku, Pengcheng Guo, Yao-Fei Cheng, Pavel Denisov, Kohei Saijo, Hsiu-Hsuan Wang
2024ICASSPTrain Long and Test Long: Leveraging Full Document Contexts in Speech Processing.William Chen, Takatomo Kano, Atsunori Ogawa, Marc Delcroix, Shinji Watanabe
2024ICASSPSummary on the Multimodal Information-Based Speech Processing (MISP) 2023 Challenge.Hang Chen, Shilong Wu, Chenxi Wang, Jun Du, Chin-Hui Lee, Sabato Marco Siniscalchi, Shinji Watanabe, Jingdong Chen, Odette Scharenborg, Zhong-Qiu Wang, Bao-Cai Yin, Jia Pan
2024ICASSPUnderstanding Probe Behaviors Through Variational Bounds of Mutual Information.Kwanghee Choi, Jee-Weon Jung, Shinji Watanabe
2024ICASSPOne Model to Rule Them All ? Towards End-to-End Joint Speaker Diarization and Speech Recognition.Samuele Cornell, Jee-Weon Jung, Shinji Watanabe, Stefano Squartini
2024ICASSPPhoneme-Aware Encoding for Prefix-Tree-Based Contextual ASR.Hayato Futami, Emiru Tsunoo, Yosuke Kashiwagi, Hiroaki Ogawa, Siddhant Arora, Shinji Watanabe
2024ICASSPLess Peaky and More Accurate CTC Forced Alignment by Label Priors.Ruizhe Huang, Xiaohui Zhang, Zhaoheng Ni, Li Sun, Moto Hira, Jeff Hwang, Vimal Manohar, Vineel Pratap, Matthew Wiesner, Shinji Watanabe, Daniel Povey, Sanjeev Khudanpur
2024ICASSPDynamic-Superb: Towards a Dynamic, Collaborative, and Comprehensive Instruction-Tuning Benchmark For Speech.Chien-Yu Huang, Ke-Han Lu, Shih-Heng Wang, Chi-Yuan Hsiao, Chun-Yi Kuan, Haibin Wu, Siddhant Arora, Kai-Wei Chang, Jiatong Shi, Yifan Peng, Roshan S. Sharma, Shinji Watanabe, Bhiksha Ramakrishnan, Shady Shehata, Hung-Yi Lee
2024ICASSPEnhancing End-to-End Conversational Speech Translation Through Target Language Context Utilization.Amir Hussein, Brian Yan, Antonios Anastasopoulos, Shinji Watanabe, Sanjeev Khudanpur
2024ICASSPSpeech Collage: Code-Switched Audio Generation by Collaging Monolingual Corpora.Amir Hussein, Dorsa Zeinali, Ondrej Klejch, Matthew Wiesner, Brian Yan, Shammur Absar Chowdhury, Ahmed Ali, Shinji Watanabe, Sanjeev Khudanpur
2024ICASSPAugSumm: Towards Generalizable Speech Summarization Using Synthetic Labels from Large Language Models.Jee-Weon Jung, Roshan S. Sharma, William Chen, Bhiksha Raj, Shinji Watanabe
2024ICASSPTowards Practical and Efficient Image-to-Speech Captioning with Vision-Language Pre-Training and Multi-Modal Tokens.Minsu Kim, Jeongsoo Choi, Soumi Maiti, Jeong Hun Yeo, Shinji Watanabe, Yong Man Ro
2024ICASSPVoxMM: Rich Transcription of Conversations in the Wild.Doyeop Kwak, Jaemin Jung, Kihyun Nam, Youngjoon Jang, Jee-Weon Jung, Shinji Watanabe, Joon Son Chung
2024ICASSPBoosting Unknown-Number Speaker Separation with Transformer Decoder-Based Attractor.Younglo Lee, Shukjae Choi, Byeong-Yeol Kim, Zhongqiu Wang, Shinji Watanabe
2024ICASSPHubertopic: Enhancing Semantic Representation of Hubert Through Self-Supervision Utilizing Topic Model.Takashi Maekaku, Jiatong Shi, Xuankai Chang, Yuya Fujita, Shinji Watanabe
2024ICASSPVoxtLM: Unified Decoder-Only Models for Consolidating Speech Recognition, Synthesis and Speech, Text Continuation Tasks.Soumi Maiti, Yifan Peng, Shukjae Choi, Jee-Weon Jung, Xuankai Chang, Shinji Watanabe
2024ICASSPPhISANet: Phonetically Informed Speech Animation Network.Salvador Medina, Sarah L. Taylor, Carsten Stoll, Gareth Edwards, Alex Hauptmann, Shinji Watanabe, Iain A. Matthews
2024ICASSPJoint Optimization of Streaming and Non-Streaming Automatic Speech Recognition with Multi-Decoder and Knowledge Distillation.Muhammad Shakeel, Yui Sudo, Yifan Peng, Shinji Watanabe
2024ICASSPGenerative Context-Aware Fine-Tuning of Self-Supervised Speech Models.Suwon Shon, Kwangyoun Kim, Prashant Sridhar, Yi-Te Hsu, Shinji Watanabe, Karen Livescu
2024ICASSPContextualized Automatic Speech Recognition With Attention-Based Bias Phrase Boosted Beam Search.Yui Sudo, Muhammad Shakeel, Yosuke Fukumoto, Yifan Peng, Shinji Watanabe
2024ICASSPImproving Audio Captioning Models with Fine-Grained Audio Features, Text Embedding Supervision, and LLM Mix-Up Augmentation.Shih-Lun Wu, Xuankai Chang, Gordon Wichern, Jee-Weon Jung, Franois G. Germain, Jonathan Le Roux, Shinji Watanabe
2024ICASSPCross-Modal Multi-Tasking for Speech-to-Text Translation via Hard Parameter Sharing.Brian Yan, Xuankai Chang, Antonios Anastasopoulos, Yuya Fujita, Shinji Watanabe
2024ICASSPVisual Speech Recognition for Languages with Limited Labeled Data Using Automatic Labels from Whisper.Jeong Hun Yeo, Minsu Kim, Shinji Watanabe, Yong Man Ro
2024IJCAICross-Talk Reduction.Zhong-Qiu Wang, Anurag Kumar, Shinji Watanabe
2024InterspeechContextualized End-to-end Automatic Speech Recognition with Intermediate Biasing Loss.Muhammad Shakeel, Yui Sudo, Yifan Peng, Shinji Watanabe
2024InterspeechCan you Remove the Downstream Model for Speaker Recognition with Self-Supervised Speech Features?Zakaria Aldeneh, Takuya Higuchi, Jee-weon Jung, Skyler Seto, Tatiana Likhomanenko, Stephen Shum, Ahmed Hussen Abdelaziz, Shinji Watanabe, Barry-John Theobald
2024InterspeechNeural Blind Source Separation and Diarization for Distant Speech Recognition.Yoshiaki Bando, Tomohiko Nakamura, Shinji Watanabe
2024InterspeechThe Interspeech 2024 Challenge on Speech Processing Using Discrete Units.Xuankai Chang, Jiatong Shi, Jinchuan Tian, Yuning Wu, Yuxun Tang, Yihan Wu, Shinji Watanabe, Yossi Adi, Xie Chen, Qin Jin
2024InterspeechSelf-Supervised Speech Representations are More Phonetic than Semantic.Kwanghee Choi, Ankita Pasad, Tomohiko Nakamura, Satoru Fukayama, Karen Livescu, Shinji Watanabe
2023AAAIA Vector Quantized Approach for Text to Speech Synthesis on Real-World Spontaneous Speech.Li-Wei Chen, Shinji Watanabe, Alexander Rudnicky
2023ACLUnitY: Two-pass Direct Speech-to-speech Translation with Discrete Units.Hirofumi Inaguma, Sravya Popuri, Ilia Kulikov, Peng-Jen Chen, Changhan Wang, Yu-An Chung, Yun Tang, Ann Lee, Shinji Watanabe, Juan Pino
2023ACLSLUE Phase-2: A Benchmark Suite of Diverse Spoken Language Understanding Tasks.Suwon Shon, Siddhant Arora, Chyi-Jiunn Lin, Ankita Pasad, Felix Wu, Roshan S. Sharma, Wei-Lun Wu, Hung-yi Lee, Karen Livescu, Shinji Watanabe
2023ACLESPnet-ST-v2: Multipurpose Spoken Language Translation Toolkit.Brian Yan, Jiatong Shi, Yun Tang, Hirofumi Inaguma, Yifan Peng, Siddharth Dalmia, Peter Polak, Patrick Fernandes, Dan Berrebbi, Tomoki Hayashi, Xiaohui Zhang, Zhaoheng Ni, Moto Hira, Soumi Maiti, Juan Pino, Shinji Watanabe
2023ASRUJoint Prediction and Denoising for Large-Scale Multilingual Self-Supervised Learning.William Chen, Jiatong Shi, Brian Yan, Dan Berrebbi, Wangyou Zhang, Yifan Peng, Xuankai Chang, Soumi Maiti, Shinji Watanabe
2023ASRULV-CTC: Non-Autoregressive ASR With CTC and Latent Variable Models.Yuya Fujita, Shinji Watanabe, Xuankai Chang, Takashi Maekaku
2023ASRUTorchAudio 2.1: Advancing Speech Recognition, Self-Supervised Learning, and Audio Processing Components for Pytorch.Jeff Hwang, Moto Hira, Caroline Chen, Xiaohui Zhang, Zhaoheng Ni, Guangzhi Sun, Pingchuan Ma, Ruizhe Huang, Vineel Pratap, Yuekai Zhang, Anurag Kumar, Chin-Yun Yu, Chuang Zhu, Chunxi Liu, Jacob Kahn, Mirco Ravanelli, Peng Sun, Shinji Watanabe, Yangyang Shi, Yumeng Tao
2023ASRUSummarize While Translating: Universal Model With Parallel Decoding for Summarization and Translation.Takatomo Kano, Atsunori Ogawa, Marc Delcroix, Kohei Matsuura, Takanori Ashihara, William Chen, Shinji Watanabe
2023ASRUYodas: Youtube-Oriented Dataset for Audio and Speech.Xinjian Li, Shinnosuke Takamichi, Takaaki Saeki, William Chen, Sayaka Shiota, Shinji Watanabe
2023ASRUReproducing Whisper-Style Training Using An Open-Source Toolkit And Publicly Available Data.Yifan Peng, Jinchuan Tian, Brian Yan, Dan Berrebbi, Xuankai Chang, Xinjian Li, Jiatong Shi, Siddhant Arora, William Chen, Roshan S. Sharma, Wangyou Zhang, Yui Sudo, Muhammad Shakeel, Jee-Weon Jung, Soumi Maiti, Shinji Watanabe
2023ASRUA Single Speech Enhancement Model Unifying Dereverberation, Denoising, Speaker Counting, Separation, And Extraction.Kohei Saijo, Wangyou Zhang, Zhong-Qiu Wang, Shinji Watanabe, Tetsunori Kobayashi, Tetsuji Ogawa
2023ASRUEspnet-Summ: Introducing a Novel Large Dataset, Toolkit, and a Cross-Corpora Evaluation of Speech Summarization Systems.Roshan S. Sharma, William Chen, Takatomo Kano, Ruchira Sharma, Siddhant Arora, Shinji Watanabe, Atsunori Ogawa, Marc Delcroix, Rita Singh, Bhiksha Raj
2023ASRUFindings of the 2023 ML-Superb Challenge: Pre-Training And Evaluation Over More Languages And Beyond.Jiatong Shi, William Chen, Dan Berrebbi, Hsiu-Hsuan Wang, Wei-Ping Huang, En-Pei Hu, Ho-Lam Chuang, Xuankai Chang, Yuxun Tang, Shang-Wen Li, Abdelrahman Mohamed, Hung-Yi Lee, Shinji Watanabe
2023ASRUDomain Adaptation by Data Distribution Matching Via Submodularity For Speech Recognition.Yusuke Shinohara, Shinji Watanabe
2023ASRUSegment-Level Vectorized Beam Search Based on Partially Autoregressive Inference.Masao Someki, Nicholas Eng, Yosuke Higuchi, Shinji Watanabe
2023ASRUToward Universal Speech Enhancement For Diverse Input Conditions.Wangyou Zhang, Kohei Saijo, Zhong-Qiu Wang, Shinji Watanabe, Yanmin Qian
2023EACLCTC Alignments Improve Autoregressive Translation.Brian Yan, Siddharth Dalmia, Yosuke Higuchi, Graham Neubig, Florian Metze, Alan W. Black, Shinji Watanabe
2023ICASSPJoint Modelling of Spoken Language Understanding Tasks with Integrated Dialog History.Siddhant Arora, Hayato Futami, Emiru Tsunoo, Brian Yan, Shinji Watanabe
2023ICASSPA Study on the Integration of Pipeline and E2E SLU Systems for Spoken Semantic Parsing Toward Stop Quality Challenge.Siddhant Arora, Hayato Futami, Shih-Lun Wu, Jessica Huynh, Yifan Peng, Yosuke Kashiwagi, Emiru Tsunoo, Brian Yan, Shinji Watanabe
2023ICASSPAvoid Overthinking in Self-Supervised Models for Speech Recognition.Dan Berrebbi, Brian Yan, Shinji Watanabe
2023ICASSPSummary on the Multimodal Information Based Speech Processing (MISP) 2022 Challenge.Hang Chen, Shilong Wu, Yusheng Dai, Zhe Wang, Jun Du, Chin-Hui Lee, Jingdong Chen, Shinji Watanabe, Sabato Marco Siniscalchi, Odette Scharenborg, Diyuan Liu, Bao-Cai Yin, Jia Pan, Jianqing Gao, Cong Liu
2023ICASSPA Unified One-Shot Prosody and Speaker Conversion System with Self-Supervised Discrete Speech Units.Li-Wei Chen, Shinji Watanabe, Alexander Rudnicky
2023ICASSPImproving Massively Multilingual ASR with Auxiliary CTC Objectives.William Chen, Brian Yan, Jiatong Shi, Yifan Peng, Soumi Maiti, Shinji Watanabe
2023ICASSPMulti-Channel Speaker Extraction with Adversarial Training: The Wavlab Submission to The Clarity ICASSP 2023 Grand Challenge.Samuele Cornell, Zhong-Qiu Wang, Yoshiki Masuyama, Shinji Watanabe, Manuel Pariente, Nobutaka Ono, Stefano Squartini
2023ICASSPThe Pipeline System of ASR and NLU with MLM-based data Augmentation Toward Stop Low-Resource Challenge.Hayato Futami, Jessica Huynh, Siddhant Arora, Shih-Lun Wu, Yosuke Kashiwagi, Yifan Peng, Brian Yan, Emiru Tsunoo, Shinji Watanabe
2023ICASSPStreaming Joint Speech Recognition and Disfluency Detection.Hayato Futami, Emiru Tsunoo, Kentaro Shibata, Yosuke Kashiwagi, Takao Okuda, Siddhant Arora, Shinji Watanabe
2023ICASSPEuro: Espnet Unsupervised ASR Open-Source Toolkit.Dongji Gao, Jiatong Shi, Shun-Po Chuang, Leibny Paola Garca, Hung-Yi Lee, Shinji Watanabe, Sanjeev Khudanpur
2023ICASSPIntermpl: Momentum Pseudo-Labeling With Intermediate CTC Loss.Yosuke Higuchi, Tetsuji Ogawa, Tetsunori Kobayashi, Shinji Watanabe
2023ICASSPBECTRA: Transducer-Based End-To-End ASR with Bert-Enhanced Encoder.Yosuke Higuchi, Tetsuji Ogawa, Tetsunori Kobayashi, Shinji Watanabe
2023ICASSPFindAdaptNet: Find and Insert Adapters by Learned Layer Importance.Junwei Huang, Karthik Ganesan, Soumi Maiti, Young Min Kim, Xuankai Chang, Paul Liang, Shinji Watanabe
2023ICASSPIn Search of Strong Embedding Extractors for Speaker Diarisation.Jee-Weon Jung, Hee-Soo Heo, Bong-Jin Lee, Jaesung Huh, Andrew Brown, Youngki Kwon, Shinji Watanabe, Joon Son Chung
2023ICASSPSpeech Summarization of Long Spoken Document: Improving Memory Efficiency of Speech/Text Encoders.Takatomo Kano, Atsunori Ogawa, Marc Delcroix, Roshan S. Sharma, Kohei Matsuura, Shinji Watanabe
2023ICASSPE-Branchformer-Based E2E SLU Toward Stop on-Device Challenge.Yosuke Kashiwagi, Siddhant Arora, Hayato Futami, Jessica Huynh, Shih-Lun Wu, Yifan Peng, Brian Yan, Emiru Tsunoo, Shinji Watanabe
2023ICASSPArticulatory Representation Learning via Joint Factor Analysis and Neural Matrix Factorization.Jiachen Lian, Alan W. Black, Yijing Lu, Louis Goldstein, Shinji Watanabe, Gopala Krishna Anumanchipalli
2023ICASSPFully Unsupervised Topic Clustering of Unlabelled Spoken Audio Using Self-Supervised Representation Learning and Topic Model.Takashi Maekaku, Yuya Fujita, Xuankai Chang, Shinji Watanabe
2023ICASSPSpeechlmscore: Evaluating Speech Generation Using Speech Language Model.Soumi Maiti, Yifan Peng, Takaaki Saeki, Shinji Watanabe
2023ICASSPAlign, Write, Re-Order: Explainable End-to-End Speech Translation via Operation Sequence Generation.Motoi Omachi, Brian Yan, Siddharth Dalmia, Yuya Fujita, Shinji Watanabe
2023ICASSPStructured Pruning of Self-Supervised Pre-Trained Models for Speech Recognition and Understanding.Yifan Peng, Kwangyoun Kim, Felix Wu, Prashant Sridhar, Shinji Watanabe
2023ICASSPI3D: Transformer Architectures with Input-Dependent Dynamic Depth for Speech Recognition.Yifan Peng, Jaesong Lee, Shinji Watanabe
2023ICASSPBridging Speech and Textual Pre-Trained Models With Unsupervised ASR.Jiatong Shi, Chan-Jan Hsu, Ho-Lam Chung, Dongji Gao, Paola Garca, Shinji Watanabe, Ann Lee, Hung-Yi Lee
2023ICASSPEnhancing Speech-To-Speech Translation with Multiple TTS Targets.Jiatong Shi, Yun Tang, Ann Lee, Hirofumi Inaguma, Changhan Wang, Juan Pino, Shinji Watanabe
2023ICASSPContext-Aware Fine-Tuning of Self-Supervised Speech Models.Suwon Shon, Felix Wu, Kwangyoun Kim, Prashant Sridhar, Karen Livescu, Shinji Watanabe
2023ICASSPTF-GRIDNET: Making Time-Frequency Domain Models Great Again for Monaural Speaker Separation.Zhong-Qiu Wang, Samuele Cornell, Shukjae Choi, Younglo Lee, Byeong-Yeol Kim, Shinji Watanabe
2023ICASSPFNeural Speech Enhancement with Very Low Algorithmic Latency and Complexity via Integrated full- and sub-band Modeling.Zhong-Qiu Wang, Samuele Cornell, Shukjae Choi, Younglo Lee, Byeong-Yeol Kim, Shinji Watanabe
2023ICASSPThe Multimodal Information Based Speech Processing (Misp) 2022 Challenge: Audio-Visual Diarization And Recognition.Zhe Wang, Shilong Wu, Hang Chen, Mao-Kui He, Jun Du, Chin-Hui Lee, Jingdong Chen, Shinji Watanabe, Sabato Marco Siniscalchi, Odette Scharenborg, Diyuan Liu, Baocai Yin, Jia Pan, Jianqing Gao, Cong Liu
2023ICASSPSpeaker-Independent Acoustic-to-Articulatory Speech Inversion.Peter Wu, Li-Wei Chen, Cheol Jun Cho, Shinji Watanabe, Louis Goldstein, Alan W. Black, Gopala Krishna Anumanchipalli
2023ICASSPWav2Seq: Pre-Training Speech-to-Text Encoder-Decoder Models Using Pseudo Languages.Felix Wu, Kwangyoun Kim, Shinji Watanabe, Kyu Jeong Han, Ryan McDonald, Kilian Q. Weinberger, Yoav Artzi
2023ICASSPMulti-Blank Transducers for Speech Recognition.Hainan Xu, Fei Jia, Somshubra Majumdar, Shinji Watanabe, Boris Ginsburg
2023ICASSPPaaploss: A Phonetic-Aligned Acoustic Parameter Loss for Speech Enhancement.Muqiao Yang, Joseph Konan, David Bick, Yunyang Zeng, Shuo Han, Anurag Kumar, Shinji Watanabe, Bhiksha Raj
2023ICASSPTowards Zero-Shot Code-Switched Speech Recognition.Brian Yan, Matthew Wiesner, Ondrej Klejch, Preethi Jyothi, Shinji Watanabe
2023ICASSPTAPLoss: A Temporal Acoustic Parameter Loss for Speech Enhancement.Yunyang Zeng, Joseph Konan, Shuo Han, David Bick, Muqiao Yang, Anurag Kumar, Shinji Watanabe, Bhiksha Raj
2023ICLRBayes Risk CTC: Controllable CTC Alignment in Sequence-to-Sequence Tasks.Jinchuan Tian, Brian Yan, Jianwei Yu, Chao Weng, Dong Yu, Shinji Watanabe
2023ICMLEfficient Sequence Transduction by Jointly Predicting Tokens and Durations.Hainan Xu, Fei Jia, Somshubra Majumdar, He Huang, Shinji Watanabe, Boris Ginsburg
2023IJCAILearning to Speak from Text: Zero-Shot Multilingual Text-to-Speech with Unsupervised Text Pretraining.Takaaki Saeki, Soumi Maiti, Xinjian Li, Shinji Watanabe, Shinnosuke Takamichi, Hiroshi Saruwatari
2023InterspeechBASS: Block-wise Adaptation for Speech Summarization.Roshan Sharma, Siddhant Arora, Kenneth Zheng, Shinji Watanabe, Rita Singh, Bhiksha Raj
2023InterspeechIntegrating Pretrained ASR and LM to Perform Sequence Generation for Spoken Language Understanding.Siddhant Arora, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Brian Yan, Shinji Watanabe
2023InterspeechExploration of Efficient End-to-End ASR using Discretized Input from Self-Supervised Learning.Xuankai Chang, Brian Yan, Yuya Fujita, Takashi Maekaku, Shinji Watanabe
2023InterspeechReducing Barriers to Self-Supervised Learning: HuBERT Pre-training with Academic Compute.William Chen, Xuankai Chang, Yifan Peng, Zhaoheng Ni, Soumi Maiti, Shinji Watanabe
2022ACLZero-shot Learning for Grapheme to Phoneme Conversion with Language Ensemble.Xinjian Li, Florian Metze, David R. Mortensen, Shinji Watanabe, Alan W. Black
2022ACLSUPERB-SG: Enhanced Speech processing Universal PERformance Benchmark for Semantic and Generative Capabilities.Hsiang-Sheng Tsai, Heng-Jui Chang, Wen-Chin Huang, Zili Huang, Kushal Lakhotia, Shu-Wen Yang, Shuyan Dong, Andy T. Liu, Cheng-I Lai, Jiatong Shi, Xuankai Chang, Phil Hall, Hsuan-Jui Chen, Shang-Wen Li, Shinji Watanabe, Abdelrahman Mohamed, Hung-yi Lee
2022EMNLPToken-level Sequence Labeling for Spoken Language Understanding using Compositional End-to-End Models.Siddhant Arora, Siddharth Dalmia, Brian Yan, Florian Metze, Alan W. Black, Shinji Watanabe
2022EMNLPBERT Meets CTC: New Formulation of End-to-End Speech Recognition with Pre-trained Masked Language Model.Yosuke Higuchi, Brian Yan, Siddhant Arora, Tetsuji Ogawa, Tetsunori Kobayashi, Shinji Watanabe
2022ICASSPESPnet-SLU: Advancing Spoken Language Understanding Through ESPnet.Siddhant Arora, Siddharth Dalmia, Pavel Denisov, Xuankai Chang, Yushi Ueda, Yifan Peng, Yuekai Zhang, Sujay Kumar, Karthik Ganesan, Brian Yan, Ngoc Thang Vu, Alan W. Black, Shinji Watanabe
2022ICASSPExtended Graph Temporal Classification for Multi-Speaker End-to-End ASR.Xuankai Chang, Niko Moritz, Takaaki Hori, Shinji Watanabe, Jonathan Le Roux
2022ICASSPThe First Multimodal Information Based Speech Processing (Misp) Challenge: Data, Tasks, Baselines And Results.Hang Chen, Hengshun Zhou, Jun Du, Chin-Hui Lee, Jingdong Chen, Shinji Watanabe, Sabato Marco Siniscalchi, Odette Scharenborg, Diyuan Liu, Bao-Cai Yin, Jia Pan, Jianqing Gao, Cong Liu
2022ICASSPImproving Non-Autoregressive End-to-End Speech Recognition with Pre-Trained Acoustic and Language Models.Keqi Deng, Zehui Yang, Shinji Watanabe, Yosuke Higuchi, Gaofeng Cheng, Pengyuan Zhang
2022ICASSPMulti-Channel End-To-End Neural Diarization with Distributed Microphones.Shota Horiguchi, Yuki Takashima, Paola Garca, Shinji Watanabe, Yohei Kawaguchi
2022ICASSPInvestigating Self-Supervised Learning for Speech Enhancement and Separation.Zili Huang, Shinji Watanabe, Shu-Wen Yang, Paola Garca, Sanjeev Khudanpur
2022ICASSPS3PRL-VC: Open-Source Voice Conversion Framework with Self-Supervised Speech Representations.Wen-Chin Huang, Shu-Wen Yang, Tomoki Hayashi, Hung-Yi Lee, Shinji Watanabe, Tomoki Toda
2022ICASSPIntegrating Multiple ASR Systems into NLP Backend with Attention Fusion.Takatomo Kano, Atsunori Ogawa, Marc Delcroix, Shinji Watanabe
2022ICASSPTowards Low-Distortion Multi-Channel Speech Enhancement: The ESPNET-Se Submission to the L3DAS22 Challenge.Yen-Ju Lu, Samuele Cornell, Xuankai Chang, Wangyou Zhang, Chenda Li, Zhaoheng Ni, Zhong-Qiu Wang, Shinji Watanabe
2022ICASSPConditional Diffusion Probabilistic Model for Speech Enhancement.Yen-Ju Lu, Zhong-Qiu Wang, Shinji Watanabe, Alexander Richard, Cheng Yu, Yu Tsao
2022ICASSPAn Exploration of Hubert with Large Number of Cluster Units and Model Assessment Using Bayesian Information Criterion.Takashi Maekaku, Xuankai Chang, Yuya Fujita, Shinji Watanabe
2022ICASSPSequence Transduction with Graph-Based Supervision.Niko Moritz, Takaaki Hori, Shinji Watanabe, Jonathan Le Roux
2022ICASSPJoint Speech Recognition and Audio Captioning.Chaitanya Narisetty, Emiru Tsunoo, Xuankai Chang, Yosuke Kashiwagi, Michael Hentschel, Shinji Watanabe
2022ICASSPNon-Autoregressive End-To-End Automatic Speech Recognition Incorporating Downstream Natural Language Processing.Motoi Omachi, Yuya Fujita, Shinji Watanabe, Tianzi Wang
2022ICASSPSRU++: Pioneering Fast Recurrence with Attention for Speech Recognition.Jing Pan, Tao Lei, Kwangyoun Kim, Kyu Jeong Han, Shinji Watanabe
2022ICASSPRun-and-Back Stitch Search: Novel Block Synchronous Decoding For Streaming Encoder-Decoder ASR.Emiru Tsunoo, Chaitanya Narisetty, Michael Hentschel, Yosuke Kashiwagi, Shinji Watanabe
2022ICASSPTorchaudio: Building Blocks for Audio and Speech Processing.Yao-Yuan Yang, Moto Hira, Zhaoheng Ni, Artyom Astafurov, Caroline Chen, Christian Puhrsch, David Pollack, Dmitriy Genzel, Donny Greenberg, Edward Z. Yang, Jason Lian, Jeff Hwang, Ji Chen, Peter Goldsborough, Sean Narenthiran, Shinji Watanabe, Soumith Chintala, Vincent Quenneville-Blair
2022ICASSPJoint Modeling of Code-Switched and Monolingual ASR via Conditional Factorization.Brian Yan, Chunlei Zhang, Meng Yu, Shi-Xiong Zhang, Siddharth Dalmia, Dan Berrebbi, Chao Weng, Shinji Watanabe, Dong Yu
2022ICMLBranchformer: Parallel MLP-Attention Architectures to Capture Local and Global Context for Speech Recognition and Understanding.Yifan Peng, Siddharth Dalmia, Ian R. Lane, Shinji Watanabe
2022InterspeechTwo-Pass Low Latency End-to-End Spoken Language Understanding.Siddhant Arora, Siddharth Dalmia, Xuankai Chang, Brian Yan, Alan W. Black, Shinji Watanabe
2022InterspeechCombining Spectral and Self-Supervised Features for Low Resource Speech Recognition and Translation.Dan Berrebbi, Jiatong Shi, Brian Yan, Osbel Lpez-Francisco, Jonathan D. Amith, Shinji Watanabe
2022InterspeechEnd-to-End Integration of Speech Recognition, Speech Enhancement, and Self-Supervised Learning Representation.Xuankai Chang, Takashi Maekaku, Yuya Fujita, Shinji Watanabe
2022InterspeechAudio-Visual Speech Recognition in MISP2021 Challenge: Dataset Release and Deep Analysis.Hang Chen, Jun Du, Yusheng Dai, Chin-Hui Lee, Sabato Marco Siniscalchi, Shinji Watanabe, Odette Scharenborg, Jingdong Chen, Baocai Yin, Jia Pan
2022InterspeechBlockwise Streaming Transformer for Spoken Language Understanding and Simultaneous Speech Translation.Keqi Deng, Shinji Watanabe, Jiatong Shi, Siddhant Arora
2021ASRUA Study of Transducer Based End-to-End ASR with ESPnet: Architecture, Auxiliary Loss and Decoding Strategies.Florian Boyer, Yusuke Shinohara, Takaaki Ishii, Hirofumi Inaguma, Shinji Watanabe
2021ASRUAn Exploration of Self-Supervised Pretrained Representations for End-to-End Speech Recognition.Xuankai Chang, Takashi Maekaku, Pengcheng Guo, Jing Shi, Yen-Ju Lu, Aswin Shanmugam Subramanian, Tianzi Wang, Shu-Wen Yang, Yu Tsao, Hung-yi Lee, Shinji Watanabe
2021ASRUA Comparative Study on Non-Autoregressive Modelings for Speech-to-Text Generation.Yosuke Higuchi, Nanxin Chen, Yuya Fujita, Hirofumi Inaguma, Tatsuya Komatsu, Jaesong Lee, Jumon Nozaki, Tianzi Wang, Shinji Watanabe
2021ASRUTowards Neural Diarization for Unlimited Numbers of Speakers Using Global and Local Attractors.Shota Horiguchi, Shinji Watanabe, Paola Garca, Yawen Xue, Yuki Takashima, Yohei Kawaguchi
2021ASRUOn Prosody Modeling for ASR+TTS Based Voice Conversion.Wen-Chin Huang, Tomoki Hayashi, Xinjian Li, Shinji Watanabe, Tomoki Toda
2021ASRUFast-MD: Fast Multi-Decoder End-to-End Speech Translation with Non-Autoregressive Hidden Intermediates.Hirofumi Inaguma, Siddharth Dalmia, Brian Yan, Shinji Watanabe
2021ASRUAttention-Based Multi-Hypothesis Fusion for Speech Summarization.Takatomo Kano, Atsunori Ogawa, Marc Delcroix, Shinji Watanabe
2021ASRUConferencingspeech Challenge: Towards Far-Field Multi-Channel Speech Enhancement for Video Conferencing.Wei Rao, Yihui Fu, Yanxin Hu, Xin Xu, Yvkai Jv, Jiangyu Han, Zhongjie Jiang, Lei Xie, Yannan Wang, Shinji Watanabe, Zheng-Hua Tan, Hui Bu, Tao Yu, Shidong Shang
2021ASRUCross-Lingual Transfer for Speech Processing Using Acoustic Language Similarity.Peter Wu, Jiatong Shi, Yifan Zhong, Shinji Watanabe, Alan W. Black
2021EACLLeveraging End-to-End ASR for Endangered Language Documentation: An Empirical Study on Yolxochitl Mixtec.Jiatong Shi, Jonathan D. Amith, Rey Castillo Garca, Esteban Guadalupe Sierra, Kevin Duh, Shinji Watanabe
2021ICASSPEat: Enhanced ASR-TTS for Self-Supervised Speech Recognition.Murali Karthick Baskar, Luks Burget, Shinji Watanabe, Ramn Fernandez Astudillo, Jan Honza Cernock
2021ICASSPRecent Developments on Espnet Toolkit Boosted By Conformer.Pengcheng Guo, Florian Boyer, Xuankai Chang, Tomoki Hayashi, Yosuke Higuchi, Hirofumi Inaguma, Naoyuki Kamo, Chenda Li, Daniel Garcia-Romero, Jiatong Shi, Jing Shi, Shinji Watanabe, Kun Wei, Wangyou Zhang, Yuekai Zhang
2021ICASSPImproved Mask-CTC for Non-Autoregressive End-to-End ASR.Yosuke Higuchi, Hirofumi Inaguma, Shinji Watanabe, Tetsuji Ogawa, Tetsunori Kobayashi
2021ICASSPEnd-To-End Speaker Diarization as Post-Processing.Shota Horiguchi, Paola Garca, Yusuke Fujita, Shinji Watanabe, Kenji Nagamatsu
2021ICASSPORTHROS: non-autoregressive end-to-end speech translation With dual-decoder.Hirofumi Inaguma, Yosuke Higuchi, Kevin Duh, Tatsuya Kawahara, Shinji Watanabe
2021ICASSPGaussian Kernelized Self-Attention for Long Sequence Data and its Application to CTC-Based Speech Recognition.Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe
2021ICASSPIntermediate Loss Regularization for CTC-Based Speech Recognition.Jaesong Lee, Shinji Watanabe
2021ICASSPDual-Path Modeling for Long Recording Speech Separation in Meetings.Chenda Li, Zhuo Chen, Yi Luo, Cong Han, Tianyan Zhou, Keisuke Kinoshita, Marc Delcroix, Shinji Watanabe, Yanmin Qian
2021ICASSPTraining Noisy Single-Channel Speech Separation with Noisy Oracle Sources: A Large Gap and a Small Step.Matthew Maciejewski, Jing Shi, Shinji Watanabe, Sanjeev Khudanpur
2021ICASSPEnd-To-End Diarization for Variable Number of Speakers with Local-Global Networks and Discriminative Speaker Embeddings.Soumi Maiti, Hakan Erdogan, Kevin W. Wilson, Scott Wisdom, Shinji Watanabe, John R. Hershey
2021ICASSPImproving RNN Transducer with Target Speaker Extraction and Neural Uncertainty Estimation.Jiatong Shi, Chunlei Zhang, Chao Weng, Shinji Watanabe, Meng Yu, Dong Yu
2021ICASSPDirectional ASR: A New Paradigm for E2E Multi-Speaker Speech Recognition with Source Localization.Aswin Shanmugam Subramanian, Chao Weng, Shinji Watanabe, Meng Yu, Yong Xu, Shi-Xiong Zhang, Dong Yu
2021ICASSPEnd-to-End Dereverberation, Beamforming, and Speech Recognition with Improved Numerical Stability and Advanced Frontend.Wangyou Zhang, Christoph Bddeker, Shinji Watanabe, Tomohiro Nakatani, Marc Delcroix, Keisuke Kinoshita, Tsubasa Ochiai, Naoyuki Kamo, Reinhold Haeb-Umbach, Yanmin Qian
2021InterspeechRethinking End-to-End Evaluation of Decomposable Tasks: A Case Study on Spoken Language Understanding.Siddhant Arora, Alissa Ostapenko, Vijay Viswanathan, Siddharth Dalmia, Florian Metze, Shinji Watanabe, Alan W. Black
2021InterspeechGigaSpeech: An Evolving, Multi-Domain ASR Corpus with 10, 000 Hours of Transcribed Audio.Guoguo Chen, Shuzhou Chai, Guan-Bo Wang, Jiayu Du, Wei-Qiang Zhang, Chao Weng, Dan Su, Daniel Povey, Jan Trmal, Junbo Zhang, Mingjie Jin, Sanjeev Khudanpur, Shinji Watanabe, Shuaijiang Zhao, Wei Zou, Xiangang Li, Xuchen Yao, Yongqing Wang, Zhao You, Zhiyong Yan
2020ACLESPnet-ST: All-in-One Speech Translation Toolkit.Hirofumi Inaguma, Shun Kiyono, Kevin Duh, Shigeki Karita, Nelson Yalta, Tomoki Hayashi, Shinji Watanabe
2020ICASSPEnd-To-End Multi-Speaker Speech Recognition With Transformer.Xuankai Chang, Wangyou Zhang, Yanmin Qian, Jonathan Le Roux, Shinji Watanabe
2020ICASSPAttention-Based ASR with Lightweight and Dynamic Convolutions.Yuya Fujita, Aswin Shanmugam Subramanian, Motoi Omachi, Shinji Watanabe
2020ICASSPEspnet-TTS: Unified, Reproducible, and Integratable Open Source End-to-End Text-to-Speech Toolkit.Tomoki Hayashi, Ryuichi Yamamoto, Katsuki Inoue, Takenori Yoshimura, Shinji Watanabe, Tomoki Toda, Kazuya Takeda, Yu Zhang, Xu Tan
2020ICASSPSpeaker Diarization with Region Proposal Network.Zili Huang, Shinji Watanabe, Yusuke Fujita, Paola Garca, Yiwen Shao, Daniel Povey, Sanjeev Khudanpur
2020ICASSPSemi-Supervised Speaker Adaptation for End-to-End Speech Synthesis with Pretrained Models.Katsuki Inoue, Sunao Hara, Masanobu Abe, Tomoki Hayashi, Ryuichi Yamamoto, Shinji Watanabe
2020ICASSPA Practical Two-Stage Training Strategy for Multi-Stream End-to-End Speech Recognition.Ruizhi Li, Gregory Sell, Xiaofei Wang, Shinji Watanabe, Hynek Hermansky
2020ICASSPWeakly-Supervised Sound Event Detection with Self-Attention.Koichi Miyazaki, Tatsuya Komatsu, Tomoki Hayashi, Shinji Watanabe, Tomoki Toda, Kazuya Takeda
2020ICASSPFar-Field Location Guided Target Speech Extraction Using End-to-End Speech Recognition Objectives.Aswin Shanmugam Subramanian, Chao Weng, Meng Yu, Shi-Xiong Zhang, Yong Xu, Shinji Watanabe, Dong Yu
2020ICASSPEnd-to-End Automatic Speech Recognition Integrated with CTC-Based Voice Activity Detection.Takenori Yoshimura, Tomoki Hayashi, Kazuya Takeda, Shinji Watanabe
2020InterspeechSpeaker-Conditional Chain Model for Speech Separation and Extraction.Jing Shi, Jiaming Xu, Yusuke Fujita, Shinji Watanabe, Bo Xu
2020InterspeechEnd-to-End ASR with Adaptive Span Self-Attention.Xuankai Chang, Aswin Shanmugam Subramanian, Pengcheng Guo, Shinji Watanabe, Yuya Fujita, Motoi Omachi
2020InterspeechLearning Speaker Embedding from Text-to-Speech.Jaejin Cho, Piotr Zelasko, Jess Villalba, Shinji Watanabe, Najim Dehak
2019ASRUMIMO-Speech: End-to-End Multi-Channel Multi-Speaker Speech Recognition.Xuankai Chang, Wangyou Zhang, Yanmin Qian, Jonathan Le Roux, Shinji Watanabe
2019ASRUEnd-to-End Neural Speaker Diarization with Self-Attention.Yusuke Fujita, Naoyuki Kanda, Shota Horiguchi, Yawen Xue, Kenji Nagamatsu, Shinji Watanabe
2019ASRUMultilingual End-to-End Speech Translation.Hirofumi Inaguma, Kevin Duh, Tatsuya Kawahara, Shinji Watanabe
2019ASRUSimultaneous Speech Recognition and Speaker Diarization for Monaural Dialogue Recordings with Target-Speaker Acoustic Models.Naoyuki Kanda, Shota Horiguchi, Yusuke Fujita, Yawen Xue, Kenji Nagamatsu, Shinji Watanabe
2019ASRUA Comparative Study on Transformer vs RNN in Speech Applications.Shigeki Karita, Xiaofei Wang, Shinji Watanabe, Takenori Yoshimura, Wangyou Zhang, Nanxin Chen, Tomoki Hayashi, Takaaki Hori, Hirofumi Inaguma, Ziyan Jiang, Masao Someki, Nelson Enrique Yalta Soplin, Ryuichi Yamamoto
2019ASRUTransformer ASR with Contextual Block Processing.Emiru Tsunoo, Yosuke Kashiwagi, Toshiyuki Kumakura, Shinji Watanabe
2019ASRUEspresso: A Fast End-to-End Neural Speech Recognition Toolkit.Yiming Wang, Sanjeev Khudanpur, Tongfei Chen, Hainan Xu, Shuoyang Ding, Hang Lv, Yiwen Shao, Nanyun Peng, Lei Xie, Shinji Watanabe
2019ICASSPPromising Accurate Prefix Boosting for Sequence-to-sequence ASR.Murali Karthick Baskar, Luks Burget, Shinji Watanabe, Martin Karafit, Takaaki Hori, Jan Honza Cernock
2019ICASSPEnd-to-end Monaural Multi-speaker ASR System without Pretraining.Xuankai Chang, Yanmin Qian, Kai Yu, Shinji Watanabe
2019ICASSPLanguage Model Integration Based on Memory Control for Sequence to Sequence Speech Recognition.Jaejin Cho, Shinji Watanabe, Takaaki Hori, Murali Karthick Baskar, Hirofumi Inaguma, Jess Villalba, Najim Dehak
2019ICASSPCycle-consistency Training for End-to-end Speech Recognition.Takaaki Hori, Ramn Fernandez Astudillo, Tomoki Hayashi, Yu Zhang, Shinji Watanabe, Jonathan Le Roux
2019ICASSPTransfer Learning of Language-independent End-to-end ASR with Language Model Fusion.Hirofumi Inaguma, Jaejin Cho, Murali Karthick Baskar, Tatsuya Kawahara, Shinji Watanabe
2019ICASSPAcoustic Modeling for Distant Multi-talker Speech Recognition with Single- and Multi-channel Branches.Naoyuki Kanda, Yusuke Fujita, Shota Horiguchi, Rintaro Ikeshita, Kenji Nagamatsu, Shinji Watanabe
2019ICASSPSemi-supervised End-to-end Speech Recognition Using Text-to-speech and Autoencoders.Shigeki Karita, Shinji Watanabe, Tomoharu Iwata, Marc Delcroix, Atsunori Ogawa, Tomohiro Nakatani
2019ICASSPJoint Acoustic and Class Inference for Weakly Supervised Sound Event Detection.Sandeep Kothinti, Keisuke Imoto, Debmalya Chakrabarty, Gregory Sell, Shinji Watanabe, Mounya Elhilali
2019ICASSPAcoustic Modeling for Overlapping Speech Recognition: Jhu Chime-5 Challenge System.Vimal Manohar, Szu-Jui Chen, Zhiqi Wang, Yusuke Fujita, Shinji Watanabe, Sanjeev Khudanpur
2019ICASSPThe Phasebook: Building Complex Masks via Discrete Representations for Source Separation.Jonathan Le Roux, Gordon Wichern, Shinji Watanabe, Andy M. Sarroff, John R. Hershey
2019ICASSPStream Attention-based Multi-array End-to-end Speech Recognition.Xiaofei Wang, Ruizhi Li, Sri Harish Mallidi, Takaaki Hori, Shinji Watanabe, Hynek Hermansky
2019ICASSPImproving End-to-end Speech Recognition with Pronunciation-assisted Sub-word Modeling.Hainan Xu, Shuoyang Ding, Shinji Watanabe
2019ICDARUsing ASR Methods for OCR.Ashish Arora, Paola Garca, Shinji Watanabe, Vimal Manohar, Yiwen Shao, Sanjeev Khudanpur, Chun-Chieh Chang, Babak Rekabdar, Bagher BabaAli, Daniel Povey, David Etter, Desh Raj, Hossein Hadian, Jan Trmal
2019IJCNNWeakly-Supervised Deep Recurrent Neural Networks for Basic Dance Step Generation.Nelson Yalta, Shinji Watanabe, Kazuhiro Nakadai, Tetsuya Ogata
2019InterspeechSemi-Supervised Sequence-to-Sequence ASR Using Unpaired Speech and Text.Murali Karthick Baskar, Shinji Watanabe, Ramn Fernandez Astudillo, Takaaki Hori, Luks Burget, Jan Cernock
2019InterspeechEnd-to-End SpeakerBeam for Single Channel Target Speech Recognition.Marc Delcroix, Shinji Watanabe, Tsubasa Ochiai, Keisuke Kinoshita, Shigeki Karita, Atsunori Ogawa, Tomohiro Nakatani
2018ACLA Purely End-to-End System for Multi-speaker Speech Recognition.Hiroshi Seki, Takaaki Hori, Shinji Watanabe, Jonathan Le Roux, John R. Hershey
2018ICASSPSpeaker Adaptation for Multichannel End-to-End Speech Recognition.Tsubasa Ochiai, Shinji Watanabe, Shigeru Katagiri, Takaaki Hori, John R. Hershey
2018ICASSPAn End-to-End Language-Tracking Speech Recognizer for Mixed-Language Speech.Hiroshi Seki, Shinji Watanabe, Takaaki Hori, Jonathan Le Roux, John R. Hershey
2018ICASSPEnd-to-End Multi-Speaker Speech Recognition.Shane Settle, Jonathan Le Roux, Takaaki Hori, Shinji Watanabe, John R. Hershey
2018InterspeechThe Fifth 'CHiME' Speech Separation and Recognition Challenge: Dataset, Task and Baselines.Jon Barker, Shinji Watanabe, Emmanuel Vincent, Jan Trmal
2018InterspeechBuilding State-of-the-art Distant Speech Recognition Using the CHiME-4 Challenge with a Setup of Speech Enhancement Baseline.Szu-Jui Chen, Aswin Shanmugam Subramanian, Hainan Xu, Shinji Watanabe
2018InterspeechAuxiliary Feature Based Adaptation of End-to-end ASR Systems.Marc Delcroix, Shinji Watanabe, Atsunori Ogawa, Shigeki Karita, Tomohiro Nakatani
2017ACLJoint CTC/attention decoding for end-to-end speech recognition.Takaaki Hori, Shinji Watanabe, John R. Hershey
2017ASRUMulti-level language modeling and decoding for open vocabulary end-to-end speech recognition.Takaaki Hori, Shinji Watanabe, John R. Hershey
2017ASRUComposite embedding systems for ZeroSpeech2017 Track1.Hayato Shibata, Taku Kato, Takahiro Shinozaki, Shinji Watanabe
2017ASRULanguage independent end-to-end architecture for joint language identification and speech recognition.Shinji Watanabe, Takaaki Hori, John R. Hershey
2017ICASSPBLSTM-HMM hybrid system combined with sound activity detection network for polyphonic Sound Event Detection.Tomoki Hayashi, Shinji Watanabe, Tomoki Toda, Takaaki Hori, Jonathan Le Roux, Kazuya Takeda
2017ICASSPJoint CTC-attention based end-to-end speech recognition using multi-task learning.Suyoun Kim, Takaaki Hori, Shinji Watanabe
2017ICASSPDeep long short-term memory adaptive beamforming networks for multichannel robust speech recognition.Zhong Meng, Shinji Watanabe, John R. Hershey, Hakan Erdogan
2017ICASSPStudent-teacher network learning with enhanced features.Shinji Watanabe, Takaaki Hori, Jonathan Le Roux, John R. Hershey
2017ICMLMultichannel End-to-end Speech Recognition.Tsubasa Ochiai, Shinji Watanabe, Takaaki Hori, John R. Hershey
2016ICASSPDeep clustering: Discriminative embeddings for segmentation and separation.John R. Hershey, Zhuo Chen, Jonathan Le Roux, Shinji Watanabe
2016ICASSPMinimum word error training of long short-term memory recurrent neural network language models for speech recognition.Takaaki Hori, Chiori Hori, Shinji Watanabe, John R. Hershey
2016ICASSPSequence summarizing neural network for speaker adaptation.Karel Vesel, Shinji Watanabe, Katerina Zmolkov, Martin Karafit, Luks Burget, Jan Honza Cernock
2016ICASSPDeep unfolding for multichannel source separation.Scott Wisdom, John R. Hershey, Jonathan Le Roux, Shinji Watanabe
2016ICASSPDeep beamforming networks for multi-channel speech recognition.Xiong Xiao, Shinji Watanabe, Hakan Erdogan, Liang Lu, John R. Hershey, Michael L. Seltzer, Guoguo Chen, Yu Zhang, Michael I. Mandel, Dong Yu
2016InterspeechImproved MVDR Beamforming Using Single-Channel Mask Prediction Networks.Hakan Erdogan, John R. Hershey, Shinji Watanabe, Michael I. Mandel, Jonathan Le Roux
2015ASRUThe third 'CHiME' speech separation and recognition challenge: Dataset, task and baselines.Jon Barker, Ricard Marxer, Emmanuel Vincent, Shinji Watanabe
2015ASRUThe MERL/SRI system for the 3RD CHiME challenge using beamforming, robust feature extraction, and advanced speech recognition.Takaaki Hori, Zhuo Chen, Hakan Erdogan, John R. Hershey, Jonathan Le Roux, Vikramjit Mitra, Shinji Watanabe
2015ASRURobust speech recognition in unknown reverberant and noisy conditions.Roger Hsiao, Jeff Z. Ma, William Hartmann, Martin Karafit, Frantisek Grzl, Luks Burget, Igor Szke, Jan Cernock, Shinji Watanabe, Zhuo Chen, Sri Harish Reddy Mallidi, Hynek Hermansky, Stavros Tsakalidis, Richard M. Schwartz
2015ASRUAutomation of system building for state-of-the-art large vocabulary speech recognition using evolution strategy.Takafumi Moriya, Tomohiro Tanaka, Takahiro Shinozaki, Shinji Watanabe, Kevin Duh
2015ICASSPPhase-sensitive and recognition-boosted speech separation using deep recurrent neural networks.Hakan Erdogan, John R. Hershey, Shinji Watanabe, Jonathan Le Roux
2015ICASSPStructure discovery of deep neural network based on evolutionary algorithms.Takahiro Shinozaki, Shinji Watanabe
2015ICASSPDiscriminative method for recurrent neural network language models.Yuuki Tachioka, Shinji Watanabe
2015InterspeechUncertainty propagation through deep neural networks.Ahmed Hussen Abdelaziz, Shinji Watanabe, John R. Hershey, Emmanuel Vincent, Dorothea Kolossa
2015InterspeechRobust speech processing using observation uncertainty and uncertainty propagation: session and paper overview.Ramn Fernandez Astudillo, Shinji Watanabe, Ahmed Hussen Abdelaziz, Dorothea Kolossa
2015InterspeechSpeech enhancement and recognition using multi-task learning of long short-term memory recurrent neural networks.Zhuo Chen, Shinji Watanabe, Hakan Erdogan, John R. Hershey
2014ICASSPLog-linear dialog manager.Hao Tang, Shinji Watanabe, Tim K. Marks, John R. Hershey
2014ICASSPBlack box optimization for automatic speech recognition.Shinji Watanabe, Jonathan Le Roux
2014ICASSPRecurrent deep neural networks for robust speech recognition.Chao Weng, Dong Yu, Shinji Watanabe, Biing-Hwang Fred Juang
2014ICASSPDeep recurrent de-noising auto-encoder and blind de-reverberation for reverberated speech recognition.Felix Weninger, Shinji Watanabe, Yuuki Tachioka, Bjrn W. Schuller
2013ASRUA generalized discriminative training framework for system combination.Yuuki Tachioka, Shinji Watanabe, Jonathan Le Roux, John R. Hershey
2013ASRUThe second 'CHiME' speech separation and recognition challenge: An overview of challenge systems and outcomes.Emmanuel Vincent, Jon Barker, Shinji Watanabe, Jonathan Le Roux, Francesco Nesta, Marco Matassoni
2013ICASSPEffectiveness of discriminative training and feature transformation for reverberated and noisy speech.Yuuki Tachioka, Shinji Watanabe, John R. Hershey
2013ICASSPThe second 'chime' speech separation and recognition challenge: Datasets, tasks and baselines.Emmanuel Vincent, Jon Barker, Shinji Watanabe, Jonathan Le Roux, Francesco Nesta, Marco Matassoni
2013ICASSPStereo-based feature enhancement using dictionary learning.Shinji Watanabe, John R. Hershey
2013IJCNLPStatistical Dialogue Management using Intention Dependency Graph.Koichiro Yoshino, Shinji Watanabe, Jonathan Le Roux, John R. Hershey
2012ICASSPHandling uncertain observations in unsupervised topic-mixture language model adaptation.Ekapol Chuangsuwanich, Shinji Watanabe, Takaaki Hori, Tomoharu Iwata, James R. Glass
2012ICASSPDiscriminative feature transforms using differenced maximum mutual information.Marc Delcroix, Atsunori Ogawa, Shinji Watanabe, Tomohiro Nakatani, Atsushi Nakamura
2012ICASSPNoise suppression with unsupervised joint speaker adaptation and noise mixture model estimation.Masakiyo Fujimoto, Shinji Watanabe, Tomohiro Nakatani
2012ICASSPDecoding network optimization using minimum transition error training.Yotaro Kubo, Shinji Watanabe, Atsushi Nakamura
2012ICASSPBasis vector orthogonalization for an improved kernel gradient matching pursuit method.Yotaro Kubo, Shinji Watanabe, Atsushi Nakamura, Simon Wiesler, Ralf Schlter, Hermann Ney
2012ICASSPEffect of dialog acts on word use in polylogue.Roland Roller, Shinji Watanabe, Tomoharu Iwata
2012ICASSPMFCC enhancement using joint corrupted and noise feature space for highly non-stationary noise environments.Masayuki Suzuki, Takuya Yoshioka, Shinji Watanabe, Nobuaki Minematsu, Keikichi Hirose
2012ICASSPFully Bayesian inference of multi-mixture Gaussian model and its evaluation using speaker clustering.Naohiro Tawara, Tetsuji Ogawa, Shinji Watanabe, Tetsunori Kobayashi
2012ICASSPBag Of ARCS: New representation of speech segment features based on finite state machines.Shinji Watanabe, Yotaro Kubo, Takanobu Oba, Takaaki Hori, Atsushi Nakamura
2011ICASSPNon-stationary noise estimation method based on bias-residual component decomposition for robust speech recognition.Masakiyo Fujimoto, Shinji Watanabe, Tomohiro Nakatani
2011ICASSPSubspace pursuit method for kernel-log-linear models.Yotaro Kubo, Simon Wiesler, Ralf Schlter, Hermann Ney, Shinji Watanabe, Atsushi Nakamura, Tetsunori Kobayashi
2011ICASSPHigh accurate model-integration-based voice conversion using dynamic features and model structure optimization.Daisuke Saito, Shinji Watanabe, Atsushi Nakamura, Nobuaki Minematsu
2011ICASSPGibbs sampling based Multi-scale Mixture Model for speaker clustering.Shinji Watanabe, Daichi Mochihashi, Takaaki Hori, Atsushi Nakamura
2011IJCAIFashion Coordinates Recommender System Using Photographs from Fashion Magazines.Tomoharu Iwata, Shinji Watanabe, Hiroshi Sawada
2010ICASSPFast similarity search on a large speech data set with neighborhood graph indexing.Kazuo Aoyama, Shinji Watanabe, Hiroshi Sawada, Yasuhiro Minami, Naonori Ueda, Kazumi Saito
2010ICASSPUsing online model comparison in the Variational Bayes framework for online unsupervised Voice Activity Detection.David Cournapeau, Shinji Watanabe, Atsushi Nakamura, Tatsuya Kawahara
2010ICASSPSearch error risk minimization in Viterbi beam search for speech recognition.Takaaki Hori, Shinji Watanabe, Atsushi Nakamura
2010ICASSPDiscriminative training based on an integrated view of MPE and MMI in margin and error space.Erik McDermott, Shinji Watanabe, Atsushi Nakamura
2010ICASSPA discriminative model for continuous speech recognition based on Weighted Finite State Transducers.Shinji Watanabe, Takaaki Hori, Erik McDermott, Atsushi Nakamura
2010ICASSPMinimum Error Classification with geometric margin control.Hideyuki Watanabe, Shigeru Katagiri, Kouta Yamada, Erik McDermott, Atsushi Nakamura, Shinji Watanabe, Miho Ohsaki
2009ICASSPA unified view for discriminative objective functions based on negative exponential of difference measure between strings.Atsushi Nakamura, Erik McDermott, Shinji Watanabe, Shigeru Katagiri
2009ICASSPOn-line adaptation and Bayesian detection of environmental changes based on a macroscopic time evolution system.Shinji Watanabe, Atsushi Nakamura
2009IJCAITopic Tracking Model for Analyzing Consumer Purchase Behavior.Tomoharu Iwata, Shinji Watanabe, Takeshi Yamada, Naonori Ueda
2008ICASSPCombined static and dynamic variance adaptation for efficient interconnection of speech enhancement pre-processor with speech recognizer.Marc Delcroix, Tomohiro Nakatani, Shinji Watanabe
2008ICASSPA unified interpretation of adaptation approaches based on a macroscopic time evolution system and indirect/direct adaptation approaches.Shinji Watanabe, Atsushi Nakamura
2007ICASSPIncremental Adaptation Based on a Macroscopic Time Evolution System.Shinji Watanabe, Atsushi Nakamura
2006ICASSPAcoustic Model Adaptation Based on Coarse/Fine Training of Transfer Vectors Using Directional Statistics.Shinji Watanabe, Atsushi Nakamura
2004ICASSPAutomatic determination of acoustic model topology using variational Bayesian estimation and clustering.Shinji Watanabe, Atsushi Sako, Atsushi Nakamura
2004ICASSPBayesian modelling of the speech spectrum using mixture of Gaussians.Parham Zolfaghari, Shinji Watanabe, Atsushi Nakamura, Shigeru Katagiri
2003ICASSPApplication of variational Bayesian estimation and clustering to acoustic model adaptation.Shinji Watanabe, Yasuhiro Minami, Atsushi Nakamura, Naonori Ueda
1996ICIPComputerized analysis for classification of heart diseases in echocardiographic images.Du-Yih Tsai, Shinji Watanabe, Masaaki Tomita
1995ICIPA new stabilized zero-crossing representation in the wavelet transform domain and signal reconstruction.Shinji Watanabe, Yujiro Akimoto, Takashi Komatsu, Takahiro Saito