Shinji Watanabe
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
445
Venues
14
Active years
1995–2026
Best venue rank
A*
Where they publish
Papers
Showing the 300 most recent indexed papers.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | ACL | Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback. | Siddhant Arora, Jinchuan Tian, Jiatong Shi, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe |
| 2026 | ACL | PRiSM: Benchmarking Phone Realization in Speech Models. | Shikhar Bharadwaj, Chin-Jou Li, Yoonjae Kim, Kwanghee Choi, Eunjung Yeo, Ryan Soh-Eun Shim, Hanyu Zhou, Brendon Boldt, Karen Rosero, Kalvin Chang, Darsh Agrawal, Keer Xu, Chao-Han Huck Yang, Jian Zhu, Shinji Watanabe, David R. Mortensen |
| 2026 | ACL | POWSM: A Phonetic Open Whisper-Style Speech Foundation Model. | Chin-Jou Li, Kalvin Chang, Shikhar Bharadwaj, Eunjung Yeo, Kwanghee Choi, Jian Zhu, David R. Mortensen, Shinji Watanabe |
| 2026 | ACL | Full-Duplex-Bench-v2: A Multi-Turn Evaluation Framework for Duplex Dialogue Systems with an Automated Examiner. | Guan-Ting Lin, Shih-Yun Shan Kuan, Jiatong Shi, Kai-Wei Chang, Siddhant Arora, Shinji Watanabe, Hung-Yi Lee |
| 2026 | ACL | PlanRAG-Audio: Planning and Retrieval Augmented Generation for Long-form Audio Understanding. | Masao Someki, Chien-Yu Huang, Siddhant Arora, Samuele Cornell, Markus Mller, Nathan Susanj, Rupak Vignesh Swaminathan, Grant P. Strimel, Jing Liu, Shinji Watanabe |
| 2026 | ACL | Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception. | Zhen Wan, Chao-Han Huck Yang, Jinchuan Tian, Hanrong Ye, Ankita Pasad, Szu-Wei Fu, Arushi Goel, Ryo Hachiuma, Shizhe Diao, Kunal Dhawan, Sreyan Ghosh, Yusuke Hirota, Zhehuai Chen, Rafael Valle, Chenhui Chu, Shinji Watanabe, Boris Ginsburg, Yu-Chiang Frank Wang |
| 2026 | EACL | CSPB: Conversational Speech Processing Benchmark for Self-supervised Speech Models. | Zili Huang, Matthew Maciejewski, Leibny Paola Garca-Perera, Shinji Watanabe, Sanjeev Khudanpur |
| 2026 | EACL | BSCodec: A Band-Split Neural Codec for High-Quality Universal Audio Reconstruction. | Haoran Wang, Jiatong Shi, Jinchuan Tian, Bohan Li, Kai Yu, Shinji Watanabe |
| 2025 | AAAI | Enhancing Audiovisual Speech Recognition Through Bifocal Preference Optimization. | Yihan Wu, Yichen Lu, Yifan Peng, Xihua Wang, Ruihua Song, Shinji Watanabe |
| 2025 | ACL | SpeechIQ: Speech-Agentic Intelligence Quotient Across Cognitive Levels in Voice Understanding by Large Language Models. | Zhen Wan, Chao-Han Huck Yang, Yahan Yu, Jinchuan Tian, Sheng Li, Ke Hu, Zhehuai Chen, Shinji Watanabe, Fei Cheng, Chenhui Chu, Sadao Kurohashi |
| 2025 | ASRU | Less is More: Data Curation Matters in Scaling Speech Enhancement. | Chenda Li, Wangyou Zhang, Wei Wang, Robin Scheibler, Kohei Saijo, Samuele Cornell, Yihui Fu, Marvin Sach, Zhaoheng Ni, Anurag Kumar, Tim Fingscheidt, Shinji Watanabe, Yanmin Qian |
| 2025 | ASRU | AURA: Agent for Understanding, Reasoning, and Automated Tool Use in Voice-Driven Tasks. | Leander Melroy Maben, Gayathri Ganesh Lakshmy, Srijith Radhakrishnan, Siddhant Arora, Shinji Watanabe |
| 2025 | ASRU | Evaluating Self-Supervised Speech Models Via Text-Based LLMs. | Takashi Maekaku, Keita Goto, Jinchuan Tian, Yusuke Shinohara, Shinji Watanabe |
| 2025 | ASRU | Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder. | Muhammad Shakeel, Yui Sudo, Yifan Peng, Chyi-Jiunn Lin, Shinji Watanabe |
| 2025 | ASRU | VERSA-v2: A Modular and Scalable Toolkit for Speech and Audio Evaluation with Expanded Metrics, Visualization, and LLM Integration. | Jiatong Shi, Bo-Hao Su, Shikhar Bharadwaj, Yiwen Zhao, Shih-Heng Wang, Jionghao Hang, Haoran Wang, Wei Wang, Wenhao Feng, Yuxun Tang, Nezih Topaloglu, Siddhant Arora, Jinchuan Tian, William Chen, Hye-jin Shim, Wangyou Zhang, Wen-Chin Huang, Shinji Watanabe |
| 2025 | ASRU | PURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning. | Jiatong Shi, Haoran Wang, William Chen, Chenda Li, Wangyou Zhang, Jinchuan Tian, Shinji Watanabe |
| 2025 | ASRU | Continual Pre-training for Codec-Based Speech LLMs: Balancing Understanding and Generation. | Jiatong Shi, Chunlei Zhang, Jinchuan Tian, Junrui Ni, Hao Zhang, Shinji Watanabe, Dong Yu |
| 2025 | ASRU | Spiralformer: Low Latency Encoder for Streaming Speech Recognition with Circular Layer Skipping and Early Exiting. | Emiru Tsunoo, Hayato Futami, Yosuke Kashiwagi, Siddhant Arora, Shinji Watanabe |
| 2025 | ASRU | Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training. | Sathvik Udupa, Shinji Watanabe, Petr Schwarz, Jan Cernock |
| 2025 | ASRU | URGENT-PK: Perceptually-Aligned Ranking Model Designed for Speech Enhancement Competition. | Jiahe Wang, Chenda Li, Wei Wang, Wangyou Zhang, Samuele Cornell, Marvin Sach, Robin Scheibler, Kohei Saijo, Yihui Fu, Zhaoheng Ni, Anurag Kumar, Tim Fingscheidt, Shinji Watanabe, Yanmin Qian |
| 2025 | ASRU | Geolocation-Aware Robust Spoken Language Identification. | Qingzheng Wang, Hye-Jin Shim, Jiancheng Sun, Shinji Watanabe |
| 2025 | ASRU | SSVD: Structured SVD for Parameter-Efficient Fine-Tuning and Benchmarking under Domain Shift in ASR. | Pu Wang, Shinji Watanabe, Hugo Van hamme |
| 2025 | ASRU | Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment. | Wei Wang, Wangyou Zhang, Chenda Li, Jaitong Shi, Shinji Watanabe, Yanmin Qian |
| 2025 | ASRU | Robust Training of Singing Voice Synthesis Using Prior and Posterior Uncertainty. | Yiwen Zhao, Jiatong Shi, Yuxun Tang, William Chen, Shinji Watanabe |
| 2025 | EMNLP | Summarizing Speech: A Comprehensive Survey. | Fabian Retkowski, Maike Zfle, Andreas Sudmann, Dinah Pfau, Shinji Watanabe, Jan Niehues, Alexander Waibel |
| 2025 | ICASSP | Speaker-IPL: Unsupervised Learning of Speaker Characteristics with i-Vector based Pseudo-Labels. | Zakaria Aldeneh, Takuya Higuchi, Jee-Weon Jung, Li-Wei Chen, Stephen Shum, Ahmed Hussen Abdelaziz, Shinji Watanabe, Tatiana Likhomanenko, Barry-John Theobald |
| 2025 | ICASSP | Investigation of Spatial Self-Supervised Learning and Its Application to Target Speaker Speech Recognition. | Yoshiaki Bando, Samuele Cornell, Satoru Fukayama, Shinji Watanabe |
| 2025 | ICASSP | Exploring Prediction Targets in Masked Pre-Training for Speech Foundation Models. | Li-Wei Chen, Takuya Higuchi, He Bai, Ahmed Hussen Abdelaziz, Shinji Watanabe, Alexander Rudnicky, Tatiana Likhomanenko, Barry-John Theobald, Zakaria Aldeneh |
| 2025 | ICASSP | Bridging Speech and Text Foundation Models with ReShape Attention. | Takatomo Kano, Atsunori Ogawa, Marc Delcroix, William Chen, Ryo Fukuda, Kohei Matsuura, Takanori Ashihara, Shinji Watanabe |
| 2025 | ICASSP | Hypothesis Clustering and Merging: Novel MultiTalker Speech Recognition with Speaker Tokens. | Yosuke Kashiwagi, Hayato Futami, Emiru Tsunoo, Siddhant Arora, Shinji Watanabe |
| 2025 | ICASSP | Discrete Speech Unit Extraction via Independent Component Analysis. | Tomohiko Nakamura, Kwanghee Choi, Keigo Hojo, Yoshiaki Bando, Satoru Fukayama, Shinji Watanabe |
| 2025 | ICASSP | LIMMITS'25: Multilingual Streaming TTS With Neural Codecs for Indian Languages. | Philipp Olbrich, Hema A. Murthy, Pranaw Kumar, Shinji Watanabe, Sheng Zhao, Mark Hasegawa-Johnson |
| 2025 | ICASSP | Preference Alignment Improves Language Model-Based TTS. | Jinchuan Tian, Chunlei Zhang, Jiatong Shi, Hao Zhang, Jianwei Yu, Shinji Watanabe, Dong Yu |
| 2025 | ICASSP | Improving Multilingual ASR in the Wild Using Simple N-best Re-ranking. | Brian Yan, Vineel Pratap, Shinji Watanabe, Michael Auli |
| 2025 | ICLR | Talking Turns: Benchmarking Audio Foundation Models on Turn-Taking Dynamics. | Siddhant Arora, Zhiyun Lu, Chung-Cheng Chiu, Ruoming Pang, Shinji Watanabe |
| 2025 | ICLR | Context-aware Dynamic Pruning for Speech Foundation Models. | Masao Someki, Yifan Peng, Siddhant Arora, Markus Mller, Athanasios Mouchtaris, Grant P. Strimel, Jing Liu, Shinji Watanabe |
| 2025 | ICML | OWLS: Scaling Laws for Multilingual Speech Recognition and Translation Models. | William Chen, Jinchuan Tian, Yifan Peng, Brian Yan, Chao-Han Huck Yang, Shinji Watanabe |
| 2025 | Interspeech | OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning. | Yifan Peng, Muhammad Shakeel, Yui Sudo, William Chen, Jinchuan Tian, Chyi-Jiunn Lin, Shinji Watanabe |
| 2025 | Interspeech | Chain-of-Thought Training for Open E2E Spoken Dialogue Systems. | Siddhant Arora, Jinchuan Tian, Hayato Futami, Jee-weon Jung, Jiatong Shi, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe |
| 2025 | Interspeech | Exploring Linear Variant Transformers and k-NN Memory Inference for Long-Form ASR. | Carlos Carvalho, Jinchuan Tian, William Chen, Yifan Peng, Alberto Abad, Shinji Watanabe |
| 2025 | Interspeech | The ML-SUPERB 2.0 Challenge: Towards Inclusive ASR Benchmarking for All Language Varieties. | William Chen, Chutong Meng, Jiatong Shi, Martijn Bartelds, Shih-Heng Wang, Hsiu-Hsuan Wang, Rafael Mosquera, Sara Hincapie, Dan Jurafsky, Antonis Anastasopoulos, Hung-yi Lee, Karen Livescu, Shinji Watanabe |
| 2025 | Interspeech | DiceHuBERT: Distilling HuBERT with a Self-Supervised Learning Objective. | Hyung-Gun Chi, Zakaria Aldeneh, Tatiana Likhomanenko, Oggi Rudovic, Takuya Higuchi, Li-Wei Chen, Shinji Watanabe, Ahmed Hussen Abdelaziz |
| 2025 | Interspeech | On-device Streaming Discrete Speech Units. | Kwanghee Choi, Masao Someki, Emma Strubell, Shinji Watanabe |
| 2024 | AAAI | AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head. | Rongjie Huang, Mingze Li, Dongchao Yang, Jiatong Shi, Xuankai Chang, Zhenhui Ye, Yuning Wu, Zhiqing Hong, Jiawei Huang, Jinglin Liu, Yi Ren, Yuexian Zou, Zhou Zhao, Shinji Watanabe |
| 2024 | ACL | On the Evaluation of Speech Foundation Models for Spoken Language Understanding. | Siddhant Arora, Ankita Pasad, Chung-Ming Chien, Jionghao Han, Roshan S. Sharma, Jee-weon Jung, Hira Dhamyal, William Chen, Suwon Shon, Hung-yi Lee, Karen Livescu, Shinji Watanabe |
| 2024 | ACL | Wav2Gloss: Generating Interlinear Glossed Text from Speech. | Taiqi He, Kwanghee Choi, Lindia Tjuatja, Nathaniel R. Robinson, Jiatong Shi, Shinji Watanabe, Graham Neubig, David R. Mortensen, Lori S. Levin |
| 2024 | ACL | OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification. | Yifan Peng, Yui Sudo, Muhammad Shakeel, Shinji Watanabe |
| 2024 | EMNLP | Towards Robust Speech Representation Learning for Thousands of Languages. | William Chen, Wangyou Zhang, Yifan Peng, Xinjian Li, Jinchuan Tian, Jiatong Shi, Xuankai Chang, Soumi Maiti, Karen Livescu, Shinji Watanabe |
| 2024 | EMNLP | FastAdaSP: Multitask-Adapted Efficient Inference for Large Speech Language Model. | Yichen Lu, Jiaqi Song, Chao-Han Huck Yang, Shinji Watanabe |
| 2024 | ICASSP | Semi-Autoregressive Streaming ASR with Label Context. | Siddhant Arora, George Saon, Shinji Watanabe, Brian Kingsbury |
| 2024 | ICASSP | Exploring Speech Recognition, Translation, and Understanding with Discrete Speech Units: A Comparative Study. | Xuankai Chang, Brian Yan, Kwanghee Choi, Jee-Weon Jung, Yichen Lu, Soumi Maiti, Roshan S. Sharma, Jiatong Shi, Jinchuan Tian, Shinji Watanabe, Yuya Fujita, Takashi Maekaku, Pengcheng Guo, Yao-Fei Cheng, Pavel Denisov, Kohei Saijo, Hsiu-Hsuan Wang |
| 2024 | ICASSP | Train Long and Test Long: Leveraging Full Document Contexts in Speech Processing. | William Chen, Takatomo Kano, Atsunori Ogawa, Marc Delcroix, Shinji Watanabe |
| 2024 | ICASSP | Summary on the Multimodal Information-Based Speech Processing (MISP) 2023 Challenge. | Hang Chen, Shilong Wu, Chenxi Wang, Jun Du, Chin-Hui Lee, Sabato Marco Siniscalchi, Shinji Watanabe, Jingdong Chen, Odette Scharenborg, Zhong-Qiu Wang, Bao-Cai Yin, Jia Pan |
| 2024 | ICASSP | Understanding Probe Behaviors Through Variational Bounds of Mutual Information. | Kwanghee Choi, Jee-Weon Jung, Shinji Watanabe |
| 2024 | ICASSP | One Model to Rule Them All ? Towards End-to-End Joint Speaker Diarization and Speech Recognition. | Samuele Cornell, Jee-Weon Jung, Shinji Watanabe, Stefano Squartini |
| 2024 | ICASSP | Phoneme-Aware Encoding for Prefix-Tree-Based Contextual ASR. | Hayato Futami, Emiru Tsunoo, Yosuke Kashiwagi, Hiroaki Ogawa, Siddhant Arora, Shinji Watanabe |
| 2024 | ICASSP | Less Peaky and More Accurate CTC Forced Alignment by Label Priors. | Ruizhe Huang, Xiaohui Zhang, Zhaoheng Ni, Li Sun, Moto Hira, Jeff Hwang, Vimal Manohar, Vineel Pratap, Matthew Wiesner, Shinji Watanabe, Daniel Povey, Sanjeev Khudanpur |
| 2024 | ICASSP | Dynamic-Superb: Towards a Dynamic, Collaborative, and Comprehensive Instruction-Tuning Benchmark For Speech. | Chien-Yu Huang, Ke-Han Lu, Shih-Heng Wang, Chi-Yuan Hsiao, Chun-Yi Kuan, Haibin Wu, Siddhant Arora, Kai-Wei Chang, Jiatong Shi, Yifan Peng, Roshan S. Sharma, Shinji Watanabe, Bhiksha Ramakrishnan, Shady Shehata, Hung-Yi Lee |
| 2024 | ICASSP | Enhancing End-to-End Conversational Speech Translation Through Target Language Context Utilization. | Amir Hussein, Brian Yan, Antonios Anastasopoulos, Shinji Watanabe, Sanjeev Khudanpur |
| 2024 | ICASSP | Speech Collage: Code-Switched Audio Generation by Collaging Monolingual Corpora. | Amir Hussein, Dorsa Zeinali, Ondrej Klejch, Matthew Wiesner, Brian Yan, Shammur Absar Chowdhury, Ahmed Ali, Shinji Watanabe, Sanjeev Khudanpur |
| 2024 | ICASSP | AugSumm: Towards Generalizable Speech Summarization Using Synthetic Labels from Large Language Models. | Jee-Weon Jung, Roshan S. Sharma, William Chen, Bhiksha Raj, Shinji Watanabe |
| 2024 | ICASSP | Towards Practical and Efficient Image-to-Speech Captioning with Vision-Language Pre-Training and Multi-Modal Tokens. | Minsu Kim, Jeongsoo Choi, Soumi Maiti, Jeong Hun Yeo, Shinji Watanabe, Yong Man Ro |
| 2024 | ICASSP | VoxMM: Rich Transcription of Conversations in the Wild. | Doyeop Kwak, Jaemin Jung, Kihyun Nam, Youngjoon Jang, Jee-Weon Jung, Shinji Watanabe, Joon Son Chung |
| 2024 | ICASSP | Boosting Unknown-Number Speaker Separation with Transformer Decoder-Based Attractor. | Younglo Lee, Shukjae Choi, Byeong-Yeol Kim, Zhongqiu Wang, Shinji Watanabe |
| 2024 | ICASSP | Hubertopic: Enhancing Semantic Representation of Hubert Through Self-Supervision Utilizing Topic Model. | Takashi Maekaku, Jiatong Shi, Xuankai Chang, Yuya Fujita, Shinji Watanabe |
| 2024 | ICASSP | VoxtLM: Unified Decoder-Only Models for Consolidating Speech Recognition, Synthesis and Speech, Text Continuation Tasks. | Soumi Maiti, Yifan Peng, Shukjae Choi, Jee-Weon Jung, Xuankai Chang, Shinji Watanabe |
| 2024 | ICASSP | PhISANet: Phonetically Informed Speech Animation Network. | Salvador Medina, Sarah L. Taylor, Carsten Stoll, Gareth Edwards, Alex Hauptmann, Shinji Watanabe, Iain A. Matthews |
| 2024 | ICASSP | Joint Optimization of Streaming and Non-Streaming Automatic Speech Recognition with Multi-Decoder and Knowledge Distillation. | Muhammad Shakeel, Yui Sudo, Yifan Peng, Shinji Watanabe |
| 2024 | ICASSP | Generative Context-Aware Fine-Tuning of Self-Supervised Speech Models. | Suwon Shon, Kwangyoun Kim, Prashant Sridhar, Yi-Te Hsu, Shinji Watanabe, Karen Livescu |
| 2024 | ICASSP | Contextualized Automatic Speech Recognition With Attention-Based Bias Phrase Boosted Beam Search. | Yui Sudo, Muhammad Shakeel, Yosuke Fukumoto, Yifan Peng, Shinji Watanabe |
| 2024 | ICASSP | Improving Audio Captioning Models with Fine-Grained Audio Features, Text Embedding Supervision, and LLM Mix-Up Augmentation. | Shih-Lun Wu, Xuankai Chang, Gordon Wichern, Jee-Weon Jung, Franois G. Germain, Jonathan Le Roux, Shinji Watanabe |
| 2024 | ICASSP | Cross-Modal Multi-Tasking for Speech-to-Text Translation via Hard Parameter Sharing. | Brian Yan, Xuankai Chang, Antonios Anastasopoulos, Yuya Fujita, Shinji Watanabe |
| 2024 | ICASSP | Visual Speech Recognition for Languages with Limited Labeled Data Using Automatic Labels from Whisper. | Jeong Hun Yeo, Minsu Kim, Shinji Watanabe, Yong Man Ro |
| 2024 | IJCAI | Cross-Talk Reduction. | Zhong-Qiu Wang, Anurag Kumar, Shinji Watanabe |
| 2024 | Interspeech | Contextualized End-to-end Automatic Speech Recognition with Intermediate Biasing Loss. | Muhammad Shakeel, Yui Sudo, Yifan Peng, Shinji Watanabe |
| 2024 | Interspeech | Can you Remove the Downstream Model for Speaker Recognition with Self-Supervised Speech Features? | Zakaria Aldeneh, Takuya Higuchi, Jee-weon Jung, Skyler Seto, Tatiana Likhomanenko, Stephen Shum, Ahmed Hussen Abdelaziz, Shinji Watanabe, Barry-John Theobald |
| 2024 | Interspeech | Neural Blind Source Separation and Diarization for Distant Speech Recognition. | Yoshiaki Bando, Tomohiko Nakamura, Shinji Watanabe |
| 2024 | Interspeech | The Interspeech 2024 Challenge on Speech Processing Using Discrete Units. | Xuankai Chang, Jiatong Shi, Jinchuan Tian, Yuning Wu, Yuxun Tang, Yihan Wu, Shinji Watanabe, Yossi Adi, Xie Chen, Qin Jin |
| 2024 | Interspeech | Self-Supervised Speech Representations are More Phonetic than Semantic. | Kwanghee Choi, Ankita Pasad, Tomohiko Nakamura, Satoru Fukayama, Karen Livescu, Shinji Watanabe |
| 2023 | AAAI | A Vector Quantized Approach for Text to Speech Synthesis on Real-World Spontaneous Speech. | Li-Wei Chen, Shinji Watanabe, Alexander Rudnicky |
| 2023 | ACL | UnitY: Two-pass Direct Speech-to-speech Translation with Discrete Units. | Hirofumi Inaguma, Sravya Popuri, Ilia Kulikov, Peng-Jen Chen, Changhan Wang, Yu-An Chung, Yun Tang, Ann Lee, Shinji Watanabe, Juan Pino |
| 2023 | ACL | SLUE Phase-2: A Benchmark Suite of Diverse Spoken Language Understanding Tasks. | Suwon Shon, Siddhant Arora, Chyi-Jiunn Lin, Ankita Pasad, Felix Wu, Roshan S. Sharma, Wei-Lun Wu, Hung-yi Lee, Karen Livescu, Shinji Watanabe |
| 2023 | ACL | ESPnet-ST-v2: Multipurpose Spoken Language Translation Toolkit. | Brian Yan, Jiatong Shi, Yun Tang, Hirofumi Inaguma, Yifan Peng, Siddharth Dalmia, Peter Polak, Patrick Fernandes, Dan Berrebbi, Tomoki Hayashi, Xiaohui Zhang, Zhaoheng Ni, Moto Hira, Soumi Maiti, Juan Pino, Shinji Watanabe |
| 2023 | ASRU | Joint Prediction and Denoising for Large-Scale Multilingual Self-Supervised Learning. | William Chen, Jiatong Shi, Brian Yan, Dan Berrebbi, Wangyou Zhang, Yifan Peng, Xuankai Chang, Soumi Maiti, Shinji Watanabe |
| 2023 | ASRU | LV-CTC: Non-Autoregressive ASR With CTC and Latent Variable Models. | Yuya Fujita, Shinji Watanabe, Xuankai Chang, Takashi Maekaku |
| 2023 | ASRU | TorchAudio 2.1: Advancing Speech Recognition, Self-Supervised Learning, and Audio Processing Components for Pytorch. | Jeff Hwang, Moto Hira, Caroline Chen, Xiaohui Zhang, Zhaoheng Ni, Guangzhi Sun, Pingchuan Ma, Ruizhe Huang, Vineel Pratap, Yuekai Zhang, Anurag Kumar, Chin-Yun Yu, Chuang Zhu, Chunxi Liu, Jacob Kahn, Mirco Ravanelli, Peng Sun, Shinji Watanabe, Yangyang Shi, Yumeng Tao |
| 2023 | ASRU | Summarize While Translating: Universal Model With Parallel Decoding for Summarization and Translation. | Takatomo Kano, Atsunori Ogawa, Marc Delcroix, Kohei Matsuura, Takanori Ashihara, William Chen, Shinji Watanabe |
| 2023 | ASRU | Yodas: Youtube-Oriented Dataset for Audio and Speech. | Xinjian Li, Shinnosuke Takamichi, Takaaki Saeki, William Chen, Sayaka Shiota, Shinji Watanabe |
| 2023 | ASRU | Reproducing Whisper-Style Training Using An Open-Source Toolkit And Publicly Available Data. | Yifan Peng, Jinchuan Tian, Brian Yan, Dan Berrebbi, Xuankai Chang, Xinjian Li, Jiatong Shi, Siddhant Arora, William Chen, Roshan S. Sharma, Wangyou Zhang, Yui Sudo, Muhammad Shakeel, Jee-Weon Jung, Soumi Maiti, Shinji Watanabe |
| 2023 | ASRU | A Single Speech Enhancement Model Unifying Dereverberation, Denoising, Speaker Counting, Separation, And Extraction. | Kohei Saijo, Wangyou Zhang, Zhong-Qiu Wang, Shinji Watanabe, Tetsunori Kobayashi, Tetsuji Ogawa |
| 2023 | ASRU | Espnet-Summ: Introducing a Novel Large Dataset, Toolkit, and a Cross-Corpora Evaluation of Speech Summarization Systems. | Roshan S. Sharma, William Chen, Takatomo Kano, Ruchira Sharma, Siddhant Arora, Shinji Watanabe, Atsunori Ogawa, Marc Delcroix, Rita Singh, Bhiksha Raj |
| 2023 | ASRU | Findings of the 2023 ML-Superb Challenge: Pre-Training And Evaluation Over More Languages And Beyond. | Jiatong Shi, William Chen, Dan Berrebbi, Hsiu-Hsuan Wang, Wei-Ping Huang, En-Pei Hu, Ho-Lam Chuang, Xuankai Chang, Yuxun Tang, Shang-Wen Li, Abdelrahman Mohamed, Hung-Yi Lee, Shinji Watanabe |
| 2023 | ASRU | Domain Adaptation by Data Distribution Matching Via Submodularity For Speech Recognition. | Yusuke Shinohara, Shinji Watanabe |
| 2023 | ASRU | Segment-Level Vectorized Beam Search Based on Partially Autoregressive Inference. | Masao Someki, Nicholas Eng, Yosuke Higuchi, Shinji Watanabe |
| 2023 | ASRU | Toward Universal Speech Enhancement For Diverse Input Conditions. | Wangyou Zhang, Kohei Saijo, Zhong-Qiu Wang, Shinji Watanabe, Yanmin Qian |
| 2023 | EACL | CTC Alignments Improve Autoregressive Translation. | Brian Yan, Siddharth Dalmia, Yosuke Higuchi, Graham Neubig, Florian Metze, Alan W. Black, Shinji Watanabe |
| 2023 | ICASSP | Joint Modelling of Spoken Language Understanding Tasks with Integrated Dialog History. | Siddhant Arora, Hayato Futami, Emiru Tsunoo, Brian Yan, Shinji Watanabe |
| 2023 | ICASSP | A Study on the Integration of Pipeline and E2E SLU Systems for Spoken Semantic Parsing Toward Stop Quality Challenge. | Siddhant Arora, Hayato Futami, Shih-Lun Wu, Jessica Huynh, Yifan Peng, Yosuke Kashiwagi, Emiru Tsunoo, Brian Yan, Shinji Watanabe |
| 2023 | ICASSP | Avoid Overthinking in Self-Supervised Models for Speech Recognition. | Dan Berrebbi, Brian Yan, Shinji Watanabe |
| 2023 | ICASSP | Summary on the Multimodal Information Based Speech Processing (MISP) 2022 Challenge. | Hang Chen, Shilong Wu, Yusheng Dai, Zhe Wang, Jun Du, Chin-Hui Lee, Jingdong Chen, Shinji Watanabe, Sabato Marco Siniscalchi, Odette Scharenborg, Diyuan Liu, Bao-Cai Yin, Jia Pan, Jianqing Gao, Cong Liu |
| 2023 | ICASSP | A Unified One-Shot Prosody and Speaker Conversion System with Self-Supervised Discrete Speech Units. | Li-Wei Chen, Shinji Watanabe, Alexander Rudnicky |
| 2023 | ICASSP | Improving Massively Multilingual ASR with Auxiliary CTC Objectives. | William Chen, Brian Yan, Jiatong Shi, Yifan Peng, Soumi Maiti, Shinji Watanabe |
| 2023 | ICASSP | Multi-Channel Speaker Extraction with Adversarial Training: The Wavlab Submission to The Clarity ICASSP 2023 Grand Challenge. | Samuele Cornell, Zhong-Qiu Wang, Yoshiki Masuyama, Shinji Watanabe, Manuel Pariente, Nobutaka Ono, Stefano Squartini |
| 2023 | ICASSP | The Pipeline System of ASR and NLU with MLM-based data Augmentation Toward Stop Low-Resource Challenge. | Hayato Futami, Jessica Huynh, Siddhant Arora, Shih-Lun Wu, Yosuke Kashiwagi, Yifan Peng, Brian Yan, Emiru Tsunoo, Shinji Watanabe |
| 2023 | ICASSP | Streaming Joint Speech Recognition and Disfluency Detection. | Hayato Futami, Emiru Tsunoo, Kentaro Shibata, Yosuke Kashiwagi, Takao Okuda, Siddhant Arora, Shinji Watanabe |
| 2023 | ICASSP | Euro: Espnet Unsupervised ASR Open-Source Toolkit. | Dongji Gao, Jiatong Shi, Shun-Po Chuang, Leibny Paola Garca, Hung-Yi Lee, Shinji Watanabe, Sanjeev Khudanpur |
| 2023 | ICASSP | Intermpl: Momentum Pseudo-Labeling With Intermediate CTC Loss. | Yosuke Higuchi, Tetsuji Ogawa, Tetsunori Kobayashi, Shinji Watanabe |
| 2023 | ICASSP | BECTRA: Transducer-Based End-To-End ASR with Bert-Enhanced Encoder. | Yosuke Higuchi, Tetsuji Ogawa, Tetsunori Kobayashi, Shinji Watanabe |
| 2023 | ICASSP | FindAdaptNet: Find and Insert Adapters by Learned Layer Importance. | Junwei Huang, Karthik Ganesan, Soumi Maiti, Young Min Kim, Xuankai Chang, Paul Liang, Shinji Watanabe |
| 2023 | ICASSP | In Search of Strong Embedding Extractors for Speaker Diarisation. | Jee-Weon Jung, Hee-Soo Heo, Bong-Jin Lee, Jaesung Huh, Andrew Brown, Youngki Kwon, Shinji Watanabe, Joon Son Chung |
| 2023 | ICASSP | Speech Summarization of Long Spoken Document: Improving Memory Efficiency of Speech/Text Encoders. | Takatomo Kano, Atsunori Ogawa, Marc Delcroix, Roshan S. Sharma, Kohei Matsuura, Shinji Watanabe |
| 2023 | ICASSP | E-Branchformer-Based E2E SLU Toward Stop on-Device Challenge. | Yosuke Kashiwagi, Siddhant Arora, Hayato Futami, Jessica Huynh, Shih-Lun Wu, Yifan Peng, Brian Yan, Emiru Tsunoo, Shinji Watanabe |
| 2023 | ICASSP | Articulatory Representation Learning via Joint Factor Analysis and Neural Matrix Factorization. | Jiachen Lian, Alan W. Black, Yijing Lu, Louis Goldstein, Shinji Watanabe, Gopala Krishna Anumanchipalli |
| 2023 | ICASSP | Fully Unsupervised Topic Clustering of Unlabelled Spoken Audio Using Self-Supervised Representation Learning and Topic Model. | Takashi Maekaku, Yuya Fujita, Xuankai Chang, Shinji Watanabe |
| 2023 | ICASSP | Speechlmscore: Evaluating Speech Generation Using Speech Language Model. | Soumi Maiti, Yifan Peng, Takaaki Saeki, Shinji Watanabe |
| 2023 | ICASSP | Align, Write, Re-Order: Explainable End-to-End Speech Translation via Operation Sequence Generation. | Motoi Omachi, Brian Yan, Siddharth Dalmia, Yuya Fujita, Shinji Watanabe |
| 2023 | ICASSP | Structured Pruning of Self-Supervised Pre-Trained Models for Speech Recognition and Understanding. | Yifan Peng, Kwangyoun Kim, Felix Wu, Prashant Sridhar, Shinji Watanabe |
| 2023 | ICASSP | I3D: Transformer Architectures with Input-Dependent Dynamic Depth for Speech Recognition. | Yifan Peng, Jaesong Lee, Shinji Watanabe |
| 2023 | ICASSP | Bridging Speech and Textual Pre-Trained Models With Unsupervised ASR. | Jiatong Shi, Chan-Jan Hsu, Ho-Lam Chung, Dongji Gao, Paola Garca, Shinji Watanabe, Ann Lee, Hung-Yi Lee |
| 2023 | ICASSP | Enhancing Speech-To-Speech Translation with Multiple TTS Targets. | Jiatong Shi, Yun Tang, Ann Lee, Hirofumi Inaguma, Changhan Wang, Juan Pino, Shinji Watanabe |
| 2023 | ICASSP | Context-Aware Fine-Tuning of Self-Supervised Speech Models. | Suwon Shon, Felix Wu, Kwangyoun Kim, Prashant Sridhar, Karen Livescu, Shinji Watanabe |
| 2023 | ICASSP | TF-GRIDNET: Making Time-Frequency Domain Models Great Again for Monaural Speaker Separation. | Zhong-Qiu Wang, Samuele Cornell, Shukjae Choi, Younglo Lee, Byeong-Yeol Kim, Shinji Watanabe |
| 2023 | ICASSP | FNeural Speech Enhancement with Very Low Algorithmic Latency and Complexity via Integrated full- and sub-band Modeling. | Zhong-Qiu Wang, Samuele Cornell, Shukjae Choi, Younglo Lee, Byeong-Yeol Kim, Shinji Watanabe |
| 2023 | ICASSP | The Multimodal Information Based Speech Processing (Misp) 2022 Challenge: Audio-Visual Diarization And Recognition. | Zhe Wang, Shilong Wu, Hang Chen, Mao-Kui He, Jun Du, Chin-Hui Lee, Jingdong Chen, Shinji Watanabe, Sabato Marco Siniscalchi, Odette Scharenborg, Diyuan Liu, Baocai Yin, Jia Pan, Jianqing Gao, Cong Liu |
| 2023 | ICASSP | Speaker-Independent Acoustic-to-Articulatory Speech Inversion. | Peter Wu, Li-Wei Chen, Cheol Jun Cho, Shinji Watanabe, Louis Goldstein, Alan W. Black, Gopala Krishna Anumanchipalli |
| 2023 | ICASSP | Wav2Seq: Pre-Training Speech-to-Text Encoder-Decoder Models Using Pseudo Languages. | Felix Wu, Kwangyoun Kim, Shinji Watanabe, Kyu Jeong Han, Ryan McDonald, Kilian Q. Weinberger, Yoav Artzi |
| 2023 | ICASSP | Multi-Blank Transducers for Speech Recognition. | Hainan Xu, Fei Jia, Somshubra Majumdar, Shinji Watanabe, Boris Ginsburg |
| 2023 | ICASSP | Paaploss: A Phonetic-Aligned Acoustic Parameter Loss for Speech Enhancement. | Muqiao Yang, Joseph Konan, David Bick, Yunyang Zeng, Shuo Han, Anurag Kumar, Shinji Watanabe, Bhiksha Raj |
| 2023 | ICASSP | Towards Zero-Shot Code-Switched Speech Recognition. | Brian Yan, Matthew Wiesner, Ondrej Klejch, Preethi Jyothi, Shinji Watanabe |
| 2023 | ICASSP | TAPLoss: A Temporal Acoustic Parameter Loss for Speech Enhancement. | Yunyang Zeng, Joseph Konan, Shuo Han, David Bick, Muqiao Yang, Anurag Kumar, Shinji Watanabe, Bhiksha Raj |
| 2023 | ICLR | Bayes Risk CTC: Controllable CTC Alignment in Sequence-to-Sequence Tasks. | Jinchuan Tian, Brian Yan, Jianwei Yu, Chao Weng, Dong Yu, Shinji Watanabe |
| 2023 | ICML | Efficient Sequence Transduction by Jointly Predicting Tokens and Durations. | Hainan Xu, Fei Jia, Somshubra Majumdar, He Huang, Shinji Watanabe, Boris Ginsburg |
| 2023 | IJCAI | Learning to Speak from Text: Zero-Shot Multilingual Text-to-Speech with Unsupervised Text Pretraining. | Takaaki Saeki, Soumi Maiti, Xinjian Li, Shinji Watanabe, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2023 | Interspeech | BASS: Block-wise Adaptation for Speech Summarization. | Roshan Sharma, Siddhant Arora, Kenneth Zheng, Shinji Watanabe, Rita Singh, Bhiksha Raj |
| 2023 | Interspeech | Integrating Pretrained ASR and LM to Perform Sequence Generation for Spoken Language Understanding. | Siddhant Arora, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Brian Yan, Shinji Watanabe |
| 2023 | Interspeech | Exploration of Efficient End-to-End ASR using Discretized Input from Self-Supervised Learning. | Xuankai Chang, Brian Yan, Yuya Fujita, Takashi Maekaku, Shinji Watanabe |
| 2023 | Interspeech | Reducing Barriers to Self-Supervised Learning: HuBERT Pre-training with Academic Compute. | William Chen, Xuankai Chang, Yifan Peng, Zhaoheng Ni, Soumi Maiti, Shinji Watanabe |
| 2022 | ACL | Zero-shot Learning for Grapheme to Phoneme Conversion with Language Ensemble. | Xinjian Li, Florian Metze, David R. Mortensen, Shinji Watanabe, Alan W. Black |
| 2022 | ACL | SUPERB-SG: Enhanced Speech processing Universal PERformance Benchmark for Semantic and Generative Capabilities. | Hsiang-Sheng Tsai, Heng-Jui Chang, Wen-Chin Huang, Zili Huang, Kushal Lakhotia, Shu-Wen Yang, Shuyan Dong, Andy T. Liu, Cheng-I Lai, Jiatong Shi, Xuankai Chang, Phil Hall, Hsuan-Jui Chen, Shang-Wen Li, Shinji Watanabe, Abdelrahman Mohamed, Hung-yi Lee |
| 2022 | EMNLP | Token-level Sequence Labeling for Spoken Language Understanding using Compositional End-to-End Models. | Siddhant Arora, Siddharth Dalmia, Brian Yan, Florian Metze, Alan W. Black, Shinji Watanabe |
| 2022 | EMNLP | BERT Meets CTC: New Formulation of End-to-End Speech Recognition with Pre-trained Masked Language Model. | Yosuke Higuchi, Brian Yan, Siddhant Arora, Tetsuji Ogawa, Tetsunori Kobayashi, Shinji Watanabe |
| 2022 | ICASSP | ESPnet-SLU: Advancing Spoken Language Understanding Through ESPnet. | Siddhant Arora, Siddharth Dalmia, Pavel Denisov, Xuankai Chang, Yushi Ueda, Yifan Peng, Yuekai Zhang, Sujay Kumar, Karthik Ganesan, Brian Yan, Ngoc Thang Vu, Alan W. Black, Shinji Watanabe |
| 2022 | ICASSP | Extended Graph Temporal Classification for Multi-Speaker End-to-End ASR. | Xuankai Chang, Niko Moritz, Takaaki Hori, Shinji Watanabe, Jonathan Le Roux |
| 2022 | ICASSP | The First Multimodal Information Based Speech Processing (Misp) Challenge: Data, Tasks, Baselines And Results. | Hang Chen, Hengshun Zhou, Jun Du, Chin-Hui Lee, Jingdong Chen, Shinji Watanabe, Sabato Marco Siniscalchi, Odette Scharenborg, Diyuan Liu, Bao-Cai Yin, Jia Pan, Jianqing Gao, Cong Liu |
| 2022 | ICASSP | Improving Non-Autoregressive End-to-End Speech Recognition with Pre-Trained Acoustic and Language Models. | Keqi Deng, Zehui Yang, Shinji Watanabe, Yosuke Higuchi, Gaofeng Cheng, Pengyuan Zhang |
| 2022 | ICASSP | Multi-Channel End-To-End Neural Diarization with Distributed Microphones. | Shota Horiguchi, Yuki Takashima, Paola Garca, Shinji Watanabe, Yohei Kawaguchi |
| 2022 | ICASSP | Investigating Self-Supervised Learning for Speech Enhancement and Separation. | Zili Huang, Shinji Watanabe, Shu-Wen Yang, Paola Garca, Sanjeev Khudanpur |
| 2022 | ICASSP | S3PRL-VC: Open-Source Voice Conversion Framework with Self-Supervised Speech Representations. | Wen-Chin Huang, Shu-Wen Yang, Tomoki Hayashi, Hung-Yi Lee, Shinji Watanabe, Tomoki Toda |
| 2022 | ICASSP | Integrating Multiple ASR Systems into NLP Backend with Attention Fusion. | Takatomo Kano, Atsunori Ogawa, Marc Delcroix, Shinji Watanabe |
| 2022 | ICASSP | Towards Low-Distortion Multi-Channel Speech Enhancement: The ESPNET-Se Submission to the L3DAS22 Challenge. | Yen-Ju Lu, Samuele Cornell, Xuankai Chang, Wangyou Zhang, Chenda Li, Zhaoheng Ni, Zhong-Qiu Wang, Shinji Watanabe |
| 2022 | ICASSP | Conditional Diffusion Probabilistic Model for Speech Enhancement. | Yen-Ju Lu, Zhong-Qiu Wang, Shinji Watanabe, Alexander Richard, Cheng Yu, Yu Tsao |
| 2022 | ICASSP | An Exploration of Hubert with Large Number of Cluster Units and Model Assessment Using Bayesian Information Criterion. | Takashi Maekaku, Xuankai Chang, Yuya Fujita, Shinji Watanabe |
| 2022 | ICASSP | Sequence Transduction with Graph-Based Supervision. | Niko Moritz, Takaaki Hori, Shinji Watanabe, Jonathan Le Roux |
| 2022 | ICASSP | Joint Speech Recognition and Audio Captioning. | Chaitanya Narisetty, Emiru Tsunoo, Xuankai Chang, Yosuke Kashiwagi, Michael Hentschel, Shinji Watanabe |
| 2022 | ICASSP | Non-Autoregressive End-To-End Automatic Speech Recognition Incorporating Downstream Natural Language Processing. | Motoi Omachi, Yuya Fujita, Shinji Watanabe, Tianzi Wang |
| 2022 | ICASSP | SRU++: Pioneering Fast Recurrence with Attention for Speech Recognition. | Jing Pan, Tao Lei, Kwangyoun Kim, Kyu Jeong Han, Shinji Watanabe |
| 2022 | ICASSP | Run-and-Back Stitch Search: Novel Block Synchronous Decoding For Streaming Encoder-Decoder ASR. | Emiru Tsunoo, Chaitanya Narisetty, Michael Hentschel, Yosuke Kashiwagi, Shinji Watanabe |
| 2022 | ICASSP | Torchaudio: Building Blocks for Audio and Speech Processing. | Yao-Yuan Yang, Moto Hira, Zhaoheng Ni, Artyom Astafurov, Caroline Chen, Christian Puhrsch, David Pollack, Dmitriy Genzel, Donny Greenberg, Edward Z. Yang, Jason Lian, Jeff Hwang, Ji Chen, Peter Goldsborough, Sean Narenthiran, Shinji Watanabe, Soumith Chintala, Vincent Quenneville-Blair |
| 2022 | ICASSP | Joint Modeling of Code-Switched and Monolingual ASR via Conditional Factorization. | Brian Yan, Chunlei Zhang, Meng Yu, Shi-Xiong Zhang, Siddharth Dalmia, Dan Berrebbi, Chao Weng, Shinji Watanabe, Dong Yu |
| 2022 | ICML | Branchformer: Parallel MLP-Attention Architectures to Capture Local and Global Context for Speech Recognition and Understanding. | Yifan Peng, Siddharth Dalmia, Ian R. Lane, Shinji Watanabe |
| 2022 | Interspeech | Two-Pass Low Latency End-to-End Spoken Language Understanding. | Siddhant Arora, Siddharth Dalmia, Xuankai Chang, Brian Yan, Alan W. Black, Shinji Watanabe |
| 2022 | Interspeech | Combining Spectral and Self-Supervised Features for Low Resource Speech Recognition and Translation. | Dan Berrebbi, Jiatong Shi, Brian Yan, Osbel Lpez-Francisco, Jonathan D. Amith, Shinji Watanabe |
| 2022 | Interspeech | End-to-End Integration of Speech Recognition, Speech Enhancement, and Self-Supervised Learning Representation. | Xuankai Chang, Takashi Maekaku, Yuya Fujita, Shinji Watanabe |
| 2022 | Interspeech | Audio-Visual Speech Recognition in MISP2021 Challenge: Dataset Release and Deep Analysis. | Hang Chen, Jun Du, Yusheng Dai, Chin-Hui Lee, Sabato Marco Siniscalchi, Shinji Watanabe, Odette Scharenborg, Jingdong Chen, Baocai Yin, Jia Pan |
| 2022 | Interspeech | Blockwise Streaming Transformer for Spoken Language Understanding and Simultaneous Speech Translation. | Keqi Deng, Shinji Watanabe, Jiatong Shi, Siddhant Arora |
| 2021 | ASRU | A Study of Transducer Based End-to-End ASR with ESPnet: Architecture, Auxiliary Loss and Decoding Strategies. | Florian Boyer, Yusuke Shinohara, Takaaki Ishii, Hirofumi Inaguma, Shinji Watanabe |
| 2021 | ASRU | An Exploration of Self-Supervised Pretrained Representations for End-to-End Speech Recognition. | Xuankai Chang, Takashi Maekaku, Pengcheng Guo, Jing Shi, Yen-Ju Lu, Aswin Shanmugam Subramanian, Tianzi Wang, Shu-Wen Yang, Yu Tsao, Hung-yi Lee, Shinji Watanabe |
| 2021 | ASRU | A Comparative Study on Non-Autoregressive Modelings for Speech-to-Text Generation. | Yosuke Higuchi, Nanxin Chen, Yuya Fujita, Hirofumi Inaguma, Tatsuya Komatsu, Jaesong Lee, Jumon Nozaki, Tianzi Wang, Shinji Watanabe |
| 2021 | ASRU | Towards Neural Diarization for Unlimited Numbers of Speakers Using Global and Local Attractors. | Shota Horiguchi, Shinji Watanabe, Paola Garca, Yawen Xue, Yuki Takashima, Yohei Kawaguchi |
| 2021 | ASRU | On Prosody Modeling for ASR+TTS Based Voice Conversion. | Wen-Chin Huang, Tomoki Hayashi, Xinjian Li, Shinji Watanabe, Tomoki Toda |
| 2021 | ASRU | Fast-MD: Fast Multi-Decoder End-to-End Speech Translation with Non-Autoregressive Hidden Intermediates. | Hirofumi Inaguma, Siddharth Dalmia, Brian Yan, Shinji Watanabe |
| 2021 | ASRU | Attention-Based Multi-Hypothesis Fusion for Speech Summarization. | Takatomo Kano, Atsunori Ogawa, Marc Delcroix, Shinji Watanabe |
| 2021 | ASRU | Conferencingspeech Challenge: Towards Far-Field Multi-Channel Speech Enhancement for Video Conferencing. | Wei Rao, Yihui Fu, Yanxin Hu, Xin Xu, Yvkai Jv, Jiangyu Han, Zhongjie Jiang, Lei Xie, Yannan Wang, Shinji Watanabe, Zheng-Hua Tan, Hui Bu, Tao Yu, Shidong Shang |
| 2021 | ASRU | Cross-Lingual Transfer for Speech Processing Using Acoustic Language Similarity. | Peter Wu, Jiatong Shi, Yifan Zhong, Shinji Watanabe, Alan W. Black |
| 2021 | EACL | Leveraging End-to-End ASR for Endangered Language Documentation: An Empirical Study on Yolxochitl Mixtec. | Jiatong Shi, Jonathan D. Amith, Rey Castillo Garca, Esteban Guadalupe Sierra, Kevin Duh, Shinji Watanabe |
| 2021 | ICASSP | Eat: Enhanced ASR-TTS for Self-Supervised Speech Recognition. | Murali Karthick Baskar, Luks Burget, Shinji Watanabe, Ramn Fernandez Astudillo, Jan Honza Cernock |
| 2021 | ICASSP | Recent Developments on Espnet Toolkit Boosted By Conformer. | Pengcheng Guo, Florian Boyer, Xuankai Chang, Tomoki Hayashi, Yosuke Higuchi, Hirofumi Inaguma, Naoyuki Kamo, Chenda Li, Daniel Garcia-Romero, Jiatong Shi, Jing Shi, Shinji Watanabe, Kun Wei, Wangyou Zhang, Yuekai Zhang |
| 2021 | ICASSP | Improved Mask-CTC for Non-Autoregressive End-to-End ASR. | Yosuke Higuchi, Hirofumi Inaguma, Shinji Watanabe, Tetsuji Ogawa, Tetsunori Kobayashi |
| 2021 | ICASSP | End-To-End Speaker Diarization as Post-Processing. | Shota Horiguchi, Paola Garca, Yusuke Fujita, Shinji Watanabe, Kenji Nagamatsu |
| 2021 | ICASSP | ORTHROS: non-autoregressive end-to-end speech translation With dual-decoder. | Hirofumi Inaguma, Yosuke Higuchi, Kevin Duh, Tatsuya Kawahara, Shinji Watanabe |
| 2021 | ICASSP | Gaussian Kernelized Self-Attention for Long Sequence Data and its Application to CTC-Based Speech Recognition. | Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe |
| 2021 | ICASSP | Intermediate Loss Regularization for CTC-Based Speech Recognition. | Jaesong Lee, Shinji Watanabe |
| 2021 | ICASSP | Dual-Path Modeling for Long Recording Speech Separation in Meetings. | Chenda Li, Zhuo Chen, Yi Luo, Cong Han, Tianyan Zhou, Keisuke Kinoshita, Marc Delcroix, Shinji Watanabe, Yanmin Qian |
| 2021 | ICASSP | Training Noisy Single-Channel Speech Separation with Noisy Oracle Sources: A Large Gap and a Small Step. | Matthew Maciejewski, Jing Shi, Shinji Watanabe, Sanjeev Khudanpur |
| 2021 | ICASSP | End-To-End Diarization for Variable Number of Speakers with Local-Global Networks and Discriminative Speaker Embeddings. | Soumi Maiti, Hakan Erdogan, Kevin W. Wilson, Scott Wisdom, Shinji Watanabe, John R. Hershey |
| 2021 | ICASSP | Improving RNN Transducer with Target Speaker Extraction and Neural Uncertainty Estimation. | Jiatong Shi, Chunlei Zhang, Chao Weng, Shinji Watanabe, Meng Yu, Dong Yu |
| 2021 | ICASSP | Directional ASR: A New Paradigm for E2E Multi-Speaker Speech Recognition with Source Localization. | Aswin Shanmugam Subramanian, Chao Weng, Shinji Watanabe, Meng Yu, Yong Xu, Shi-Xiong Zhang, Dong Yu |
| 2021 | ICASSP | End-to-End Dereverberation, Beamforming, and Speech Recognition with Improved Numerical Stability and Advanced Frontend. | Wangyou Zhang, Christoph Bddeker, Shinji Watanabe, Tomohiro Nakatani, Marc Delcroix, Keisuke Kinoshita, Tsubasa Ochiai, Naoyuki Kamo, Reinhold Haeb-Umbach, Yanmin Qian |
| 2021 | Interspeech | Rethinking End-to-End Evaluation of Decomposable Tasks: A Case Study on Spoken Language Understanding. | Siddhant Arora, Alissa Ostapenko, Vijay Viswanathan, Siddharth Dalmia, Florian Metze, Shinji Watanabe, Alan W. Black |
| 2021 | Interspeech | GigaSpeech: An Evolving, Multi-Domain ASR Corpus with 10, 000 Hours of Transcribed Audio. | Guoguo Chen, Shuzhou Chai, Guan-Bo Wang, Jiayu Du, Wei-Qiang Zhang, Chao Weng, Dan Su, Daniel Povey, Jan Trmal, Junbo Zhang, Mingjie Jin, Sanjeev Khudanpur, Shinji Watanabe, Shuaijiang Zhao, Wei Zou, Xiangang Li, Xuchen Yao, Yongqing Wang, Zhao You, Zhiyong Yan |
| 2020 | ACL | ESPnet-ST: All-in-One Speech Translation Toolkit. | Hirofumi Inaguma, Shun Kiyono, Kevin Duh, Shigeki Karita, Nelson Yalta, Tomoki Hayashi, Shinji Watanabe |
| 2020 | ICASSP | End-To-End Multi-Speaker Speech Recognition With Transformer. | Xuankai Chang, Wangyou Zhang, Yanmin Qian, Jonathan Le Roux, Shinji Watanabe |
| 2020 | ICASSP | Attention-Based ASR with Lightweight and Dynamic Convolutions. | Yuya Fujita, Aswin Shanmugam Subramanian, Motoi Omachi, Shinji Watanabe |
| 2020 | ICASSP | Espnet-TTS: Unified, Reproducible, and Integratable Open Source End-to-End Text-to-Speech Toolkit. | Tomoki Hayashi, Ryuichi Yamamoto, Katsuki Inoue, Takenori Yoshimura, Shinji Watanabe, Tomoki Toda, Kazuya Takeda, Yu Zhang, Xu Tan |
| 2020 | ICASSP | Speaker Diarization with Region Proposal Network. | Zili Huang, Shinji Watanabe, Yusuke Fujita, Paola Garca, Yiwen Shao, Daniel Povey, Sanjeev Khudanpur |
| 2020 | ICASSP | Semi-Supervised Speaker Adaptation for End-to-End Speech Synthesis with Pretrained Models. | Katsuki Inoue, Sunao Hara, Masanobu Abe, Tomoki Hayashi, Ryuichi Yamamoto, Shinji Watanabe |
| 2020 | ICASSP | A Practical Two-Stage Training Strategy for Multi-Stream End-to-End Speech Recognition. | Ruizhi Li, Gregory Sell, Xiaofei Wang, Shinji Watanabe, Hynek Hermansky |
| 2020 | ICASSP | Weakly-Supervised Sound Event Detection with Self-Attention. | Koichi Miyazaki, Tatsuya Komatsu, Tomoki Hayashi, Shinji Watanabe, Tomoki Toda, Kazuya Takeda |
| 2020 | ICASSP | Far-Field Location Guided Target Speech Extraction Using End-to-End Speech Recognition Objectives. | Aswin Shanmugam Subramanian, Chao Weng, Meng Yu, Shi-Xiong Zhang, Yong Xu, Shinji Watanabe, Dong Yu |
| 2020 | ICASSP | End-to-End Automatic Speech Recognition Integrated with CTC-Based Voice Activity Detection. | Takenori Yoshimura, Tomoki Hayashi, Kazuya Takeda, Shinji Watanabe |
| 2020 | Interspeech | Speaker-Conditional Chain Model for Speech Separation and Extraction. | Jing Shi, Jiaming Xu, Yusuke Fujita, Shinji Watanabe, Bo Xu |
| 2020 | Interspeech | End-to-End ASR with Adaptive Span Self-Attention. | Xuankai Chang, Aswin Shanmugam Subramanian, Pengcheng Guo, Shinji Watanabe, Yuya Fujita, Motoi Omachi |
| 2020 | Interspeech | Learning Speaker Embedding from Text-to-Speech. | Jaejin Cho, Piotr Zelasko, Jess Villalba, Shinji Watanabe, Najim Dehak |
| 2019 | ASRU | MIMO-Speech: End-to-End Multi-Channel Multi-Speaker Speech Recognition. | Xuankai Chang, Wangyou Zhang, Yanmin Qian, Jonathan Le Roux, Shinji Watanabe |
| 2019 | ASRU | End-to-End Neural Speaker Diarization with Self-Attention. | Yusuke Fujita, Naoyuki Kanda, Shota Horiguchi, Yawen Xue, Kenji Nagamatsu, Shinji Watanabe |
| 2019 | ASRU | Multilingual End-to-End Speech Translation. | Hirofumi Inaguma, Kevin Duh, Tatsuya Kawahara, Shinji Watanabe |
| 2019 | ASRU | Simultaneous Speech Recognition and Speaker Diarization for Monaural Dialogue Recordings with Target-Speaker Acoustic Models. | Naoyuki Kanda, Shota Horiguchi, Yusuke Fujita, Yawen Xue, Kenji Nagamatsu, Shinji Watanabe |
| 2019 | ASRU | A Comparative Study on Transformer vs RNN in Speech Applications. | Shigeki Karita, Xiaofei Wang, Shinji Watanabe, Takenori Yoshimura, Wangyou Zhang, Nanxin Chen, Tomoki Hayashi, Takaaki Hori, Hirofumi Inaguma, Ziyan Jiang, Masao Someki, Nelson Enrique Yalta Soplin, Ryuichi Yamamoto |
| 2019 | ASRU | Transformer ASR with Contextual Block Processing. | Emiru Tsunoo, Yosuke Kashiwagi, Toshiyuki Kumakura, Shinji Watanabe |
| 2019 | ASRU | Espresso: A Fast End-to-End Neural Speech Recognition Toolkit. | Yiming Wang, Sanjeev Khudanpur, Tongfei Chen, Hainan Xu, Shuoyang Ding, Hang Lv, Yiwen Shao, Nanyun Peng, Lei Xie, Shinji Watanabe |
| 2019 | ICASSP | Promising Accurate Prefix Boosting for Sequence-to-sequence ASR. | Murali Karthick Baskar, Luks Burget, Shinji Watanabe, Martin Karafit, Takaaki Hori, Jan Honza Cernock |
| 2019 | ICASSP | End-to-end Monaural Multi-speaker ASR System without Pretraining. | Xuankai Chang, Yanmin Qian, Kai Yu, Shinji Watanabe |
| 2019 | ICASSP | Language Model Integration Based on Memory Control for Sequence to Sequence Speech Recognition. | Jaejin Cho, Shinji Watanabe, Takaaki Hori, Murali Karthick Baskar, Hirofumi Inaguma, Jess Villalba, Najim Dehak |
| 2019 | ICASSP | Cycle-consistency Training for End-to-end Speech Recognition. | Takaaki Hori, Ramn Fernandez Astudillo, Tomoki Hayashi, Yu Zhang, Shinji Watanabe, Jonathan Le Roux |
| 2019 | ICASSP | Transfer Learning of Language-independent End-to-end ASR with Language Model Fusion. | Hirofumi Inaguma, Jaejin Cho, Murali Karthick Baskar, Tatsuya Kawahara, Shinji Watanabe |
| 2019 | ICASSP | Acoustic Modeling for Distant Multi-talker Speech Recognition with Single- and Multi-channel Branches. | Naoyuki Kanda, Yusuke Fujita, Shota Horiguchi, Rintaro Ikeshita, Kenji Nagamatsu, Shinji Watanabe |
| 2019 | ICASSP | Semi-supervised End-to-end Speech Recognition Using Text-to-speech and Autoencoders. | Shigeki Karita, Shinji Watanabe, Tomoharu Iwata, Marc Delcroix, Atsunori Ogawa, Tomohiro Nakatani |
| 2019 | ICASSP | Joint Acoustic and Class Inference for Weakly Supervised Sound Event Detection. | Sandeep Kothinti, Keisuke Imoto, Debmalya Chakrabarty, Gregory Sell, Shinji Watanabe, Mounya Elhilali |
| 2019 | ICASSP | Acoustic Modeling for Overlapping Speech Recognition: Jhu Chime-5 Challenge System. | Vimal Manohar, Szu-Jui Chen, Zhiqi Wang, Yusuke Fujita, Shinji Watanabe, Sanjeev Khudanpur |
| 2019 | ICASSP | The Phasebook: Building Complex Masks via Discrete Representations for Source Separation. | Jonathan Le Roux, Gordon Wichern, Shinji Watanabe, Andy M. Sarroff, John R. Hershey |
| 2019 | ICASSP | Stream Attention-based Multi-array End-to-end Speech Recognition. | Xiaofei Wang, Ruizhi Li, Sri Harish Mallidi, Takaaki Hori, Shinji Watanabe, Hynek Hermansky |
| 2019 | ICASSP | Improving End-to-end Speech Recognition with Pronunciation-assisted Sub-word Modeling. | Hainan Xu, Shuoyang Ding, Shinji Watanabe |
| 2019 | ICDAR | Using ASR Methods for OCR. | Ashish Arora, Paola Garca, Shinji Watanabe, Vimal Manohar, Yiwen Shao, Sanjeev Khudanpur, Chun-Chieh Chang, Babak Rekabdar, Bagher BabaAli, Daniel Povey, David Etter, Desh Raj, Hossein Hadian, Jan Trmal |
| 2019 | IJCNN | Weakly-Supervised Deep Recurrent Neural Networks for Basic Dance Step Generation. | Nelson Yalta, Shinji Watanabe, Kazuhiro Nakadai, Tetsuya Ogata |
| 2019 | Interspeech | Semi-Supervised Sequence-to-Sequence ASR Using Unpaired Speech and Text. | Murali Karthick Baskar, Shinji Watanabe, Ramn Fernandez Astudillo, Takaaki Hori, Luks Burget, Jan Cernock |
| 2019 | Interspeech | End-to-End SpeakerBeam for Single Channel Target Speech Recognition. | Marc Delcroix, Shinji Watanabe, Tsubasa Ochiai, Keisuke Kinoshita, Shigeki Karita, Atsunori Ogawa, Tomohiro Nakatani |
| 2018 | ACL | A Purely End-to-End System for Multi-speaker Speech Recognition. | Hiroshi Seki, Takaaki Hori, Shinji Watanabe, Jonathan Le Roux, John R. Hershey |
| 2018 | ICASSP | Speaker Adaptation for Multichannel End-to-End Speech Recognition. | Tsubasa Ochiai, Shinji Watanabe, Shigeru Katagiri, Takaaki Hori, John R. Hershey |
| 2018 | ICASSP | An End-to-End Language-Tracking Speech Recognizer for Mixed-Language Speech. | Hiroshi Seki, Shinji Watanabe, Takaaki Hori, Jonathan Le Roux, John R. Hershey |
| 2018 | ICASSP | End-to-End Multi-Speaker Speech Recognition. | Shane Settle, Jonathan Le Roux, Takaaki Hori, Shinji Watanabe, John R. Hershey |
| 2018 | Interspeech | The Fifth 'CHiME' Speech Separation and Recognition Challenge: Dataset, Task and Baselines. | Jon Barker, Shinji Watanabe, Emmanuel Vincent, Jan Trmal |
| 2018 | Interspeech | Building State-of-the-art Distant Speech Recognition Using the CHiME-4 Challenge with a Setup of Speech Enhancement Baseline. | Szu-Jui Chen, Aswin Shanmugam Subramanian, Hainan Xu, Shinji Watanabe |
| 2018 | Interspeech | Auxiliary Feature Based Adaptation of End-to-end ASR Systems. | Marc Delcroix, Shinji Watanabe, Atsunori Ogawa, Shigeki Karita, Tomohiro Nakatani |
| 2017 | ACL | Joint CTC/attention decoding for end-to-end speech recognition. | Takaaki Hori, Shinji Watanabe, John R. Hershey |
| 2017 | ASRU | Multi-level language modeling and decoding for open vocabulary end-to-end speech recognition. | Takaaki Hori, Shinji Watanabe, John R. Hershey |
| 2017 | ASRU | Composite embedding systems for ZeroSpeech2017 Track1. | Hayato Shibata, Taku Kato, Takahiro Shinozaki, Shinji Watanabe |
| 2017 | ASRU | Language independent end-to-end architecture for joint language identification and speech recognition. | Shinji Watanabe, Takaaki Hori, John R. Hershey |
| 2017 | ICASSP | BLSTM-HMM hybrid system combined with sound activity detection network for polyphonic Sound Event Detection. | Tomoki Hayashi, Shinji Watanabe, Tomoki Toda, Takaaki Hori, Jonathan Le Roux, Kazuya Takeda |
| 2017 | ICASSP | Joint CTC-attention based end-to-end speech recognition using multi-task learning. | Suyoun Kim, Takaaki Hori, Shinji Watanabe |
| 2017 | ICASSP | Deep long short-term memory adaptive beamforming networks for multichannel robust speech recognition. | Zhong Meng, Shinji Watanabe, John R. Hershey, Hakan Erdogan |
| 2017 | ICASSP | Student-teacher network learning with enhanced features. | Shinji Watanabe, Takaaki Hori, Jonathan Le Roux, John R. Hershey |
| 2017 | ICML | Multichannel End-to-end Speech Recognition. | Tsubasa Ochiai, Shinji Watanabe, Takaaki Hori, John R. Hershey |
| 2016 | ICASSP | Deep clustering: Discriminative embeddings for segmentation and separation. | John R. Hershey, Zhuo Chen, Jonathan Le Roux, Shinji Watanabe |
| 2016 | ICASSP | Minimum word error training of long short-term memory recurrent neural network language models for speech recognition. | Takaaki Hori, Chiori Hori, Shinji Watanabe, John R. Hershey |
| 2016 | ICASSP | Sequence summarizing neural network for speaker adaptation. | Karel Vesel, Shinji Watanabe, Katerina Zmolkov, Martin Karafit, Luks Burget, Jan Honza Cernock |
| 2016 | ICASSP | Deep unfolding for multichannel source separation. | Scott Wisdom, John R. Hershey, Jonathan Le Roux, Shinji Watanabe |
| 2016 | ICASSP | Deep beamforming networks for multi-channel speech recognition. | Xiong Xiao, Shinji Watanabe, Hakan Erdogan, Liang Lu, John R. Hershey, Michael L. Seltzer, Guoguo Chen, Yu Zhang, Michael I. Mandel, Dong Yu |
| 2016 | Interspeech | Improved MVDR Beamforming Using Single-Channel Mask Prediction Networks. | Hakan Erdogan, John R. Hershey, Shinji Watanabe, Michael I. Mandel, Jonathan Le Roux |
| 2015 | ASRU | The third 'CHiME' speech separation and recognition challenge: Dataset, task and baselines. | Jon Barker, Ricard Marxer, Emmanuel Vincent, Shinji Watanabe |
| 2015 | ASRU | The MERL/SRI system for the 3RD CHiME challenge using beamforming, robust feature extraction, and advanced speech recognition. | Takaaki Hori, Zhuo Chen, Hakan Erdogan, John R. Hershey, Jonathan Le Roux, Vikramjit Mitra, Shinji Watanabe |
| 2015 | ASRU | Robust speech recognition in unknown reverberant and noisy conditions. | Roger Hsiao, Jeff Z. Ma, William Hartmann, Martin Karafit, Frantisek Grzl, Luks Burget, Igor Szke, Jan Cernock, Shinji Watanabe, Zhuo Chen, Sri Harish Reddy Mallidi, Hynek Hermansky, Stavros Tsakalidis, Richard M. Schwartz |
| 2015 | ASRU | Automation of system building for state-of-the-art large vocabulary speech recognition using evolution strategy. | Takafumi Moriya, Tomohiro Tanaka, Takahiro Shinozaki, Shinji Watanabe, Kevin Duh |
| 2015 | ICASSP | Phase-sensitive and recognition-boosted speech separation using deep recurrent neural networks. | Hakan Erdogan, John R. Hershey, Shinji Watanabe, Jonathan Le Roux |
| 2015 | ICASSP | Structure discovery of deep neural network based on evolutionary algorithms. | Takahiro Shinozaki, Shinji Watanabe |
| 2015 | ICASSP | Discriminative method for recurrent neural network language models. | Yuuki Tachioka, Shinji Watanabe |
| 2015 | Interspeech | Uncertainty propagation through deep neural networks. | Ahmed Hussen Abdelaziz, Shinji Watanabe, John R. Hershey, Emmanuel Vincent, Dorothea Kolossa |
| 2015 | Interspeech | Robust speech processing using observation uncertainty and uncertainty propagation: session and paper overview. | Ramn Fernandez Astudillo, Shinji Watanabe, Ahmed Hussen Abdelaziz, Dorothea Kolossa |
| 2015 | Interspeech | Speech enhancement and recognition using multi-task learning of long short-term memory recurrent neural networks. | Zhuo Chen, Shinji Watanabe, Hakan Erdogan, John R. Hershey |
| 2014 | ICASSP | Log-linear dialog manager. | Hao Tang, Shinji Watanabe, Tim K. Marks, John R. Hershey |
| 2014 | ICASSP | Black box optimization for automatic speech recognition. | Shinji Watanabe, Jonathan Le Roux |
| 2014 | ICASSP | Recurrent deep neural networks for robust speech recognition. | Chao Weng, Dong Yu, Shinji Watanabe, Biing-Hwang Fred Juang |
| 2014 | ICASSP | Deep recurrent de-noising auto-encoder and blind de-reverberation for reverberated speech recognition. | Felix Weninger, Shinji Watanabe, Yuuki Tachioka, Bjrn W. Schuller |
| 2013 | ASRU | A generalized discriminative training framework for system combination. | Yuuki Tachioka, Shinji Watanabe, Jonathan Le Roux, John R. Hershey |
| 2013 | ASRU | The second 'CHiME' speech separation and recognition challenge: An overview of challenge systems and outcomes. | Emmanuel Vincent, Jon Barker, Shinji Watanabe, Jonathan Le Roux, Francesco Nesta, Marco Matassoni |
| 2013 | ICASSP | Effectiveness of discriminative training and feature transformation for reverberated and noisy speech. | Yuuki Tachioka, Shinji Watanabe, John R. Hershey |
| 2013 | ICASSP | The second 'chime' speech separation and recognition challenge: Datasets, tasks and baselines. | Emmanuel Vincent, Jon Barker, Shinji Watanabe, Jonathan Le Roux, Francesco Nesta, Marco Matassoni |
| 2013 | ICASSP | Stereo-based feature enhancement using dictionary learning. | Shinji Watanabe, John R. Hershey |
| 2013 | IJCNLP | Statistical Dialogue Management using Intention Dependency Graph. | Koichiro Yoshino, Shinji Watanabe, Jonathan Le Roux, John R. Hershey |
| 2012 | ICASSP | Handling uncertain observations in unsupervised topic-mixture language model adaptation. | Ekapol Chuangsuwanich, Shinji Watanabe, Takaaki Hori, Tomoharu Iwata, James R. Glass |
| 2012 | ICASSP | Discriminative feature transforms using differenced maximum mutual information. | Marc Delcroix, Atsunori Ogawa, Shinji Watanabe, Tomohiro Nakatani, Atsushi Nakamura |
| 2012 | ICASSP | Noise suppression with unsupervised joint speaker adaptation and noise mixture model estimation. | Masakiyo Fujimoto, Shinji Watanabe, Tomohiro Nakatani |
| 2012 | ICASSP | Decoding network optimization using minimum transition error training. | Yotaro Kubo, Shinji Watanabe, Atsushi Nakamura |
| 2012 | ICASSP | Basis vector orthogonalization for an improved kernel gradient matching pursuit method. | Yotaro Kubo, Shinji Watanabe, Atsushi Nakamura, Simon Wiesler, Ralf Schlter, Hermann Ney |
| 2012 | ICASSP | Effect of dialog acts on word use in polylogue. | Roland Roller, Shinji Watanabe, Tomoharu Iwata |
| 2012 | ICASSP | MFCC enhancement using joint corrupted and noise feature space for highly non-stationary noise environments. | Masayuki Suzuki, Takuya Yoshioka, Shinji Watanabe, Nobuaki Minematsu, Keikichi Hirose |
| 2012 | ICASSP | Fully Bayesian inference of multi-mixture Gaussian model and its evaluation using speaker clustering. | Naohiro Tawara, Tetsuji Ogawa, Shinji Watanabe, Tetsunori Kobayashi |
| 2012 | ICASSP | Bag Of ARCS: New representation of speech segment features based on finite state machines. | Shinji Watanabe, Yotaro Kubo, Takanobu Oba, Takaaki Hori, Atsushi Nakamura |
| 2011 | ICASSP | Non-stationary noise estimation method based on bias-residual component decomposition for robust speech recognition. | Masakiyo Fujimoto, Shinji Watanabe, Tomohiro Nakatani |
| 2011 | ICASSP | Subspace pursuit method for kernel-log-linear models. | Yotaro Kubo, Simon Wiesler, Ralf Schlter, Hermann Ney, Shinji Watanabe, Atsushi Nakamura, Tetsunori Kobayashi |
| 2011 | ICASSP | High accurate model-integration-based voice conversion using dynamic features and model structure optimization. | Daisuke Saito, Shinji Watanabe, Atsushi Nakamura, Nobuaki Minematsu |
| 2011 | ICASSP | Gibbs sampling based Multi-scale Mixture Model for speaker clustering. | Shinji Watanabe, Daichi Mochihashi, Takaaki Hori, Atsushi Nakamura |
| 2011 | IJCAI | Fashion Coordinates Recommender System Using Photographs from Fashion Magazines. | Tomoharu Iwata, Shinji Watanabe, Hiroshi Sawada |
| 2010 | ICASSP | Fast similarity search on a large speech data set with neighborhood graph indexing. | Kazuo Aoyama, Shinji Watanabe, Hiroshi Sawada, Yasuhiro Minami, Naonori Ueda, Kazumi Saito |
| 2010 | ICASSP | Using online model comparison in the Variational Bayes framework for online unsupervised Voice Activity Detection. | David Cournapeau, Shinji Watanabe, Atsushi Nakamura, Tatsuya Kawahara |
| 2010 | ICASSP | Search error risk minimization in Viterbi beam search for speech recognition. | Takaaki Hori, Shinji Watanabe, Atsushi Nakamura |
| 2010 | ICASSP | Discriminative training based on an integrated view of MPE and MMI in margin and error space. | Erik McDermott, Shinji Watanabe, Atsushi Nakamura |
| 2010 | ICASSP | A discriminative model for continuous speech recognition based on Weighted Finite State Transducers. | Shinji Watanabe, Takaaki Hori, Erik McDermott, Atsushi Nakamura |
| 2010 | ICASSP | Minimum Error Classification with geometric margin control. | Hideyuki Watanabe, Shigeru Katagiri, Kouta Yamada, Erik McDermott, Atsushi Nakamura, Shinji Watanabe, Miho Ohsaki |
| 2009 | ICASSP | A unified view for discriminative objective functions based on negative exponential of difference measure between strings. | Atsushi Nakamura, Erik McDermott, Shinji Watanabe, Shigeru Katagiri |
| 2009 | ICASSP | On-line adaptation and Bayesian detection of environmental changes based on a macroscopic time evolution system. | Shinji Watanabe, Atsushi Nakamura |
| 2009 | IJCAI | Topic Tracking Model for Analyzing Consumer Purchase Behavior. | Tomoharu Iwata, Shinji Watanabe, Takeshi Yamada, Naonori Ueda |
| 2008 | ICASSP | Combined static and dynamic variance adaptation for efficient interconnection of speech enhancement pre-processor with speech recognizer. | Marc Delcroix, Tomohiro Nakatani, Shinji Watanabe |
| 2008 | ICASSP | A unified interpretation of adaptation approaches based on a macroscopic time evolution system and indirect/direct adaptation approaches. | Shinji Watanabe, Atsushi Nakamura |
| 2007 | ICASSP | Incremental Adaptation Based on a Macroscopic Time Evolution System. | Shinji Watanabe, Atsushi Nakamura |
| 2006 | ICASSP | Acoustic Model Adaptation Based on Coarse/Fine Training of Transfer Vectors Using Directional Statistics. | Shinji Watanabe, Atsushi Nakamura |
| 2004 | ICASSP | Automatic determination of acoustic model topology using variational Bayesian estimation and clustering. | Shinji Watanabe, Atsushi Sako, Atsushi Nakamura |
| 2004 | ICASSP | Bayesian modelling of the speech spectrum using mixture of Gaussians. | Parham Zolfaghari, Shinji Watanabe, Atsushi Nakamura, Shigeru Katagiri |
| 2003 | ICASSP | Application of variational Bayesian estimation and clustering to acoustic model adaptation. | Shinji Watanabe, Yasuhiro Minami, Atsushi Nakamura, Naonori Ueda |
| 1996 | ICIP | Computerized analysis for classification of heart diseases in echocardiographic images. | Du-Yih Tsai, Shinji Watanabe, Masaaki Tomita |
| 1995 | ICIP | A new stabilized zero-crossing representation in the wavelet transform domain and signal reconstruction. | Shinji Watanabe, Yujiro Akimoto, Takashi Komatsu, Takahiro Saito |