Skip to content

Yashesh Gaur

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

39

Venues

4

Active years

2015–2025

Best venue rank

A

Where they publish

Papers

39 indexed papers, newest first.

YearVenueTitleAuthors
2025ICASSPTranscribing and Translating, Fast and Slow: Joint Speech Translation and Recognition.Niko Moritz, Ruiming Xie, Yashesh Gaur, Ke Li, Simone Merello, Zeeshan Ahmed, Frank Seide, Christian Fuegen
2025ICASSPTextless Streaming Speech-to-Speech Translation using Semantic Speech Tokens.Jinzheng Zhao, Niko Moritz, Egor Lakomkin, Ruiming Xie, Zhiping Xiu, Katerina Zmolkov, Zeeshan Ahmed, Yashesh Gaur, Duc Le, Christian Fuegen
2025InterspeechFrozen Large Language Models Can Perceive Paralinguistic Aspects of Speech.Wonjune Kang, Junteng Jia, Chunyang Wu, Wei Zhou, Egor Lakomkin, Yashesh Gaur, Leda Sari, Suyoun Kim, Ke Li, Jay Mahadeokar, Ozlem Kalinli
2024ICASSPLeveraging Timestamp Information for Serialized Joint Streaming Recognition and Translation.Sara Papi, Peidong Wang, Jun-Kun Chen, Jian Xue, Naoyuki Kanda, Jinyu Li, Yashesh Gaur
2024InterspeechCOSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning.Jing Pan, Jian Wu, Yashesh Gaur, Sunit Sivasankaran, Zhuo Chen, Shujie Liu, Jinyu Li
2024InterspeechSpeech ReaLLM - Real-time Speech Recognition with Multimodal Language Models by Teaching the Flow of Time.Frank Seide, Yangyang Shi, Morrie Doulaty, Yashesh Gaur, Junteng Jia, Chunyang Wu
2023ASRUToken-Level Serialized Output Training for Joint Streaming ASR and ST Leveraging Textual Alignments.Sara Papi, Peidong Wang, Jun-Kun Chen, Jian Xue, Jinyu Li, Yashesh Gaur
2023ASRUOn Decoder-Only Architecture For Speech-to-Text and Large Language Model Integration.Jian Wu, Yashesh Gaur, Zhuo Chen, Long Zhou, Yimeng Zhu, Tianrui Wang, Jinyu Li, Shujie Liu, Bo Ren, Linquan Liu, Yu Wu
2023ICASSPCTCBERT: Advancing Hidden-Unit Bert with CTC Objectives.Ruchao Fan, Yiming Wang, Yashesh Gaur, Jinyu Li
2023InterspeechLAMASSU: A Streaming Language-Agnostic Multilingual Speech Recognition and Translation Model Using Neural Transducers.Peidong Wang, Eric Sun, Jian Xue, Yu Wu, Long Zhou, Yashesh Gaur, Shujie Liu, Jinyu Li
2022ICASSPTranscribe-to-Diarize: Neural Speaker Diarization for Unlimited Number of Speakers Using End-to-End Speaker-Attributed ASR.Naoyuki Kanda, Xiong Xiao, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Takuya Yoshioka
2022ICASSPContinuous Streaming Multi-Talker ASR with Dual-Path Transducers.Desh Raj, Liang Lu, Zhuo Chen, Yashesh Gaur, Jinyu Li
2022InterspeechStreaming Speaker-Attributed ASR with Token-Level Speaker Embeddings.Naoyuki Kanda, Jian Wu, Yu Wu, Xiong Xiao, Zhong Meng, Xiaofei Wang, Yashesh Gaur, Zhuo Chen, Jinyu Li, Takuya Yoshioka
2022InterspeechStreaming Multi-Talker ASR with Token-Level Serialized Output Training.Naoyuki Kanda, Jian Wu, Yu Wu, Xiong Xiao, Zhong Meng, Xiaofei Wang, Yashesh Gaur, Zhuo Chen, Jinyu Li, Takuya Yoshioka
2022InterspeechInternal Language Model Adaptation with Text-Only Data for End-to-End Speech Recognition.Zhong Meng, Yashesh Gaur, Naoyuki Kanda, Jinyu Li, Xie Chen, Yu Wu, Yifan Gong
2022InterspeechLarge-Scale Streaming End-to-End Speech Translation with Neural Transducers.Jian Xue, Peidong Wang, Jinyu Li, Matt Post, Yashesh Gaur
2021ASRUA Comparative Study of Modular and Joint Approaches for Speaker-Attributed ASR on Monaural Long-Form Audio.Naoyuki Kanda, Xiong Xiao, Jian Wu, Tianyan Zhou, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Takuya Yoshioka
2021ICASSPHypothesis Stitcher for End-to-End Speaker-Attributed ASR on Long-Form Multi-Talker Recordings.Xuankai Chang, Naoyuki Kanda, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Takuya Yoshioka
2021ICASSPMinimum Bayes Risk Training for End-to-End Speaker-Attributed ASR.Naoyuki Kanda, Zhong Meng, Liang Lu, Yashesh Gaur, Xiaofei Wang, Zhuo Chen, Takuya Yoshioka
2021ICASSPInternal Language Model Training for Domain-Adaptive End-To-End Speech Recognition.Zhong Meng, Naoyuki Kanda, Yashesh Gaur, Sarangarajan Parthasarathy, Eric Sun, Liang Lu, Xie Chen, Jinyu Li, Yifan Gong
2021ICASSPEnsemble Combination between Different Time Segmentations.Jeremy Heng Meng Wong, Dimitrios Dimitriadis, Ken'ichi Kumatani, Yashesh Gaur, George Polovets, Partha Parthasarathy, Eric Sun, Jinyu Li, Yifan Gong
2021InterspeechEnd-to-End Speaker-Attributed ASR with Transformer.Naoyuki Kanda, Guoli Ye, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Takuya Yoshioka
2021InterspeechLarge-Scale Pre-Training of End-to-End Multi-Talker ASR for Meeting Transcription with Single Distant Microphone.Naoyuki Kanda, Guoli Ye, Yu Wu, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Takuya Yoshioka
2020ICASSPMinimum Latency Training Strategies for Streaming Sequence-to-Sequence ASR.Hirofumi Inaguma, Yashesh Gaur, Liang Lu, Jinyu Li, Yifan Gong
2020InterspeechA Federated Approach in Training Acoustic Models.Dimitrios Dimitriadis, Ken'ichi Kumatani, Robert Gmyr, Yashesh Gaur, Sefik Emre Eskimez
2020InterspeechJoint Speaker Counting, Speech Recognition, and Speaker Identification for Overlapped Speech of any Number of Speakers.Naoyuki Kanda, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Tianyan Zhou, Takuya Yoshioka
2020InterspeechSerialized Output Training for End-to-End Overlapped Speech Recognition.Naoyuki Kanda, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Takuya Yoshioka
2020InterspeechSequence-Level Self-Learning with Multiple Hypotheses.Ken'ichi Kumatani, Dimitrios Dimitriadis, Yashesh Gaur, Robert Gmyr, Sefik Emre Eskimez, Jinyu Li, Michael Zeng
2020InterspeechOn the Comparison of Popular End-to-End Models for Large Scale Speech Recognition.Jinyu Li, Yu Wu, Yashesh Gaur, Chengyi Wang, Rui Zhao, Shujie Liu
2020InterspeechCombination of End-to-End and Hybrid Models for Speech Recognition.Jeremy Heng Meng Wong, Yashesh Gaur, Rui Zhao, Liang Lu, Eric Sun, Jinyu Li, Yifan Gong
2019ASRUCharacter-Aware Attention-Based End-to-End Speech Recognition.Zhong Meng, Yashesh Gaur, Jinyu Li, Yifan Gong
2019ASRUDomain Adaptation via Teacher-Student Learning for End-to-End Speech Recognition.Zhong Meng, Jinyu Li, Yashesh Gaur, Yifan Gong
2019InterspeechAcoustic-to-Phrase Models for Speech Recognition.Yashesh Gaur, Jinyu Li, Zhong Meng, Yifan Gong
2019InterspeechSpeaker Adaptation for Attention-Based End-to-End Speech Recognition.Zhong Meng, Yashesh Gaur, Jinyu Li, Yifan Gong
2018ICASSPRobust Speech Recognition Using Generative Adversarial Networks.Anuroop Sriram, Heewoo Jun, Yashesh Gaur, Sanjeev Satheesh
2017ASRUExploring neural transducers for end-to-end speech recognition.Eric Battenberg, Jitong Chen, Rewon Child, Adam Coates, Yashesh Gaur, Yi Li, Hairong Liu, Sanjeev Satheesh, Anuroop Sriram, Zhenyao Zhu
2016InterspeechManipulating Word Lattices to Incorporate Human Corrections.Yashesh Gaur, Florian Metze, Jeffrey P. Bigham
2015ASSETSThe Effects of Automatic Speech Recognition Quality on Human Transcription Latency.Yashesh Gaur
2015InterspeechUsing keyword spotting to help humans correct captioning faster.Yashesh Gaur, Florian Metze, Yajie Miao, Jeffrey P. Bigham