Yashesh Gaur
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
39
Venues
4
Active years
2015–2025
Best venue rank
A
Where they publish
Papers
39 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2025 | ICASSP | Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition. | Niko Moritz, Ruiming Xie, Yashesh Gaur, Ke Li, Simone Merello, Zeeshan Ahmed, Frank Seide, Christian Fuegen |
| 2025 | ICASSP | Textless Streaming Speech-to-Speech Translation using Semantic Speech Tokens. | Jinzheng Zhao, Niko Moritz, Egor Lakomkin, Ruiming Xie, Zhiping Xiu, Katerina Zmolkov, Zeeshan Ahmed, Yashesh Gaur, Duc Le, Christian Fuegen |
| 2025 | Interspeech | Frozen Large Language Models Can Perceive Paralinguistic Aspects of Speech. | Wonjune Kang, Junteng Jia, Chunyang Wu, Wei Zhou, Egor Lakomkin, Yashesh Gaur, Leda Sari, Suyoun Kim, Ke Li, Jay Mahadeokar, Ozlem Kalinli |
| 2024 | ICASSP | Leveraging Timestamp Information for Serialized Joint Streaming Recognition and Translation. | Sara Papi, Peidong Wang, Jun-Kun Chen, Jian Xue, Naoyuki Kanda, Jinyu Li, Yashesh Gaur |
| 2024 | Interspeech | COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning. | Jing Pan, Jian Wu, Yashesh Gaur, Sunit Sivasankaran, Zhuo Chen, Shujie Liu, Jinyu Li |
| 2024 | Interspeech | Speech ReaLLM - Real-time Speech Recognition with Multimodal Language Models by Teaching the Flow of Time. | Frank Seide, Yangyang Shi, Morrie Doulaty, Yashesh Gaur, Junteng Jia, Chunyang Wu |
| 2023 | ASRU | Token-Level Serialized Output Training for Joint Streaming ASR and ST Leveraging Textual Alignments. | Sara Papi, Peidong Wang, Jun-Kun Chen, Jian Xue, Jinyu Li, Yashesh Gaur |
| 2023 | ASRU | On Decoder-Only Architecture For Speech-to-Text and Large Language Model Integration. | Jian Wu, Yashesh Gaur, Zhuo Chen, Long Zhou, Yimeng Zhu, Tianrui Wang, Jinyu Li, Shujie Liu, Bo Ren, Linquan Liu, Yu Wu |
| 2023 | ICASSP | CTCBERT: Advancing Hidden-Unit Bert with CTC Objectives. | Ruchao Fan, Yiming Wang, Yashesh Gaur, Jinyu Li |
| 2023 | Interspeech | LAMASSU: A Streaming Language-Agnostic Multilingual Speech Recognition and Translation Model Using Neural Transducers. | Peidong Wang, Eric Sun, Jian Xue, Yu Wu, Long Zhou, Yashesh Gaur, Shujie Liu, Jinyu Li |
| 2022 | ICASSP | Transcribe-to-Diarize: Neural Speaker Diarization for Unlimited Number of Speakers Using End-to-End Speaker-Attributed ASR. | Naoyuki Kanda, Xiong Xiao, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Takuya Yoshioka |
| 2022 | ICASSP | Continuous Streaming Multi-Talker ASR with Dual-Path Transducers. | Desh Raj, Liang Lu, Zhuo Chen, Yashesh Gaur, Jinyu Li |
| 2022 | Interspeech | Streaming Speaker-Attributed ASR with Token-Level Speaker Embeddings. | Naoyuki Kanda, Jian Wu, Yu Wu, Xiong Xiao, Zhong Meng, Xiaofei Wang, Yashesh Gaur, Zhuo Chen, Jinyu Li, Takuya Yoshioka |
| 2022 | Interspeech | Streaming Multi-Talker ASR with Token-Level Serialized Output Training. | Naoyuki Kanda, Jian Wu, Yu Wu, Xiong Xiao, Zhong Meng, Xiaofei Wang, Yashesh Gaur, Zhuo Chen, Jinyu Li, Takuya Yoshioka |
| 2022 | Interspeech | Internal Language Model Adaptation with Text-Only Data for End-to-End Speech Recognition. | Zhong Meng, Yashesh Gaur, Naoyuki Kanda, Jinyu Li, Xie Chen, Yu Wu, Yifan Gong |
| 2022 | Interspeech | Large-Scale Streaming End-to-End Speech Translation with Neural Transducers. | Jian Xue, Peidong Wang, Jinyu Li, Matt Post, Yashesh Gaur |
| 2021 | ASRU | A Comparative Study of Modular and Joint Approaches for Speaker-Attributed ASR on Monaural Long-Form Audio. | Naoyuki Kanda, Xiong Xiao, Jian Wu, Tianyan Zhou, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Takuya Yoshioka |
| 2021 | ICASSP | Hypothesis Stitcher for End-to-End Speaker-Attributed ASR on Long-Form Multi-Talker Recordings. | Xuankai Chang, Naoyuki Kanda, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Takuya Yoshioka |
| 2021 | ICASSP | Minimum Bayes Risk Training for End-to-End Speaker-Attributed ASR. | Naoyuki Kanda, Zhong Meng, Liang Lu, Yashesh Gaur, Xiaofei Wang, Zhuo Chen, Takuya Yoshioka |
| 2021 | ICASSP | Internal Language Model Training for Domain-Adaptive End-To-End Speech Recognition. | Zhong Meng, Naoyuki Kanda, Yashesh Gaur, Sarangarajan Parthasarathy, Eric Sun, Liang Lu, Xie Chen, Jinyu Li, Yifan Gong |
| 2021 | ICASSP | Ensemble Combination between Different Time Segmentations. | Jeremy Heng Meng Wong, Dimitrios Dimitriadis, Ken'ichi Kumatani, Yashesh Gaur, George Polovets, Partha Parthasarathy, Eric Sun, Jinyu Li, Yifan Gong |
| 2021 | Interspeech | End-to-End Speaker-Attributed ASR with Transformer. | Naoyuki Kanda, Guoli Ye, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Takuya Yoshioka |
| 2021 | Interspeech | Large-Scale Pre-Training of End-to-End Multi-Talker ASR for Meeting Transcription with Single Distant Microphone. | Naoyuki Kanda, Guoli Ye, Yu Wu, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Takuya Yoshioka |
| 2020 | ICASSP | Minimum Latency Training Strategies for Streaming Sequence-to-Sequence ASR. | Hirofumi Inaguma, Yashesh Gaur, Liang Lu, Jinyu Li, Yifan Gong |
| 2020 | Interspeech | A Federated Approach in Training Acoustic Models. | Dimitrios Dimitriadis, Ken'ichi Kumatani, Robert Gmyr, Yashesh Gaur, Sefik Emre Eskimez |
| 2020 | Interspeech | Joint Speaker Counting, Speech Recognition, and Speaker Identification for Overlapped Speech of any Number of Speakers. | Naoyuki Kanda, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Tianyan Zhou, Takuya Yoshioka |
| 2020 | Interspeech | Serialized Output Training for End-to-End Overlapped Speech Recognition. | Naoyuki Kanda, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Takuya Yoshioka |
| 2020 | Interspeech | Sequence-Level Self-Learning with Multiple Hypotheses. | Ken'ichi Kumatani, Dimitrios Dimitriadis, Yashesh Gaur, Robert Gmyr, Sefik Emre Eskimez, Jinyu Li, Michael Zeng |
| 2020 | Interspeech | On the Comparison of Popular End-to-End Models for Large Scale Speech Recognition. | Jinyu Li, Yu Wu, Yashesh Gaur, Chengyi Wang, Rui Zhao, Shujie Liu |
| 2020 | Interspeech | Combination of End-to-End and Hybrid Models for Speech Recognition. | Jeremy Heng Meng Wong, Yashesh Gaur, Rui Zhao, Liang Lu, Eric Sun, Jinyu Li, Yifan Gong |
| 2019 | ASRU | Character-Aware Attention-Based End-to-End Speech Recognition. | Zhong Meng, Yashesh Gaur, Jinyu Li, Yifan Gong |
| 2019 | ASRU | Domain Adaptation via Teacher-Student Learning for End-to-End Speech Recognition. | Zhong Meng, Jinyu Li, Yashesh Gaur, Yifan Gong |
| 2019 | Interspeech | Acoustic-to-Phrase Models for Speech Recognition. | Yashesh Gaur, Jinyu Li, Zhong Meng, Yifan Gong |
| 2019 | Interspeech | Speaker Adaptation for Attention-Based End-to-End Speech Recognition. | Zhong Meng, Yashesh Gaur, Jinyu Li, Yifan Gong |
| 2018 | ICASSP | Robust Speech Recognition Using Generative Adversarial Networks. | Anuroop Sriram, Heewoo Jun, Yashesh Gaur, Sanjeev Satheesh |
| 2017 | ASRU | Exploring neural transducers for end-to-end speech recognition. | Eric Battenberg, Jitong Chen, Rewon Child, Adam Coates, Yashesh Gaur, Yi Li, Hairong Liu, Sanjeev Satheesh, Anuroop Sriram, Zhenyao Zhu |
| 2016 | Interspeech | Manipulating Word Lattices to Incorporate Human Corrections. | Yashesh Gaur, Florian Metze, Jeffrey P. Bigham |
| 2015 | ASSETS | The Effects of Automatic Speech Recognition Quality on Human Transcription Latency. | Yashesh Gaur |
| 2015 | Interspeech | Using keyword spotting to help humans correct captioning faster. | Yashesh Gaur, Florian Metze, Yajie Miao, Jeffrey P. Bigham |