Skip to content

Kunal Dhawan

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

14

Venues

6

Active years

2024–2026

Best venue rank

A*

Where they publish

Papers

14 indexed papers, newest first.

YearVenueTitleAuthors
2026ACLSpeech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception.Zhen Wan, Chao-Han Huck Yang, Jinchuan Tian, Hanrong Ye, Ankita Pasad, Szu-Wei Fu, Arushi Goel, Ryo Hachiuma, Shizhe Diao, Kunal Dhawan, Sreyan Ghosh, Yusuke Hirota, Zhehuai Chen, Rafael Valle, Chenhui Chu, Shinji Watanabe, Boris Ginsburg, Yu-Chiang Frank Wang
2025ASRUTraining and Inference Efficiency of Encoder-Decoder Speech Models.Piotr Zelasko, Kunal Dhawan, Daniel Galvez, Krishna C. Puvvada, Ankita Pasad, Travis M. Bartley, Nithin Rao Koluguri, Ke Hu, Vitaly Lavrukhin, Jagadeesh Balam, Boris Ginsburg
2025ICASSPNEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing Tasks.He Huang, Taejin Park, Kunal Dhawan, Ivan Medennikov, Krishna C. Puvvada, Nithin Rao Koluguri, Weiqing Wang, Jagadeesh Balam, Boris Ginsburg
2025ICASSPMETA-CAT: Speaker-Informed Speech Embeddings via Meta Information Concatenation for Multi-talker ASR.Jinhan Wang, Weiqing Wang, Kunal Dhawan, Taejin Park, Myungjong Kim, Ivan Medennikov, He Huang, Nithin Rao Koluguri, Jagadeesh Balam, Boris Ginsburg
2025ICMLSortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems.Taejin Park, Ivan Medennikov, Kunal Dhawan, Weiqing Wang, He Huang, Nithin Rao Koluguri, Krishna C. Puvvada, Jagadeesh Balam, Boris Ginsburg
2025InterspeechSPGISpeech 2.0: Transcribed multi-speaker financial audio for speaker-tagged transcription.Raymond Grossman, Taejin Park, Kunal Dhawan, Andrew Titus, Sophia Zhi, Yulia Shchadilova, Weiqing Wang, Jagadeesh Balam, Boris Ginsburg
2025InterspeechWord Level Timestamp Generation for Automatic Speech Recognition and Translation.Ke Hu, Krishna C. Puvvada, Elena Rastorgueva, Zhehuai Chen, He Huang, Shuoyang Ding, Kunal Dhawan, Hainan Xu, Jagadeesh Balam, Boris Ginsburg
2025InterspeechStreaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering.Ivan Medennikov, Taejin Park, Weiqing Wang, He Huang, Kunal Dhawan, Jinhan Wang, Jagadeesh Balam, Boris Ginsburg
2025InterspeechSpeaker Targeting via Self-Speaker Adaptation for Multi-talker ASR.Weiqing Wang, Taejin Park, Ivan Medennikov, Jinhan Wang, Kunal Dhawan, He Huang, Nithin Rao Koluguri, Jagadeesh Balam, Boris Ginsburg
2025NAACLVoiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech-Text Supervised Fine-Tuning.Yifan Peng, Krishna C. Puvvada, Zhehuai Chen, Piotr Zelasko, He Huang, Kunal Dhawan, Ke Hu, Shinji Watanabe, Jagadeesh Balam, Boris Ginsburg
2024ICASSPEnhancing Speaker Diarization with Large Language Models: A Contextual Beam Search Approach.Taejin Park, Kunal Dhawan, Nithin Rao Koluguri, Jagadeesh Balam
2024ICASSPDiscrete Audio Representation as an Alternative to Mel-Spectrograms for Speaker and Speech Recognition.Krishna C. Puvvada, Nithin Rao Koluguri, Kunal Dhawan, Jagadeesh Balam, Boris Ginsburg
2024InterspeechCodec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations.Kunal Dhawan, Nithin Rao Koluguri, Ante Jukic, Ryan Langman, Jagadeesh Balam, Boris Ginsburg
2024InterspeechLess is More: Accurate Speech Recognition & Translation without Web-Scale Data.Krishna C. Puvvada, Piotr Zelasko, He Huang, Oleksii Hrinchuk, Nithin Rao Koluguri, Kunal Dhawan, Somshubra Majumdar, Elena Rastorgueva, Zhehuai Chen, Vitaly Lavrukhin, Jagadeesh Balam, Boris Ginsburg