Kunal Dhawan
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
14
Venues
6
Active years
2024–2026
Best venue rank
A*
Where they publish
Papers
14 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | ACL | Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception. | Zhen Wan, Chao-Han Huck Yang, Jinchuan Tian, Hanrong Ye, Ankita Pasad, Szu-Wei Fu, Arushi Goel, Ryo Hachiuma, Shizhe Diao, Kunal Dhawan, Sreyan Ghosh, Yusuke Hirota, Zhehuai Chen, Rafael Valle, Chenhui Chu, Shinji Watanabe, Boris Ginsburg, Yu-Chiang Frank Wang |
| 2025 | ASRU | Training and Inference Efficiency of Encoder-Decoder Speech Models. | Piotr Zelasko, Kunal Dhawan, Daniel Galvez, Krishna C. Puvvada, Ankita Pasad, Travis M. Bartley, Nithin Rao Koluguri, Ke Hu, Vitaly Lavrukhin, Jagadeesh Balam, Boris Ginsburg |
| 2025 | ICASSP | NEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing Tasks. | He Huang, Taejin Park, Kunal Dhawan, Ivan Medennikov, Krishna C. Puvvada, Nithin Rao Koluguri, Weiqing Wang, Jagadeesh Balam, Boris Ginsburg |
| 2025 | ICASSP | META-CAT: Speaker-Informed Speech Embeddings via Meta Information Concatenation for Multi-talker ASR. | Jinhan Wang, Weiqing Wang, Kunal Dhawan, Taejin Park, Myungjong Kim, Ivan Medennikov, He Huang, Nithin Rao Koluguri, Jagadeesh Balam, Boris Ginsburg |
| 2025 | ICML | Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems. | Taejin Park, Ivan Medennikov, Kunal Dhawan, Weiqing Wang, He Huang, Nithin Rao Koluguri, Krishna C. Puvvada, Jagadeesh Balam, Boris Ginsburg |
| 2025 | Interspeech | SPGISpeech 2.0: Transcribed multi-speaker financial audio for speaker-tagged transcription. | Raymond Grossman, Taejin Park, Kunal Dhawan, Andrew Titus, Sophia Zhi, Yulia Shchadilova, Weiqing Wang, Jagadeesh Balam, Boris Ginsburg |
| 2025 | Interspeech | Word Level Timestamp Generation for Automatic Speech Recognition and Translation. | Ke Hu, Krishna C. Puvvada, Elena Rastorgueva, Zhehuai Chen, He Huang, Shuoyang Ding, Kunal Dhawan, Hainan Xu, Jagadeesh Balam, Boris Ginsburg |
| 2025 | Interspeech | Streaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering. | Ivan Medennikov, Taejin Park, Weiqing Wang, He Huang, Kunal Dhawan, Jinhan Wang, Jagadeesh Balam, Boris Ginsburg |
| 2025 | Interspeech | Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR. | Weiqing Wang, Taejin Park, Ivan Medennikov, Jinhan Wang, Kunal Dhawan, He Huang, Nithin Rao Koluguri, Jagadeesh Balam, Boris Ginsburg |
| 2025 | NAACL | VoiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech-Text Supervised Fine-Tuning. | Yifan Peng, Krishna C. Puvvada, Zhehuai Chen, Piotr Zelasko, He Huang, Kunal Dhawan, Ke Hu, Shinji Watanabe, Jagadeesh Balam, Boris Ginsburg |
| 2024 | ICASSP | Enhancing Speaker Diarization with Large Language Models: A Contextual Beam Search Approach. | Taejin Park, Kunal Dhawan, Nithin Rao Koluguri, Jagadeesh Balam |
| 2024 | ICASSP | Discrete Audio Representation as an Alternative to Mel-Spectrograms for Speaker and Speech Recognition. | Krishna C. Puvvada, Nithin Rao Koluguri, Kunal Dhawan, Jagadeesh Balam, Boris Ginsburg |
| 2024 | Interspeech | Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations. | Kunal Dhawan, Nithin Rao Koluguri, Ante Jukic, Ryan Langman, Jagadeesh Balam, Boris Ginsburg |
| 2024 | Interspeech | Less is More: Accurate Speech Recognition & Translation without Web-Scale Data. | Krishna C. Puvvada, Piotr Zelasko, He Huang, Oleksii Hrinchuk, Nithin Rao Koluguri, Kunal Dhawan, Somshubra Majumdar, Elena Rastorgueva, Zhehuai Chen, Vitaly Lavrukhin, Jagadeesh Balam, Boris Ginsburg |