Jagadeesh Balam
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
37
Venues
9
Active years
2006–2025
Best venue rank
A*
Where they publish
Papers
37 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2025 | ACL | NeKo: Cross-Modality Post-Recognition Error Correction with Tasks-Guided Mixture-of-Experts Language Model. | Yen-Ting Lin, Zhehuai Chen, Piotr Zelasko, Zhen Wan, Xuesong Yang, Zih-Ching Chen, Krishna C. Puvvada, Ke Hu, Szu-Wei Fu, Jun Wei Chiu, Jagadeesh Balam, Boris Ginsburg, Yu-Chiang Frank Wang, Chao-Han Huck Yang |
| 2025 | ACL | Genetic Instruct: Scaling up Synthetic Generation of Coding Instructions for Large Language Models. | Somshubra Majumdar, Vahid Noroozi, Mehrzad Samadi, Sean Narenthiran, Aleksander Ficek, Wasi Uddin Ahmad, Jocelyn Huang, Jagadeesh Balam, Boris Ginsburg |
| 2025 | ASRU | Open Full-duplex Voice Agent with Speech-to-Speech Language Model. | Edresson Casanova, Chen Chen, Kevin Hu, Ankita Pasad, Elena Rastorgueva, Seelan Lakshmi Narasimhan, Slyne Deng, Ehsan Hosseini-Asl, Piotr Zelasko, Valentin Mendelev, Subhankar Ghosh, Yifan Peng, Zhehuai Chen, Jason Li, Jagadeesh Balam, Vitaly Lavrukhin, Boris Ginsburg |
| 2025 | ASRU | Training and Inference Efficiency of Encoder-Decoder Speech Models. | Piotr Zelasko, Kunal Dhawan, Daniel Galvez, Krishna C. Puvvada, Ankita Pasad, Travis M. Bartley, Nithin Rao Koluguri, Ke Hu, Vitaly Lavrukhin, Jagadeesh Balam, Boris Ginsburg |
| 2025 | ICASSP | NEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing Tasks. | He Huang, Taejin Park, Kunal Dhawan, Ivan Medennikov, Krishna C. Puvvada, Nithin Rao Koluguri, Weiqing Wang, Jagadeesh Balam, Boris Ginsburg |
| 2025 | ICASSP | Chain-of-Thought Prompting for Speech Translation. | Ke Hu, Zhehuai Chen, Chao-Han Huck Yang, Piotr Zelasko, Oleksii Hrinchuk, Vitaly Lavrukhin, Jagadeesh Balam, Boris Ginsburg |
| 2025 | ICASSP | Developing Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data. | Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu, Chao-Han Huck Yang, Jagadeesh Balam, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-Yi Lee |
| 2025 | ICASSP | META-CAT: Speaker-Informed Speech Embeddings via Meta Information Concatenation for Multi-talker ASR. | Jinhan Wang, Weiqing Wang, Kunal Dhawan, Taejin Park, Myungjong Kim, Ivan Medennikov, He Huang, Nithin Rao Koluguri, Jagadeesh Balam, Boris Ginsburg |
| 2025 | ICASSP | EMMeTT: Efficient Multimodal Machine Translation Training. | Piotr Zelasko, Zhehuai Chen, Mengru Wang, Daniel Galvez, Oleksii Hrinchuk, Shuoyang Ding, Ke Hu, Jagadeesh Balam, Vitaly Lavrukhin, Boris Ginsburg |
| 2025 | ICML | Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems. | Taejin Park, Ivan Medennikov, Kunal Dhawan, Weiqing Wang, He Huang, Nithin Rao Koluguri, Krishna C. Puvvada, Jagadeesh Balam, Boris Ginsburg |
| 2025 | Interspeech | SPGISpeech 2.0: Transcribed multi-speaker financial audio for speaker-tagged transcription. | Raymond Grossman, Taejin Park, Kunal Dhawan, Andrew Titus, Sophia Zhi, Yulia Shchadilova, Weiqing Wang, Jagadeesh Balam, Boris Ginsburg |
| 2025 | Interspeech | Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model. | Ke Hu, Ehsan Hosseini-Asl, Chen Chen, Edresson Casanova, Subhankar Ghosh, Piotr Zelasko, Zhehuai Chen, Jason Li, Jagadeesh Balam, Boris Ginsburg |
| 2025 | Interspeech | Word Level Timestamp Generation for Automatic Speech Recognition and Translation. | Ke Hu, Krishna C. Puvvada, Elena Rastorgueva, Zhehuai Chen, He Huang, Shuoyang Ding, Kunal Dhawan, Hainan Xu, Jagadeesh Balam, Boris Ginsburg |
| 2025 | Interspeech | Granary: Speech Recognition and Translation Dataset in 25 European Languages. | Nithin Rao Koluguri, Monica Sekoyan, George Zelenfroynd, Sasha Meister, Shuoyang Ding, Sofia Kostandian, He Huang, Nikolay Karpov, Jagadeesh Balam, Vitaly Lavrukhin, Yifan Peng, Sara Papi, Marco Gaido, Alessio Brutti, Boris Ginsburg |
| 2025 | Interspeech | Streaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering. | Ivan Medennikov, Taejin Park, Weiqing Wang, He Huang, Kunal Dhawan, Jinhan Wang, Jagadeesh Balam, Boris Ginsburg |
| 2025 | Interspeech | Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR. | Weiqing Wang, Taejin Park, Ivan Medennikov, Jinhan Wang, Kunal Dhawan, He Huang, Nithin Rao Koluguri, Jagadeesh Balam, Boris Ginsburg |
| 2025 | NAACL | Anticipating Future with Large Language Model for Simultaneous Machine Translation. | Siqi Ouyang, Oleksii Hrinchuk, Zhehuai Chen, Vitaly Lavrukhin, Jagadeesh Balam, Lei Li, Boris Ginsburg |
| 2025 | NAACL | VoiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech-Text Supervised Fine-Tuning. | Yifan Peng, Krishna C. Puvvada, Zhehuai Chen, Piotr Zelasko, He Huang, Kunal Dhawan, Ke Hu, Shinji Watanabe, Jagadeesh Balam, Boris Ginsburg |
| 2024 | ICASSP | Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer. | Maxime Burchi, Krishna C. Puvvada, Jagadeesh Balam, Boris Ginsburg, Radu Timofte |
| 2024 | ICASSP | SALM: Speech-Augmented Language Model with in-Context Learning for Speech Recognition and Translation. | Zhehuai Chen, He Huang, Andrei Andrusenko, Oleksii Hrinchuk, Krishna C. Puvvada, Jason Li, Subhankar Ghosh, Jagadeesh Balam, Boris Ginsburg |
| 2024 | ICASSP | Investigating End-to-End ASR Architectures for Long Form Audio Transcription. | Nithin Rao Koluguri, Samuel Kriman, Georgy Zelenfroind, Somshubra Majumdar, Dima Rekesh, Vahid Noroozi, Jagadeesh Balam, Boris Ginsburg |
| 2024 | ICASSP | Stateful Conformer with Cache-Based Inference for Streaming Automatic Speech Recognition. | Vahid Noroozi, Somshubra Majumdar, Ankur Kumar, Jagadeesh Balam, Boris Ginsburg |
| 2024 | ICASSP | Enhancing Speaker Diarization with Large Language Models: A Contextual Beam Search Approach. | Taejin Park, Kunal Dhawan, Nithin Rao Koluguri, Jagadeesh Balam |
| 2024 | ICASSP | Discrete Audio Representation as an Alternative to Mel-Spectrograms for Speaker and Speech Recognition. | Krishna C. Puvvada, Nithin Rao Koluguri, Kunal Dhawan, Jagadeesh Balam, Boris Ginsburg |
| 2024 | Interspeech | Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations. | Kunal Dhawan, Nithin Rao Koluguri, Ante Jukic, Ryan Langman, Jagadeesh Balam, Boris Ginsburg |
| 2024 | Interspeech | Schrdinger Bridge for Generative Speech Enhancement. | Ante Jukic, Roman Korostik, Jagadeesh Balam, Boris Ginsburg |
| 2024 | Interspeech | Instruction Data Generation and Unsupervised Adaptation for Speech Language Models. | Vahid Noroozi, Zhehuai Chen, Somshubra Majumdar, Steve Huang, Jagadeesh Balam, Boris Ginsburg |
| 2024 | Interspeech | Less is More: Accurate Speech Recognition & Translation without Web-Scale Data. | Krishna C. Puvvada, Piotr Zelasko, He Huang, Oleksii Hrinchuk, Nithin Rao Koluguri, Kunal Dhawan, Somshubra Majumdar, Elena Rastorgueva, Zhehuai Chen, Vitaly Lavrukhin, Jagadeesh Balam, Boris Ginsburg |
| 2023 | ASRU | Fast Conformer With Linearly Scalable Attention For Efficient Speech Recognition. | Dima Rekesh, Nithin Rao Koluguri, Samuel Kriman, Somshubra Majumdar, Vahid Noroozi, He Huang, Oleksii Hrinchuk, Krishna C. Puvvada, Ankur Kumar, Jagadeesh Balam, Boris Ginsburg |
| 2023 | Interspeech | Leveraging Pretrained ASR Encoders for Effective and Efficient End-to-End Speech Intent Classification and Slot Filling. | He Huang, Jagadeesh Balam, Boris Ginsburg |
| 2023 | Interspeech | A Compact End-to-End Model with Local and Global Context for Spoken Language Identification. | Fei Jia, Nithin Rao Koluguri, Jagadeesh Balam, Boris Ginsburg |
| 2022 | Interspeech | Multi-scale Speaker Diarization with Dynamic Scale Weighting. | Taejin Park, Nithin Rao Koluguri, Jagadeesh Balam, Boris Ginsburg |
| 2022 | Interspeech | NeMo Open Source Speaker Diarization System. | Taejin Park, Nithin Rao Koluguri, Fei Jia, Jagadeesh Balam, Boris Ginsburg |
| 2021 | Interspeech | SPGISpeech: 5, 000 Hours of Transcribed Financial Audio for Fully Formatted End-to-End Speech Recognition. | Patrick K. O'Neill, Vitaly Lavrukhin, Somshubra Majumdar, Vahid Noroozi, Yuekai Zhang, Oleksii Kuchaiev, Jagadeesh Balam, Yuliya Dovzhenko, Keenan Freyberg, Michael D. Shulman, Boris Ginsburg, Shinji Watanabe, Georg Kucsko |
| 2008 | WCNC | A Transcoding-Free Multiple Description Coder for Voice over Mobile Ad-Hoc Networks. | Jagadeesh Balam, Jerry D. Gibson |
| 2007 | GLOBECOM | Two-Hop Two-Path Voice Communications Over a Mobile Ad-Hoc Network. | Jagadeesh Balam, Jerry D. Gibson |
| 2006 | IWCMC | Multiple descriptions and path diversity using the AMR-WB speech codec for voice communication over MANETs. | Jagadeesh Balam, Jerry D. Gibson |