Skip to content

Sreyan Ghosh

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

44

Venues

12

Active years

2020–2026

Best venue rank

A*

Where they publish

Papers

44 indexed papers, newest first.

YearVenueTitleAuthors
2026AAAIMMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence.Sonal Kumar, Simon Sedlcek, Vaibhavi Lokegaonkar, Fernando Lpez, Wenyi Yu, Nishit Anand, Hyeonggon Ryu, Lichang Chen, Maxim Plicka, Miroslav Hlavcek, William Fineas Ellingwood, Sathvik Udupa, Siyuan Hou, Allison Ferner, Sara Barahona, Cecilia Bolaos, Satish Rahi, Laura Herrera-Alarcn, Satvik Dixit, Rupali S. Patil, Soham Deshmukh, Lasha Koroshinadze, Yao Liu, Leibny Paola Garca-Perera, Eleni Zanou, Themos Stafylakis, Joon Son Chung, David Harwath, Chao Zhang, Dinesh Manocha, Alicia Lozano-Diez, Santosh Kesiraju, Sreyan Ghosh, Ramani Duraiswami
2026ACLFIGMA: Towards FIne-Grained Music retrievAl.Nishit Anand, Ashish Seth, Sreyan Ghosh, Dinesh Manocha, Ramani Duraiswami
2026ACLPolyAudio: Advancing Multi-Audio Reasoning in Large Audio Language Models with Interleaved Multi-Audio Contexts.Sonal Kumar, Sreyan Ghosh, Yueqian Lin, S. Sakshi, Ashish Seth, Yiran Chen, Ramani Duraiswami, Dinesh Manocha
2026ACLSpeech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception.Zhen Wan, Chao-Han Huck Yang, Jinchuan Tian, Hanrong Ye, Ankita Pasad, Szu-Wei Fu, Arushi Goel, Ryo Hachiuma, Shizhe Diao, Kunal Dhawan, Sreyan Ghosh, Yusuke Hirota, Zhehuai Chen, Rafael Valle, Chenhui Chu, Shinji Watanabe, Boris Ginsburg, Yu-Chiang Frank Wang
2025ACLFailing Forward: Improving Generative Error Correction for ASR with Synthetic Data and Retrieval Augmentation.Sreyan Ghosh, Mohammad Sadegh Rasooli, Michael Levit, Peidong Wang, Jian Xue, Dinesh Manocha, Jinyu Li
2025EMNLPMULTIVOX: A Benchmark for Evaluating Voice Assistants for Multimodal Interactions.Ramaneswaran Selvakumar, Ashish Seth, Nishit Anand, Utkarsh Tyagi, Sonal Kumar, Sreyan Ghosh, Dinesh Manocha
2025EMNLPEGOILLUSION: Benchmarking Hallucinations in Egocentric Video Understanding.Ashish Seth, Utkarsh Tyagi, Ramaneswaran Selvakumar, Nishit Anand, Sonal Kumar, Sreyan Ghosh, Ramani Duraiswami, Chirag Agarwal, Dinesh Manocha
2025ICASSPReCLAP: Improving Zero Shot Audio Classification by Describing Sounds.Sreyan Ghosh, Sonal Kumar, Chandra Kiran Reddy Evuru, Oriol Nieto, Ramani Duraiswami, Dinesh Manocha
2025ICASSPLarge Language Models Are Efficient Learners as Zero-Shot Speech Translators.Chenxuan Liu, Liping Chen, Peiwang Tang, Weitai Zhang, Xiaoxi Li, Sreyan Ghosh, Zhongyi Ye, Mingjia Yu
2025ICASSPAdversarial Speech-Text Pre-Training for Speech Translation.Chenxuan Liu, Liping Chen, Weitai Zhang, Xiaoxi Li, Peiwang Tang, Mingjia Yu, Sreyan Ghosh, Zhongyi Ye
2025ICLRVisual Description Grounding Reduces Hallucinations and Boosts Reasoning in LVLMs.Sreyan Ghosh, Chandra Kiran Reddy Evuru, Sonal Kumar, Utkarsh Tyagi, Oriol Nieto, Zeyu Jin, Dinesh Manocha
2025ICLRSynthio: Augmenting Small-Scale Audio Classification Datasets with Synthetic Data.Sreyan Ghosh, Sonal Kumar, Zhifeng Kong, Rafael Valle, Bryan Catanzaro, Dinesh Manocha
2025ICLRMMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark.S. Sakshi, Utkarsh Tyagi, Sonal Kumar, Ashish Seth, Ramaneswaran Selvakumar, Oriol Nieto, Ramani Duraiswami, Sreyan Ghosh, Dinesh Manocha
2025ICMLAudio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities.Sreyan Ghosh, Zhifeng Kong, Sonal Kumar, S. Sakshi, Jaehyeon Kim, Wei Ping, Rafael Valle, Dinesh Manocha, Bryan Catanzaro
2025NAACLProSE: Diffusion Priors for Speech Enhancement.Sonal Kumar, Sreyan Ghosh, Utkarsh Tyagi, Anton Jeran Ratnarajah, Chandra Kiran Reddy Evuru, Ramani Duraiswami, Dinesh Manocha
2025NAACLDo Audio-Language Models Understand Linguistic Variations?Ramaneswaran Selvakumar, Sonal Kumar, Hemant Kumar Giri, Nishit Anand, Ashish Seth, Sreyan Ghosh, Dinesh Manocha
2025NAACLPAT: Parameter-Free Audio-Text Aligner to Boost Zero-Shot Audio Classification.Ashish Seth, Ramaneswaran Selvakumar, Sonal Kumar, Sreyan Ghosh, Dinesh Manocha
2024ACLASPIRE: Language-Guided Data Augmentation for Improving Robustness Against Spurious Correlations.Sreyan Ghosh, Chandra Kiran Reddy Evuru, Sonal Kumar, Utkarsh Tyagi, S. Sakshi, Sanjoy Chowdhury, Dinesh Manocha
2024ACLABEX: Data Augmentation for Low-Resource NLU via Expanding Abstract Descriptions.Sreyan Ghosh, Utkarsh Tyagi, Sonal Kumar, Chandra Kiran Reddy Evuru, Ramaneswaran S., S. Sakshi, Dinesh Manocha
2024CVPRAV-RIR: Audio-Visual Room Impulse Response Estimation.Anton Ratnarajah, Sreyan Ghosh, Sonal Kumar, Purva Chiniya, Dinesh Manocha
2024EMNLPGAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities.Sreyan Ghosh, Sonal Kumar, Ashish Seth, Chandra Kiran Reddy Evuru, Utkarsh Tyagi, S. Sakshi, Oriol Nieto, Ramani Duraiswami, Dinesh Manocha
2024EMNLPEH-MAM: Easy-to-Hard Masked Acoustic Modeling for Self-Supervised Speech Representation Learning.Ashish Seth, Ramaneswaran Selvakumar, S. Sakshi, Sonal Kumar, Sreyan Ghosh, Dinesh Manocha
2024ICASSPRecap: Retrieval-Augmented Audio Captioning.Sreyan Ghosh, Sonal Kumar, Chandra Kiran Reddy Evuru, Ramani Duraiswami, Dinesh Manocha
2024ICASSPStable Distillation: Regularizing Continued Pre-Training for Low-Resource Automatic Speech Recognition.Ashish Seth, Sreyan Ghosh, Srinivasan Umesh, Dinesh Manocha
2024ICASSPFusDom: Combining in-Domain and Out-of-Domain Knowledge for Continuous Self-Supervised Learning.Ashish Seth, Sreyan Ghosh, Srinivasan Umesh, Dinesh Manocha
2024ICLRCompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models.Sreyan Ghosh, Ashish Seth, Sonal Kumar, Utkarsh Tyagi, Chandra Kiran Reddy Evuru, Ramaneswaran S., Sakshi Singh, Oriol Nieto, Ramani Duraiswami, Dinesh Manocha
2024ICMLA Closer Look at the Limitations of Instruction Tuning.Sreyan Ghosh, Chandra Kiran Reddy Evuru, Sonal Kumar, Ramaneswaran S., Deepali Aneja, Zeyu Jin, Ramani Duraiswami, Dinesh Manocha
2024InterspeechLipGER: Visually-Conditioned Generative Error Correction for Robust Automatic Speech Recognition.Sreyan Ghosh, Sonal Kumar, Ashish Seth, Purva Chiniya, Utkarsh Tyagi, Ramani Duraiswami, Dinesh Manocha
2024NAACLCoDa: Constrained Generation based Data Augmentation for Low-Resource NLP.Chandra Kiran Reddy Evuru, Sreyan Ghosh, Sonal Kumar, Ramaneswaran S., Utkarsh Tyagi, Dinesh Manocha
2024NAACLDo Vision-Language Models Understand Compound Nouns?Sonal Kumar, Sreyan Ghosh, S. Sakshi, Utkarsh Tyagi, Dinesh Manocha
2023ACLACLM: A Selective-Denoising based Generative Data Augmentation Approach for Low-Resource Complex NER.Sreyan Ghosh, Utkarsh Tyagi, Manan Suri, Sonal Kumar, Ramaneswaran S., Dinesh Manocha
2023EMNLPDALE: Generative Data Augmentation for Low-Resource Legal NLP.Sreyan Ghosh, Chandra Kiran Reddy Evuru, Sonal Kumar, Ramaneswaran S., Sakshi Singh, Utkarsh Tyagi, Dinesh Manocha
2023EMNLPCoSyn: Detecting Implicit Hate Speech in Online Conversations Using a Context Synergized Hyperbolic Network.Sreyan Ghosh, Manan Suri, Purva Chiniya, Utkarsh Tyagi, Sonal Kumar, Dinesh Manocha
2023ICASSPMAST: Multiscale Audio Spectrogram Transformers.Sreyan Ghosh, Ashish Seth, Srinivasan Umesh, Dinesh Manocha
2023ICASSPData2vec-Aqc: Search for the Right Teaching Assistant in the Teacher-Student Training Setup.Vasista Sai Lodagala, Sreyan Ghosh, Srinivasan Umesh
2023ICASSPUnfused: Unsupervised Finetuning Using Self Supervised Distillation.Ashish Seth, Sreyan Ghosh, Srinivasan Umesh, Dinesh Manocha
2023ICASSPSLICER: Learning Universal Audio Representations Using Low-Resource Self-Supervised Pre-Training.Ashish Seth, Sreyan Ghosh, Srinivasan Umesh, Dinesh Manocha
2023ICCVAdVerb: Visually Guided Audio Dereverberation.Sanjoy Chowdhury, Sreyan Ghosh, Subhrajyoti Dasgupta, Anton Ratnarajah, Utkarsh Tyagi, Dinesh Manocha
2023InterspeechMMER: Multimodal Multi-task Learning for Speech Emotion Recognition.Sreyan Ghosh, Utkarsh Tyagi, S. Ramaneswaran, Harshvardhan Srivastava, Dinesh Manocha
2023SIGIRBioAug: Conditional Generation based Data Augmentation for Low-Resource Biomedical NER.Sreyan Ghosh, Utkarsh Tyagi, Sonal Kumar, Dinesh Manocha
2022COLINGSpan Extraction Aided Improved Code-mixed Sentiment Classification.Ramaneswaran S., Sean Benhur, Sreyan Ghosh
2022InterspeechSpan Classification with Structured Information for Disfluency Detection in Spoken Utterances.Sreyan Ghosh, Sonal Kumar, Yaman Kumar, Rajiv Ratn Shah, Srinivasan Umesh
2022InterspeechDeToxy: A Large-Scale Multimodal Dataset for Toxicity Classification in Spoken Utterances.Sreyan Ghosh, Samden Lepcha, Sakshi Singh, Rajiv Ratn Shah, Srinivasan Umesh
2020InterspeechEnd-to-End Named Entity Recognition from English Speech.Hemant Yadav, Sreyan Ghosh, Yi Yu, Rajiv Ratn Shah