Skip to content

Siddhant Arora

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

52

Venues

14

Active years

2019–2026

Best venue rank

A*

Where they publish

Papers

52 indexed papers, newest first.

YearVenueTitleAuthors
2026ACLOptimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback.Siddhant Arora, Jinchuan Tian, Jiatong Shi, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe
2026ACLFull-Duplex-Bench-v2: A Multi-Turn Evaluation Framework for Duplex Dialogue Systems with an Automated Examiner.Guan-Ting Lin, Shih-Yun Shan Kuan, Jiatong Shi, Kai-Wei Chang, Siddhant Arora, Shinji Watanabe, Hung-Yi Lee
2026ACLPlanRAG-Audio: Planning and Retrieval Augmented Generation for Long-form Audio Understanding.Masao Someki, Chien-Yu Huang, Siddhant Arora, Samuele Cornell, Markus Mller, Nathan Susanj, Rupak Vignesh Swaminathan, Grant P. Strimel, Jing Liu, Shinji Watanabe
2025ASRUAURA: Agent for Understanding, Reasoning, and Automated Tool Use in Voice-Driven Tasks.Leander Melroy Maben, Gayathri Ganesh Lakshmy, Srijith Radhakrishnan, Siddhant Arora, Shinji Watanabe
2025ASRUVERSA-v2: A Modular and Scalable Toolkit for Speech and Audio Evaluation with Expanded Metrics, Visualization, and LLM Integration.Jiatong Shi, Bo-Hao Su, Shikhar Bharadwaj, Yiwen Zhao, Shih-Heng Wang, Jionghao Hang, Haoran Wang, Wei Wang, Wenhao Feng, Yuxun Tang, Nezih Topaloglu, Siddhant Arora, Jinchuan Tian, William Chen, Hye-jin Shim, Wangyou Zhang, Wen-Chin Huang, Shinji Watanabe
2025ASRUSpiralformer: Low Latency Encoder for Streaming Speech Recognition with Circular Layer Skipping and Early Exiting.Emiru Tsunoo, Hayato Futami, Yosuke Kashiwagi, Siddhant Arora, Shinji Watanabe
2025ICASSPHypothesis Clustering and Merging: Novel MultiTalker Speech Recognition with Speaker Tokens.Yosuke Kashiwagi, Hayato Futami, Emiru Tsunoo, Siddhant Arora, Shinji Watanabe
2025ICLRTalking Turns: Benchmarking Audio Foundation Models on Turn-Taking Dynamics.Siddhant Arora, Zhiyun Lu, Chung-Cheng Chiu, Ruoming Pang, Shinji Watanabe
2025ICLRContext-aware Dynamic Pruning for Speech Foundation Models.Masao Someki, Yifan Peng, Siddhant Arora, Markus Mller, Athanasios Mouchtaris, Grant P. Strimel, Jing Liu, Shinji Watanabe
2025InterspeechChain-of-Thought Training for Open E2E Spoken Dialogue Systems.Siddhant Arora, Jinchuan Tian, Hayato Futami, Jee-weon Jung, Jiatong Shi, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe
2025InterspeechScheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs.Hayato Futami, Emiru Tsunoo, Yosuke Kashiwagi, Yuki Ito, Hassan Shahmohammadi, Siddhant Arora, Shinji Watanabe
2025InterspeechScalable Spontaneous Speech Dataset (SSSD): Crowdsourcing Data Collection to Promote Dialogue Research.Zaid Sheikh, Shuichiro Shimizu, Siddhant Arora, Jiatong Shi, Samuele Cornell, Xinjian Li, Shinji Watanabe
2025InterspeechOpusLM: A Family of Open Unified Speech Language Models.Jinchuan Tian, William Chen, Yifan Peng, Jiatong Shi, Siddhant Arora, Shikhar Bharadwaj, Takashi Maekaku, Yusuke Shinohara, Keita Goto, Xiang Yue, Huck Yang, Shinji Watanabe
2025NAACLESPnet-SDS: Unified Toolkit and Demo for Spoken Dialogue Systems.Siddhant Arora, Yifan Peng, Jiatong Shi, Jinchuan Tian, William Chen, Shikhar Bharadwaj, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shuichiro Shimizu, Vaibhav Srivastav, Shinji Watanabe
2025NAACLVERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music.Jiatong Shi, Hye-jin Shim, Jinchuan Tian, Siddhant Arora, Haibin Wu, Darius Petermann, Jia Qi Yip, You Zhang, Yuxun Tang, Wangyou Zhang, Dareen Alharthi, Yichen Huang, Koichi Saito, Jionghao Han, Yiwen Zhao, Chris Donahue, Shinji Watanabe
2025NAACLESPnet-SpeechLM: An Open Speech Language Model Toolkit.Jinchuan Tian, Jiatong Shi, William Chen, Siddhant Arora, Yoshiki Masuyama, Takashi Maekaku, Yihan Wu, Junyi Peng, Shikhar Bharadwaj, Yiwen Zhao, Samuele Cornell, Yifan Peng, Xiang Yue, Chao-Han Huck Yang, Graham Neubig, Shinji Watanabe
2024ACLOn the Evaluation of Speech Foundation Models for Spoken Language Understanding.Siddhant Arora, Ankita Pasad, Chung-Ming Chien, Jionghao Han, Roshan S. Sharma, Jee-weon Jung, Hira Dhamyal, William Chen, Suwon Shon, Hung-yi Lee, Karen Livescu, Shinji Watanabe
2024COLINGCreation and Analysis of an International Corpus of Privacy Laws.Sonu Gupta, Geetika Gopi, Harish Balaji, Ellen Poplavska, Nora O'Toole, Siddhant Arora, Thomas B. Norton, Norman M. Sadeh, Shomir Wilson
2024ICASSPSemi-Autoregressive Streaming ASR with Label Context.Siddhant Arora, George Saon, Shinji Watanabe, Brian Kingsbury
2024ICASSPPhoneme-Aware Encoding for Prefix-Tree-Based Contextual ASR.Hayato Futami, Emiru Tsunoo, Yosuke Kashiwagi, Hiroaki Ogawa, Siddhant Arora, Shinji Watanabe
2024ICASSPDynamic-Superb: Towards a Dynamic, Collaborative, and Comprehensive Instruction-Tuning Benchmark For Speech.Chien-Yu Huang, Ke-Han Lu, Shih-Heng Wang, Chi-Yuan Hsiao, Chun-Yi Kuan, Haibin Wu, Siddhant Arora, Kai-Wei Chang, Jiatong Shi, Yifan Peng, Roshan S. Sharma, Shinji Watanabe, Bhiksha Ramakrishnan, Shady Shehata, Hung-Yi Lee
2024InterspeechFinding Task-specific Subnetworks in Multi-task Spoken Language Understanding Model.Hayato Futami, Siddhant Arora, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe
2024InterspeechTo what extent can ASV systems naturally defend against spoofing attacks?Jee-weon Jung, Xin Wang, Nicholas W. D. Evans, Shinji Watanabe, Hye-jin Shim, Hemlata Tak, Siddhant Arora, Junichi Yamagishi, Joon Son Chung
2024InterspeechRapid Language Adaptation for Multilingual E2E Speech Recognition Using Encoder Prompting.Yosuke Kashiwagi, Hayato Futami, Emiru Tsunoo, Siddhant Arora, Shinji Watanabe
2024InterspeechOWSM v3.1: Better and Faster Open Whisper-Style Speech Models based on E-Branchformer.Yifan Peng, Jinchuan Tian, William Chen, Siddhant Arora, Brian Yan, Yui Sudo, Muhammad Shakeel, Kwanghee Choi, Jiatong Shi, Xuankai Chang, Jee-weon Jung, Shinji Watanabe
2024InterspeechDecoder-only Architecture for Streaming End-to-end Speech Recognition.Emiru Tsunoo, Hayato Futami, Yosuke Kashiwagi, Siddhant Arora, Shinji Watanabe
2024NAACLUniverSLU: Universal Spoken Language Understanding for Diverse Tasks with Natural Language Instructions.Siddhant Arora, Hayato Futami, Jee-weon Jung, Yifan Peng, Roshan S. Sharma, Yosuke Kashiwagi, Emiru Tsunoo, Karen Livescu, Shinji Watanabe
2023ACLSLUE Phase-2: A Benchmark Suite of Diverse Spoken Language Understanding Tasks.Suwon Shon, Siddhant Arora, Chyi-Jiunn Lin, Ankita Pasad, Felix Wu, Roshan S. Sharma, Wei-Lun Wu, Hung-yi Lee, Karen Livescu, Shinji Watanabe
2023ASRUReproducing Whisper-Style Training Using An Open-Source Toolkit And Publicly Available Data.Yifan Peng, Jinchuan Tian, Brian Yan, Dan Berrebbi, Xuankai Chang, Xinjian Li, Jiatong Shi, Siddhant Arora, William Chen, Roshan S. Sharma, Wangyou Zhang, Yui Sudo, Muhammad Shakeel, Jee-Weon Jung, Soumi Maiti, Shinji Watanabe
2023ASRUEspnet-Summ: Introducing a Novel Large Dataset, Toolkit, and a Cross-Corpora Evaluation of Speech Summarization Systems.Roshan S. Sharma, William Chen, Takatomo Kano, Ruchira Sharma, Siddhant Arora, Shinji Watanabe, Atsunori Ogawa, Marc Delcroix, Rita Singh, Bhiksha Raj
2023COMADTeaching Old DB Neu(ral) Tricks: Learning Embeddings on Multi-tabular Databases.Garima Gaur, Rajat Singh, Siddhant Arora, Vinayak Gupta, Srikanta Bedathur
2023ICASSPJoint Modelling of Spoken Language Understanding Tasks with Integrated Dialog History.Siddhant Arora, Hayato Futami, Emiru Tsunoo, Brian Yan, Shinji Watanabe
2023ICASSPA Study on the Integration of Pipeline and E2E SLU Systems for Spoken Semantic Parsing Toward Stop Quality Challenge.Siddhant Arora, Hayato Futami, Shih-Lun Wu, Jessica Huynh, Yifan Peng, Yosuke Kashiwagi, Emiru Tsunoo, Brian Yan, Shinji Watanabe
2023ICASSPThe Pipeline System of ASR and NLU with MLM-based data Augmentation Toward Stop Low-Resource Challenge.Hayato Futami, Jessica Huynh, Siddhant Arora, Shih-Lun Wu, Yosuke Kashiwagi, Yifan Peng, Brian Yan, Emiru Tsunoo, Shinji Watanabe
2023ICASSPStreaming Joint Speech Recognition and Disfluency Detection.Hayato Futami, Emiru Tsunoo, Kentaro Shibata, Yosuke Kashiwagi, Takao Okuda, Siddhant Arora, Shinji Watanabe
2023ICASSPE-Branchformer-Based E2E SLU Toward Stop on-Device Challenge.Yosuke Kashiwagi, Siddhant Arora, Hayato Futami, Jessica Huynh, Shih-Lun Wu, Yifan Peng, Brian Yan, Emiru Tsunoo, Shinji Watanabe
2023InterspeechBASS: Block-wise Adaptation for Speech Summarization.Roshan Sharma, Siddhant Arora, Kenneth Zheng, Shinji Watanabe, Rita Singh, Bhiksha Raj
2023InterspeechIntegrating Pretrained ASR and LM to Perform Sequence Generation for Spoken Language Understanding.Siddhant Arora, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Brian Yan, Shinji Watanabe
2023InterspeechTensor decomposition for minimization of E2E SLU model toward on-device processing.Yosuke Kashiwagi, Siddhant Arora, Hayato Futami, Jessica Huynh, Shih-Lun Wu, Yifan Peng, Brian Yan, Emiru Tsunoo, Shinji Watanabe
2023InterspeechA Comparative Study on E-Branchformer vs Conformer in Speech Recognition, Translation, and Understanding Tasks.Yifan Peng, Kwangyoun Kim, Felix Wu, Brian Yan, Siddhant Arora, William Chen, Jiyang Tang, Suwon Shon, Prashant Sridhar, Shinji Watanabe
2023InterspeechIntegration of Frame- and Label-synchronous Beam Search for Streaming Encoder-decoder Speech Recognition.Emiru Tsunoo, Hayato Futami, Yosuke Kashiwagi, Siddhant Arora, Shinji Watanabe
2022AAAIExplain, Edit, and Understand: Rethinking User Study Design for Evaluating Model Explanations.Siddhant Arora, Danish Pruthi, Norman M. Sadeh, William W. Cohen, Zachary C. Lipton, Graham Neubig
2022EMNLPToken-level Sequence Labeling for Spoken Language Understanding using Compositional End-to-End Models.Siddhant Arora, Siddharth Dalmia, Brian Yan, Florian Metze, Alan W. Black, Shinji Watanabe
2022EMNLPBERT Meets CTC: New Formulation of End-to-End Speech Recognition with Pre-trained Masked Language Model.Yosuke Higuchi, Brian Yan, Siddhant Arora, Tetsuji Ogawa, Tetsunori Kobayashi, Shinji Watanabe
2022ICASSPESPnet-SLU: Advancing Spoken Language Understanding Through ESPnet.Siddhant Arora, Siddharth Dalmia, Pavel Denisov, Xuankai Chang, Yushi Ueda, Yifan Peng, Yuekai Zhang, Sujay Kumar, Karthik Ganesan, Brian Yan, Ngoc Thang Vu, Alan W. Black, Shinji Watanabe
2022InterspeechTwo-Pass Low Latency End-to-End Spoken Language Understanding.Siddhant Arora, Siddharth Dalmia, Xuankai Chang, Brian Yan, Alan W. Black, Shinji Watanabe
2022InterspeechBlockwise Streaming Transformer for Spoken Language Understanding and Simultaneous Speech Translation.Keqi Deng, Shinji Watanabe, Jiatong Shi, Siddhant Arora
2022LRECA Tale of Two Regulatory Regimes: Creation and Analysis of a Bilingual Privacy Policy Corpus.Siddhant Arora, Henry Hosseini, Christine Utz, Vinayshekhar Bannihatti Kumar, Tristan Dhellemmes, Abhilasha Ravichander, Peter Story, Jasmine Mangat, Rex Chen, Martin Degeling, Thomas B. Norton, Thomas Hupperich, Shomir Wilson, Norman M. Sadeh
2021InterspeechRethinking End-to-End Evaluation of Decomposable Tasks: A Case Study on Spoken Language Understanding.Siddhant Arora, Alissa Ostapenko, Vijay Viswanathan, Siddharth Dalmia, Florian Metze, Shinji Watanabe, Alan W. Black
2020WSDMCapreolus: A Toolkit for End-to-End Neural Ad Hoc Retrieval.Andrew Yates, Siddhant Arora, Xinyu Zhang, Wei Yang, Kevin Martin Jose, Jimmy Lin
2019ECIRInvestigating Retrieval Method Selection with Axiomatic Features.Siddhant Arora, Andrew Yates
2019IUIUnderstanding Community Rivalry on Social Media: A Case Study of Two Footballing Giants.Sopan Khosla, Siddhant Arora, Abhilash Nandy, Ankita Saxena, Anandhavelu Natarajan