Siddhant Arora
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
52
Venues
14
Active years
2019–2026
Best venue rank
A*
Where they publish
Papers
52 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | ACL | Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback. | Siddhant Arora, Jinchuan Tian, Jiatong Shi, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe |
| 2026 | ACL | Full-Duplex-Bench-v2: A Multi-Turn Evaluation Framework for Duplex Dialogue Systems with an Automated Examiner. | Guan-Ting Lin, Shih-Yun Shan Kuan, Jiatong Shi, Kai-Wei Chang, Siddhant Arora, Shinji Watanabe, Hung-Yi Lee |
| 2026 | ACL | PlanRAG-Audio: Planning and Retrieval Augmented Generation for Long-form Audio Understanding. | Masao Someki, Chien-Yu Huang, Siddhant Arora, Samuele Cornell, Markus Mller, Nathan Susanj, Rupak Vignesh Swaminathan, Grant P. Strimel, Jing Liu, Shinji Watanabe |
| 2025 | ASRU | AURA: Agent for Understanding, Reasoning, and Automated Tool Use in Voice-Driven Tasks. | Leander Melroy Maben, Gayathri Ganesh Lakshmy, Srijith Radhakrishnan, Siddhant Arora, Shinji Watanabe |
| 2025 | ASRU | VERSA-v2: A Modular and Scalable Toolkit for Speech and Audio Evaluation with Expanded Metrics, Visualization, and LLM Integration. | Jiatong Shi, Bo-Hao Su, Shikhar Bharadwaj, Yiwen Zhao, Shih-Heng Wang, Jionghao Hang, Haoran Wang, Wei Wang, Wenhao Feng, Yuxun Tang, Nezih Topaloglu, Siddhant Arora, Jinchuan Tian, William Chen, Hye-jin Shim, Wangyou Zhang, Wen-Chin Huang, Shinji Watanabe |
| 2025 | ASRU | Spiralformer: Low Latency Encoder for Streaming Speech Recognition with Circular Layer Skipping and Early Exiting. | Emiru Tsunoo, Hayato Futami, Yosuke Kashiwagi, Siddhant Arora, Shinji Watanabe |
| 2025 | ICASSP | Hypothesis Clustering and Merging: Novel MultiTalker Speech Recognition with Speaker Tokens. | Yosuke Kashiwagi, Hayato Futami, Emiru Tsunoo, Siddhant Arora, Shinji Watanabe |
| 2025 | ICLR | Talking Turns: Benchmarking Audio Foundation Models on Turn-Taking Dynamics. | Siddhant Arora, Zhiyun Lu, Chung-Cheng Chiu, Ruoming Pang, Shinji Watanabe |
| 2025 | ICLR | Context-aware Dynamic Pruning for Speech Foundation Models. | Masao Someki, Yifan Peng, Siddhant Arora, Markus Mller, Athanasios Mouchtaris, Grant P. Strimel, Jing Liu, Shinji Watanabe |
| 2025 | Interspeech | Chain-of-Thought Training for Open E2E Spoken Dialogue Systems. | Siddhant Arora, Jinchuan Tian, Hayato Futami, Jee-weon Jung, Jiatong Shi, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe |
| 2025 | Interspeech | Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs. | Hayato Futami, Emiru Tsunoo, Yosuke Kashiwagi, Yuki Ito, Hassan Shahmohammadi, Siddhant Arora, Shinji Watanabe |
| 2025 | Interspeech | Scalable Spontaneous Speech Dataset (SSSD): Crowdsourcing Data Collection to Promote Dialogue Research. | Zaid Sheikh, Shuichiro Shimizu, Siddhant Arora, Jiatong Shi, Samuele Cornell, Xinjian Li, Shinji Watanabe |
| 2025 | Interspeech | OpusLM: A Family of Open Unified Speech Language Models. | Jinchuan Tian, William Chen, Yifan Peng, Jiatong Shi, Siddhant Arora, Shikhar Bharadwaj, Takashi Maekaku, Yusuke Shinohara, Keita Goto, Xiang Yue, Huck Yang, Shinji Watanabe |
| 2025 | NAACL | ESPnet-SDS: Unified Toolkit and Demo for Spoken Dialogue Systems. | Siddhant Arora, Yifan Peng, Jiatong Shi, Jinchuan Tian, William Chen, Shikhar Bharadwaj, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shuichiro Shimizu, Vaibhav Srivastav, Shinji Watanabe |
| 2025 | NAACL | VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music. | Jiatong Shi, Hye-jin Shim, Jinchuan Tian, Siddhant Arora, Haibin Wu, Darius Petermann, Jia Qi Yip, You Zhang, Yuxun Tang, Wangyou Zhang, Dareen Alharthi, Yichen Huang, Koichi Saito, Jionghao Han, Yiwen Zhao, Chris Donahue, Shinji Watanabe |
| 2025 | NAACL | ESPnet-SpeechLM: An Open Speech Language Model Toolkit. | Jinchuan Tian, Jiatong Shi, William Chen, Siddhant Arora, Yoshiki Masuyama, Takashi Maekaku, Yihan Wu, Junyi Peng, Shikhar Bharadwaj, Yiwen Zhao, Samuele Cornell, Yifan Peng, Xiang Yue, Chao-Han Huck Yang, Graham Neubig, Shinji Watanabe |
| 2024 | ACL | On the Evaluation of Speech Foundation Models for Spoken Language Understanding. | Siddhant Arora, Ankita Pasad, Chung-Ming Chien, Jionghao Han, Roshan S. Sharma, Jee-weon Jung, Hira Dhamyal, William Chen, Suwon Shon, Hung-yi Lee, Karen Livescu, Shinji Watanabe |
| 2024 | COLING | Creation and Analysis of an International Corpus of Privacy Laws. | Sonu Gupta, Geetika Gopi, Harish Balaji, Ellen Poplavska, Nora O'Toole, Siddhant Arora, Thomas B. Norton, Norman M. Sadeh, Shomir Wilson |
| 2024 | ICASSP | Semi-Autoregressive Streaming ASR with Label Context. | Siddhant Arora, George Saon, Shinji Watanabe, Brian Kingsbury |
| 2024 | ICASSP | Phoneme-Aware Encoding for Prefix-Tree-Based Contextual ASR. | Hayato Futami, Emiru Tsunoo, Yosuke Kashiwagi, Hiroaki Ogawa, Siddhant Arora, Shinji Watanabe |
| 2024 | ICASSP | Dynamic-Superb: Towards a Dynamic, Collaborative, and Comprehensive Instruction-Tuning Benchmark For Speech. | Chien-Yu Huang, Ke-Han Lu, Shih-Heng Wang, Chi-Yuan Hsiao, Chun-Yi Kuan, Haibin Wu, Siddhant Arora, Kai-Wei Chang, Jiatong Shi, Yifan Peng, Roshan S. Sharma, Shinji Watanabe, Bhiksha Ramakrishnan, Shady Shehata, Hung-Yi Lee |
| 2024 | Interspeech | Finding Task-specific Subnetworks in Multi-task Spoken Language Understanding Model. | Hayato Futami, Siddhant Arora, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe |
| 2024 | Interspeech | To what extent can ASV systems naturally defend against spoofing attacks? | Jee-weon Jung, Xin Wang, Nicholas W. D. Evans, Shinji Watanabe, Hye-jin Shim, Hemlata Tak, Siddhant Arora, Junichi Yamagishi, Joon Son Chung |
| 2024 | Interspeech | Rapid Language Adaptation for Multilingual E2E Speech Recognition Using Encoder Prompting. | Yosuke Kashiwagi, Hayato Futami, Emiru Tsunoo, Siddhant Arora, Shinji Watanabe |
| 2024 | Interspeech | OWSM v3.1: Better and Faster Open Whisper-Style Speech Models based on E-Branchformer. | Yifan Peng, Jinchuan Tian, William Chen, Siddhant Arora, Brian Yan, Yui Sudo, Muhammad Shakeel, Kwanghee Choi, Jiatong Shi, Xuankai Chang, Jee-weon Jung, Shinji Watanabe |
| 2024 | Interspeech | Decoder-only Architecture for Streaming End-to-end Speech Recognition. | Emiru Tsunoo, Hayato Futami, Yosuke Kashiwagi, Siddhant Arora, Shinji Watanabe |
| 2024 | NAACL | UniverSLU: Universal Spoken Language Understanding for Diverse Tasks with Natural Language Instructions. | Siddhant Arora, Hayato Futami, Jee-weon Jung, Yifan Peng, Roshan S. Sharma, Yosuke Kashiwagi, Emiru Tsunoo, Karen Livescu, Shinji Watanabe |
| 2023 | ACL | SLUE Phase-2: A Benchmark Suite of Diverse Spoken Language Understanding Tasks. | Suwon Shon, Siddhant Arora, Chyi-Jiunn Lin, Ankita Pasad, Felix Wu, Roshan S. Sharma, Wei-Lun Wu, Hung-yi Lee, Karen Livescu, Shinji Watanabe |
| 2023 | ASRU | Reproducing Whisper-Style Training Using An Open-Source Toolkit And Publicly Available Data. | Yifan Peng, Jinchuan Tian, Brian Yan, Dan Berrebbi, Xuankai Chang, Xinjian Li, Jiatong Shi, Siddhant Arora, William Chen, Roshan S. Sharma, Wangyou Zhang, Yui Sudo, Muhammad Shakeel, Jee-Weon Jung, Soumi Maiti, Shinji Watanabe |
| 2023 | ASRU | Espnet-Summ: Introducing a Novel Large Dataset, Toolkit, and a Cross-Corpora Evaluation of Speech Summarization Systems. | Roshan S. Sharma, William Chen, Takatomo Kano, Ruchira Sharma, Siddhant Arora, Shinji Watanabe, Atsunori Ogawa, Marc Delcroix, Rita Singh, Bhiksha Raj |
| 2023 | COMAD | Teaching Old DB Neu(ral) Tricks: Learning Embeddings on Multi-tabular Databases. | Garima Gaur, Rajat Singh, Siddhant Arora, Vinayak Gupta, Srikanta Bedathur |
| 2023 | ICASSP | Joint Modelling of Spoken Language Understanding Tasks with Integrated Dialog History. | Siddhant Arora, Hayato Futami, Emiru Tsunoo, Brian Yan, Shinji Watanabe |
| 2023 | ICASSP | A Study on the Integration of Pipeline and E2E SLU Systems for Spoken Semantic Parsing Toward Stop Quality Challenge. | Siddhant Arora, Hayato Futami, Shih-Lun Wu, Jessica Huynh, Yifan Peng, Yosuke Kashiwagi, Emiru Tsunoo, Brian Yan, Shinji Watanabe |
| 2023 | ICASSP | The Pipeline System of ASR and NLU with MLM-based data Augmentation Toward Stop Low-Resource Challenge. | Hayato Futami, Jessica Huynh, Siddhant Arora, Shih-Lun Wu, Yosuke Kashiwagi, Yifan Peng, Brian Yan, Emiru Tsunoo, Shinji Watanabe |
| 2023 | ICASSP | Streaming Joint Speech Recognition and Disfluency Detection. | Hayato Futami, Emiru Tsunoo, Kentaro Shibata, Yosuke Kashiwagi, Takao Okuda, Siddhant Arora, Shinji Watanabe |
| 2023 | ICASSP | E-Branchformer-Based E2E SLU Toward Stop on-Device Challenge. | Yosuke Kashiwagi, Siddhant Arora, Hayato Futami, Jessica Huynh, Shih-Lun Wu, Yifan Peng, Brian Yan, Emiru Tsunoo, Shinji Watanabe |
| 2023 | Interspeech | BASS: Block-wise Adaptation for Speech Summarization. | Roshan Sharma, Siddhant Arora, Kenneth Zheng, Shinji Watanabe, Rita Singh, Bhiksha Raj |
| 2023 | Interspeech | Integrating Pretrained ASR and LM to Perform Sequence Generation for Spoken Language Understanding. | Siddhant Arora, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Brian Yan, Shinji Watanabe |
| 2023 | Interspeech | Tensor decomposition for minimization of E2E SLU model toward on-device processing. | Yosuke Kashiwagi, Siddhant Arora, Hayato Futami, Jessica Huynh, Shih-Lun Wu, Yifan Peng, Brian Yan, Emiru Tsunoo, Shinji Watanabe |
| 2023 | Interspeech | A Comparative Study on E-Branchformer vs Conformer in Speech Recognition, Translation, and Understanding Tasks. | Yifan Peng, Kwangyoun Kim, Felix Wu, Brian Yan, Siddhant Arora, William Chen, Jiyang Tang, Suwon Shon, Prashant Sridhar, Shinji Watanabe |
| 2023 | Interspeech | Integration of Frame- and Label-synchronous Beam Search for Streaming Encoder-decoder Speech Recognition. | Emiru Tsunoo, Hayato Futami, Yosuke Kashiwagi, Siddhant Arora, Shinji Watanabe |
| 2022 | AAAI | Explain, Edit, and Understand: Rethinking User Study Design for Evaluating Model Explanations. | Siddhant Arora, Danish Pruthi, Norman M. Sadeh, William W. Cohen, Zachary C. Lipton, Graham Neubig |
| 2022 | EMNLP | Token-level Sequence Labeling for Spoken Language Understanding using Compositional End-to-End Models. | Siddhant Arora, Siddharth Dalmia, Brian Yan, Florian Metze, Alan W. Black, Shinji Watanabe |
| 2022 | EMNLP | BERT Meets CTC: New Formulation of End-to-End Speech Recognition with Pre-trained Masked Language Model. | Yosuke Higuchi, Brian Yan, Siddhant Arora, Tetsuji Ogawa, Tetsunori Kobayashi, Shinji Watanabe |
| 2022 | ICASSP | ESPnet-SLU: Advancing Spoken Language Understanding Through ESPnet. | Siddhant Arora, Siddharth Dalmia, Pavel Denisov, Xuankai Chang, Yushi Ueda, Yifan Peng, Yuekai Zhang, Sujay Kumar, Karthik Ganesan, Brian Yan, Ngoc Thang Vu, Alan W. Black, Shinji Watanabe |
| 2022 | Interspeech | Two-Pass Low Latency End-to-End Spoken Language Understanding. | Siddhant Arora, Siddharth Dalmia, Xuankai Chang, Brian Yan, Alan W. Black, Shinji Watanabe |
| 2022 | Interspeech | Blockwise Streaming Transformer for Spoken Language Understanding and Simultaneous Speech Translation. | Keqi Deng, Shinji Watanabe, Jiatong Shi, Siddhant Arora |
| 2022 | LREC | A Tale of Two Regulatory Regimes: Creation and Analysis of a Bilingual Privacy Policy Corpus. | Siddhant Arora, Henry Hosseini, Christine Utz, Vinayshekhar Bannihatti Kumar, Tristan Dhellemmes, Abhilasha Ravichander, Peter Story, Jasmine Mangat, Rex Chen, Martin Degeling, Thomas B. Norton, Thomas Hupperich, Shomir Wilson, Norman M. Sadeh |
| 2021 | Interspeech | Rethinking End-to-End Evaluation of Decomposable Tasks: A Case Study on Spoken Language Understanding. | Siddhant Arora, Alissa Ostapenko, Vijay Viswanathan, Siddharth Dalmia, Florian Metze, Shinji Watanabe, Alan W. Black |
| 2020 | WSDM | Capreolus: A Toolkit for End-to-End Neural Ad Hoc Retrieval. | Andrew Yates, Siddhant Arora, Xinyu Zhang, Wei Yang, Kevin Martin Jose, Jimmy Lin |
| 2019 | ECIR | Investigating Retrieval Method Selection with Axiomatic Features. | Siddhant Arora, Andrew Yates |
| 2019 | IUI | Understanding Community Rivalry on Social Media: A Case Study of Two Footballing Giants. | Sopan Khosla, Siddhant Arora, Abhilash Nandy, Ankita Saxena, Anandhavelu Natarajan |