| 2026 | ACL | Agentic Very Long Video Understanding. | Aniket Rege, Arka Sadhu, Yuliang Li, Kejie Li, Ramya Korlakai Vinayak, Yuning Chai, Yong Jae Lee, Hyo Jin Kim |
| 2024 | WACV | Leveraging Task-Specific Pre-Training to Reason across Images and Videos. | Arka Sadhu, Ram Nevatia |
| 2021 | CVPR | Visual Semantic Role Labeling for Video Understanding. | Arka Sadhu, Tanmay Gupta, Mark Yatskar, Ram Nevatia, Aniruddha Kembhavi |
| 2021 | ICIP | Improving Object Detection And Attribute Recognition By Feature Entanglement Reduction. | Zhaoheng Zheng, Arka Sadhu, Ram Nevatia |
| 2021 | NAACL | Video Question Answering with Phrases via Semantic Roles. | Arka Sadhu, Kan Chen, Ram Nevatia |
| 2021 | WACV | Utilizing Every Image Object for Semi-supervised Phrase Grounding. | Haidong Zhu, Arka Sadhu, Zhaoheng Zheng, Ram Nevatia |
| 2020 | CVPR | Video Object Grounding Using Semantic Roles in Language Description. | Arka Sadhu, Kan Chen, Ram Nevatia |
| 2020 | EMNLP | Visually Grounded Continual Learning of Compositional Phrases. | Xisen Jin, Junyi Du, Arka Sadhu, Ram Nevatia, Xiang Ren |
| 2019 | ICCV | Zero-Shot Grounding of Objects From Natural Language Queries. | Arka Sadhu, Kan Chen, Ram Nevatia |