Skip to content

Arsha Nagrani

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

46

Venues

10

Active years

2017–2025

Best venue rank

A*

Where they publish

Papers

46 indexed papers, newest first.

YearVenueTitleAuthors
2025CVPRFlexible Frame Selection for Efficient Video Reasoning.Shyamal Buch, Arsha Nagrani, Anurag Arnab, Cordelia Schmid
2025CVPRUnbiasing through Textual Descriptions: Mitigating Representation Bias in Video Benchmarks.Nina Shvetsova, Arsha Nagrani, Bernt Schiele, Hilde Kuehne, Christian Rupprecht
2025ICCVMinerva: Evaluating Complex Video Reasoning.Arsha Nagrani, Sachit Menon, Ahmet Iscen, Shyamal Buch, Ramin Mehran, Nilpa Jha, Anja Hauth, Yukun Zhu, Carl Vondrick, Mikhail Sirotenko, Cordelia Schmid, Tobias Weyand
2025ICCVShot-by-Shot: Film-Grammar-Aware Training-Free Audio Description Generation.Junyu Xie, Tengda Han, Max Bain, Arsha Nagrani, Eshika Khandelwal, Gl Varol, Weidi Xie, Andrew Zisserman
2024ACCVAutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description.Junyu Xie, Tengda Han, Max Bain, Arsha Nagrani, Gl Varol, Weidi Xie, Andrew Zisserman
2024CVPROn Scaling Up a Multilingual Vision and Language Model.Xi Chen, Josip Djolonga, Piotr Padlewski, Basil Mustafa, Soravit Changpinyo, Jialin Wu, Carlos Riquelme Ruiz, Sebastian Goodman, Xiao Wang, Yi Tay, Siamak Shakeri, Mostafa Dehghani, Daniel Salz, Mario Lucic, Michael Tschannen, Arsha Nagrani, Hexiang Hu, Mandar Joshi, Bo Pang, Ceslee Montgomery, Paulina Pietrzyk, Marvin Ritter, A. J. Piergiovanni, Matthias Minderer, Filip Pavetic, Austin Waters, Gang Li, Ibrahim Alabdulmohsin, Lucas Beyer, Julien Amelot, Kenton Lee, Andreas Peter Steiner, Yang Li, Daniel Keysers, Anurag Arnab, Yuanzhong Xu, Keran Rong, Alexander Kolesnikov, Mojtaba Seyedhosseini, Anelia Angelova, Xiaohua Zhai, Neil Houlsby, Radu Soricut
2024CVPRAutoAD III: The Prequel - Back to the Pixels.Tengda Han, Max Bain, Arsha Nagrani, Gl Varol, Weidi Xie, Andrew Zisserman
2024CVPRVicTR: Video-conditioned Text Representations for Activity Recognition.Kumara Kahatapitiya, Anurag Arnab, Arsha Nagrani, Michael S. Ryoo
2024CVPRMoReVQA: Exploring Modular Reasoning Models for Video Question Answering.Juhong Min, Shyamal Buch, Arsha Nagrani, Minsu Cho, Cordelia Schmid
2024CVPRStreaming Dense Video Captioning.Xingyi Zhou, Anurag Arnab, Shyamal Buch, Shen Yan, Austin Myers, Xuehan Xiong, Arsha Nagrani, Cordelia Schmid
2024EMNLPVIEWS: Entity-Aware News Video Captioning.Hammad A. Ayyubi, Tianqi Liu, Arsha Nagrani, Xudong Lin, Mingda Zhang, Anurag Arnab, Feng Han, Yukun Zhu, Xuande Feng, Kevin Zhang, Jialu Liu, Shih-Fu Chang
2023ACLModular Visual Question Answering via Code Generation.Sanjay Subramanian, Medhini Narasimhan, Kushal Khangaonkar, Kevin Yang, Arsha Nagrani, Cordelia Schmid, Andy Zeng, Trevor Darrell, Dan Klein
2023CVPRAutoAD: Movie Description in Context.Tengda Han, Max Bain, Arsha Nagrani, Gl Varol, Weidi Xie, Andrew Zisserman
2023CVPRAVFormer: Injecting Vision into Frozen Speech Models for Zero-Shot AV-ASR.Paul Hongsuck Seo, Arsha Nagrani, Cordelia Schmid
2023CVPRVid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video Captioning.Antoine Yang, Arsha Nagrani, Paul Hongsuck Seo, Antoine Miech, Jordi Pont-Tuset, Ivan Laptev, Josef Sivic, Cordelia Schmid
2023ICCVAutoAD II: The Sequel - Who, When, and What in Movie Audio Description.Tengda Han, Max Bain, Arsha Nagrani, Gl Varol, Weidi Xie, Andrew Zisserman
2023ICCVVerbs in Action: Improving verb understanding in video-language models.Liliane Momeni, Mathilde Caron, Arsha Nagrani, Andrew Zisserman, Cordelia Schmid
2023ICCVUnLoc: A Unified Framework for Video Localization Tasks.Shen Yan, Xuehan Xiong, Arsha Nagrani, Anurag Arnab, Zhonghao Wang, Weina Ge, David Ross, Cordelia Schmid
2023InterspeechLanSER: Language-Model Supported Speech Emotion Recognition.Taesik Gong, Josh Belanich, Krishna Somandepalli, Arsha Nagrani, Brian Eoff, Brendan Jou
2022CVPREnd-to-end Generative Pretraining for Multimodal Video Captioning.Paul Hongsuck Seo, Arsha Nagrani, Anurag Arnab, Cordelia Schmid
2022ECCVLearning Audio-Video Modalities from Image Captions.Arsha Nagrani, Paul Hongsuck Seo, Bryan Seybold, Anja Hauth, Santiago Manen, Chen Sun, Cordelia Schmid
2022ECCVTL;DW? Summarizing Instructional Videos with Task Relevance and Cross-Modal Saliency.Medhini Narasimhan, Arsha Nagrani, Chen Sun, Michael Rubinstein, Trevor Darrell, Anna Rohrbach, Cordelia Schmid
2022InterspeechAVATAR: Unconstrained Audiovisual Speech Recognition.Valentin Gabeur, Paul Hongsuck Seo, Arsha Nagrani, Chen Sun, Karteek Alahari, Cordelia Schmid
2022WACVMasking Modalities for Cross-modal Video Retrieval.Valentin Gabeur, Arsha Nagrani, Chen Sun, Karteek Alahari, Cordelia Schmid
2021BMVCAudio-Visual Synchronisation in the wild.Triantafyllos Afouras, Honglie Chen, Weidi Xie, Arsha Nagrani, Andrea Vedaldi, Andrew Zisserman
2021BMVCWith a Little Help from my Temporal Context: Multimodal Egocentric Action Recognition.Evangelos Kazakos, Jaesung Huh, Arsha Nagrani, Andrew Zisserman, Dima Damen
2021CVPRLocalizing Visual Sounds the Hard Way.Honglie Chen, Weidi Xie, Triantafyllos Afouras, Arsha Nagrani, Andrea Vedaldi, Andrew Zisserman
2021CVPRLook Before You Speak: Visually Contextualized Utterances.Paul Hongsuck Seo, Arsha Nagrani, Cordelia Schmid
2021ICASSPPlaying a Part: Speaker Verification at the movies.Andrew Brown, Jaesung Huh, Arsha Nagrani, Joon Son Chung, Andrew Zisserman
2021ICASSPSlow-Fast Auditory Streams for Audio Recognition.Evangelos Kazakos, Arsha Nagrani, Andrew Zisserman, Dima Damen
2021ICCVComposable Augmentation Encoding for Video Representation Learning.Chen Sun, Arsha Nagrani, Yonglong Tian, Cordelia Schmid
2021ICCVFrozen in Time: A Joint Video and Image Encoder for End-to-End Retrieval.Max Bain, Arsha Nagrani, Gl Varol, Andrew Zisserman
2020ACCVCondensed Movies: Story Based Retrieval with Contextual Embeddings.Max Bain, Arsha Nagrani, Andrew Brown, Andrew Zisserman
2020CVPRSpeech2Action: Cross-Modal Supervision for Action Recognition.Arsha Nagrani, Chen Sun, David Ross, Rahul Sukthankar, Cordelia Schmid, Andrew Zisserman
2020ECCVUncertainty-Aware Weakly Supervised Action Detection from Untrimmed Videos.Anurag Arnab, Chen Sun, Arsha Nagrani, Cordelia Schmid
2020ICASSPDisentangled Speech Embeddings Using Cross-Modal Self-Supervision.Arsha Nagrani, Joon Son Chung, Samuel Albanie, Andrew Zisserman
2020InterspeechSpot the Conversation: Speaker Diarisation in the Wild.Joon Son Chung, Jaesung Huh, Arsha Nagrani, Triantafyllos Afouras, Andrew Zisserman
2019BMVCUse What You Have: Video retrieval using representations from collaborative experts.Yang Liu, Samuel Albanie, Arsha Nagrani, Andrew Zisserman
2019CVPRWiCV 2019: The Sixth Women In Computer Vision Workshop.Irene Amerini, Elena Balashova, Sayna Ebrahimi, Kathryn Leonard, Arsha Nagrani, Amaia Salvador
2019ICASSPUtterance-level Aggregation for Speaker Recognition in the Wild.Weidi Xie, Arsha Nagrani, Joon Son Chung, Andrew Zisserman
2019ICCVEPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition.Evangelos Kazakos, Arsha Nagrani, Andrew Zisserman, Dima Damen
2018CVPRSeeing Voices and Hearing Faces: Cross-Modal Biometric Matching.Arsha Nagrani, Samuel Albanie, Andrew Zisserman
2018ECCVLearnable PINs: Cross-modal Embeddings for Person Identity.Arsha Nagrani, Samuel Albanie, Andrew Zisserman
2018InterspeechVoxCeleb2: Deep Speaker Recognition.Joon Son Chung, Arsha Nagrani, Andrew Zisserman
2017BMVCFrom Benedict Cumberbatch to Sherlock Holmes: Character Identification in TV series without a Script.Arsha Nagrani, Andrew Zisserman
2017InterspeechVoxCeleb: A Large-Scale Speaker Identification Dataset.Arsha Nagrani, Joon Son Chung, Andrew Zisserman