Arsha Nagrani
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
46
Venues
10
Active years
2017–2025
Best venue rank
A*
Where they publish
Papers
46 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2025 | CVPR | Flexible Frame Selection for Efficient Video Reasoning. | Shyamal Buch, Arsha Nagrani, Anurag Arnab, Cordelia Schmid |
| 2025 | CVPR | Unbiasing through Textual Descriptions: Mitigating Representation Bias in Video Benchmarks. | Nina Shvetsova, Arsha Nagrani, Bernt Schiele, Hilde Kuehne, Christian Rupprecht |
| 2025 | ICCV | Minerva: Evaluating Complex Video Reasoning. | Arsha Nagrani, Sachit Menon, Ahmet Iscen, Shyamal Buch, Ramin Mehran, Nilpa Jha, Anja Hauth, Yukun Zhu, Carl Vondrick, Mikhail Sirotenko, Cordelia Schmid, Tobias Weyand |
| 2025 | ICCV | Shot-by-Shot: Film-Grammar-Aware Training-Free Audio Description Generation. | Junyu Xie, Tengda Han, Max Bain, Arsha Nagrani, Eshika Khandelwal, Gl Varol, Weidi Xie, Andrew Zisserman |
| 2024 | ACCV | AutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description. | Junyu Xie, Tengda Han, Max Bain, Arsha Nagrani, Gl Varol, Weidi Xie, Andrew Zisserman |
| 2024 | CVPR | On Scaling Up a Multilingual Vision and Language Model. | Xi Chen, Josip Djolonga, Piotr Padlewski, Basil Mustafa, Soravit Changpinyo, Jialin Wu, Carlos Riquelme Ruiz, Sebastian Goodman, Xiao Wang, Yi Tay, Siamak Shakeri, Mostafa Dehghani, Daniel Salz, Mario Lucic, Michael Tschannen, Arsha Nagrani, Hexiang Hu, Mandar Joshi, Bo Pang, Ceslee Montgomery, Paulina Pietrzyk, Marvin Ritter, A. J. Piergiovanni, Matthias Minderer, Filip Pavetic, Austin Waters, Gang Li, Ibrahim Alabdulmohsin, Lucas Beyer, Julien Amelot, Kenton Lee, Andreas Peter Steiner, Yang Li, Daniel Keysers, Anurag Arnab, Yuanzhong Xu, Keran Rong, Alexander Kolesnikov, Mojtaba Seyedhosseini, Anelia Angelova, Xiaohua Zhai, Neil Houlsby, Radu Soricut |
| 2024 | CVPR | AutoAD III: The Prequel - Back to the Pixels. | Tengda Han, Max Bain, Arsha Nagrani, Gl Varol, Weidi Xie, Andrew Zisserman |
| 2024 | CVPR | VicTR: Video-conditioned Text Representations for Activity Recognition. | Kumara Kahatapitiya, Anurag Arnab, Arsha Nagrani, Michael S. Ryoo |
| 2024 | CVPR | MoReVQA: Exploring Modular Reasoning Models for Video Question Answering. | Juhong Min, Shyamal Buch, Arsha Nagrani, Minsu Cho, Cordelia Schmid |
| 2024 | CVPR | Streaming Dense Video Captioning. | Xingyi Zhou, Anurag Arnab, Shyamal Buch, Shen Yan, Austin Myers, Xuehan Xiong, Arsha Nagrani, Cordelia Schmid |
| 2024 | EMNLP | VIEWS: Entity-Aware News Video Captioning. | Hammad A. Ayyubi, Tianqi Liu, Arsha Nagrani, Xudong Lin, Mingda Zhang, Anurag Arnab, Feng Han, Yukun Zhu, Xuande Feng, Kevin Zhang, Jialu Liu, Shih-Fu Chang |
| 2023 | ACL | Modular Visual Question Answering via Code Generation. | Sanjay Subramanian, Medhini Narasimhan, Kushal Khangaonkar, Kevin Yang, Arsha Nagrani, Cordelia Schmid, Andy Zeng, Trevor Darrell, Dan Klein |
| 2023 | CVPR | AutoAD: Movie Description in Context. | Tengda Han, Max Bain, Arsha Nagrani, Gl Varol, Weidi Xie, Andrew Zisserman |
| 2023 | CVPR | AVFormer: Injecting Vision into Frozen Speech Models for Zero-Shot AV-ASR. | Paul Hongsuck Seo, Arsha Nagrani, Cordelia Schmid |
| 2023 | CVPR | Vid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video Captioning. | Antoine Yang, Arsha Nagrani, Paul Hongsuck Seo, Antoine Miech, Jordi Pont-Tuset, Ivan Laptev, Josef Sivic, Cordelia Schmid |
| 2023 | ICCV | AutoAD II: The Sequel - Who, When, and What in Movie Audio Description. | Tengda Han, Max Bain, Arsha Nagrani, Gl Varol, Weidi Xie, Andrew Zisserman |
| 2023 | ICCV | Verbs in Action: Improving verb understanding in video-language models. | Liliane Momeni, Mathilde Caron, Arsha Nagrani, Andrew Zisserman, Cordelia Schmid |
| 2023 | ICCV | UnLoc: A Unified Framework for Video Localization Tasks. | Shen Yan, Xuehan Xiong, Arsha Nagrani, Anurag Arnab, Zhonghao Wang, Weina Ge, David Ross, Cordelia Schmid |
| 2023 | Interspeech | LanSER: Language-Model Supported Speech Emotion Recognition. | Taesik Gong, Josh Belanich, Krishna Somandepalli, Arsha Nagrani, Brian Eoff, Brendan Jou |
| 2022 | CVPR | End-to-end Generative Pretraining for Multimodal Video Captioning. | Paul Hongsuck Seo, Arsha Nagrani, Anurag Arnab, Cordelia Schmid |
| 2022 | ECCV | Learning Audio-Video Modalities from Image Captions. | Arsha Nagrani, Paul Hongsuck Seo, Bryan Seybold, Anja Hauth, Santiago Manen, Chen Sun, Cordelia Schmid |
| 2022 | ECCV | TL;DW? Summarizing Instructional Videos with Task Relevance and Cross-Modal Saliency. | Medhini Narasimhan, Arsha Nagrani, Chen Sun, Michael Rubinstein, Trevor Darrell, Anna Rohrbach, Cordelia Schmid |
| 2022 | Interspeech | AVATAR: Unconstrained Audiovisual Speech Recognition. | Valentin Gabeur, Paul Hongsuck Seo, Arsha Nagrani, Chen Sun, Karteek Alahari, Cordelia Schmid |
| 2022 | WACV | Masking Modalities for Cross-modal Video Retrieval. | Valentin Gabeur, Arsha Nagrani, Chen Sun, Karteek Alahari, Cordelia Schmid |
| 2021 | BMVC | Audio-Visual Synchronisation in the wild. | Triantafyllos Afouras, Honglie Chen, Weidi Xie, Arsha Nagrani, Andrea Vedaldi, Andrew Zisserman |
| 2021 | BMVC | With a Little Help from my Temporal Context: Multimodal Egocentric Action Recognition. | Evangelos Kazakos, Jaesung Huh, Arsha Nagrani, Andrew Zisserman, Dima Damen |
| 2021 | CVPR | Localizing Visual Sounds the Hard Way. | Honglie Chen, Weidi Xie, Triantafyllos Afouras, Arsha Nagrani, Andrea Vedaldi, Andrew Zisserman |
| 2021 | CVPR | Look Before You Speak: Visually Contextualized Utterances. | Paul Hongsuck Seo, Arsha Nagrani, Cordelia Schmid |
| 2021 | ICASSP | Playing a Part: Speaker Verification at the movies. | Andrew Brown, Jaesung Huh, Arsha Nagrani, Joon Son Chung, Andrew Zisserman |
| 2021 | ICASSP | Slow-Fast Auditory Streams for Audio Recognition. | Evangelos Kazakos, Arsha Nagrani, Andrew Zisserman, Dima Damen |
| 2021 | ICCV | Composable Augmentation Encoding for Video Representation Learning. | Chen Sun, Arsha Nagrani, Yonglong Tian, Cordelia Schmid |
| 2021 | ICCV | Frozen in Time: A Joint Video and Image Encoder for End-to-End Retrieval. | Max Bain, Arsha Nagrani, Gl Varol, Andrew Zisserman |
| 2020 | ACCV | Condensed Movies: Story Based Retrieval with Contextual Embeddings. | Max Bain, Arsha Nagrani, Andrew Brown, Andrew Zisserman |
| 2020 | CVPR | Speech2Action: Cross-Modal Supervision for Action Recognition. | Arsha Nagrani, Chen Sun, David Ross, Rahul Sukthankar, Cordelia Schmid, Andrew Zisserman |
| 2020 | ECCV | Uncertainty-Aware Weakly Supervised Action Detection from Untrimmed Videos. | Anurag Arnab, Chen Sun, Arsha Nagrani, Cordelia Schmid |
| 2020 | ICASSP | Disentangled Speech Embeddings Using Cross-Modal Self-Supervision. | Arsha Nagrani, Joon Son Chung, Samuel Albanie, Andrew Zisserman |
| 2020 | Interspeech | Spot the Conversation: Speaker Diarisation in the Wild. | Joon Son Chung, Jaesung Huh, Arsha Nagrani, Triantafyllos Afouras, Andrew Zisserman |
| 2019 | BMVC | Use What You Have: Video retrieval using representations from collaborative experts. | Yang Liu, Samuel Albanie, Arsha Nagrani, Andrew Zisserman |
| 2019 | CVPR | WiCV 2019: The Sixth Women In Computer Vision Workshop. | Irene Amerini, Elena Balashova, Sayna Ebrahimi, Kathryn Leonard, Arsha Nagrani, Amaia Salvador |
| 2019 | ICASSP | Utterance-level Aggregation for Speaker Recognition in the Wild. | Weidi Xie, Arsha Nagrani, Joon Son Chung, Andrew Zisserman |
| 2019 | ICCV | EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition. | Evangelos Kazakos, Arsha Nagrani, Andrew Zisserman, Dima Damen |
| 2018 | CVPR | Seeing Voices and Hearing Faces: Cross-Modal Biometric Matching. | Arsha Nagrani, Samuel Albanie, Andrew Zisserman |
| 2018 | ECCV | Learnable PINs: Cross-modal Embeddings for Person Identity. | Arsha Nagrani, Samuel Albanie, Andrew Zisserman |
| 2018 | Interspeech | VoxCeleb2: Deep Speaker Recognition. | Joon Son Chung, Arsha Nagrani, Andrew Zisserman |
| 2017 | BMVC | From Benedict Cumberbatch to Sherlock Holmes: Character Identification in TV series without a Script. | Arsha Nagrani, Andrew Zisserman |
| 2017 | Interspeech | VoxCeleb: A Large-Scale Speaker Identification Dataset. | Arsha Nagrani, Joon Son Chung, Andrew Zisserman |