Skip to content

Rohit Girdhar

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

31

Venues

7

Active years

2014–2025

Best venue rank

A*

Where they publish

Papers

31 indexed papers, newest first.

YearVenueTitleAuthors
2025CVPRMotiF: Making Text Count in Image Animation with Motion Focal Loss.Shijie Wang, Samaneh Azadi, Rohit Girdhar, Saketh Rambhatla, Chen Sun, Xi Yin
2025ICMLLLMs can see and hear without any training.Kumar Ashutosh, Yossi Gandelsman, Xinlei Chen, Ishan Misra, Rohit Girdhar
2024CVPRInstanceDiffusion: Instance-Level Control for Image Generation.Xudong Wang, Trevor Darrell, Sai Saketh Rambhatla, Rohit Girdhar, Ishan Misra
2024CVPRVideoCutLER: Surprisingly Simple Unsupervised Video Instance Segmentation.Xudong Wang, Ishan Misra, Ziyun Zeng, Rohit Girdhar, Trevor Darrell
2024CVPRSoundingActions: Learning How Actions Sound from Narrated Egocentric Videos.Changan Chen, Kumar Ashutosh, Rohit Girdhar, David Harwath, Kristen Grauman
2024CVPRGenerating Illustrated Instructions.Sachit Menon, Ishan Misra, Rohit Girdhar
2024ECCVFactorizing Text-to-Video Generation by Explicit Image Conditioning.Rohit Girdhar, Mannat Singh, Andrew Brown, Quentin Duval, Samaneh Azadi, Sai Saketh Rambhatla, Akbar Shah, Xi Yin, Devi Parikh, Ishan Misra
2023CVPRLearning Video Representations from Large Language Models.Yue Zhao, Ishan Misra, Philipp Krhenbhl, Rohit Girdhar
2023CVPRCut and Learn for Unsupervised Object Detection and Instance Segmentation.Xudong Wang, Rohit Girdhar, Stella X. Yu, Ishan Misra
2023CVPRHierVL: Learning Hierarchical Video-Language Embeddings.Kumar Ashutosh, Rohit Girdhar, Lorenzo Torresani, Kristen Grauman
2023CVPRImageBind One Embedding Space to Bind Them All.Rohit Girdhar, Alaaeldin El-Nouby, Zhuang Liu, Mannat Singh, Kalyan Vasudev Alwala, Armand Joulin, Ishan Misra
2023CVPROmniMAE: Single Model Masked Pretraining on Images and Videos.Rohit Girdhar, Alaaeldin El-Nouby, Mannat Singh, Kalyan Vasudev Alwala, Armand Joulin, Ishan Misra
2023ICCVThe effectiveness of MAE pre-pretraining for billion-scale pretraining.Mannat Singh, Quentin Duval, Kalyan Vasudev Alwala, Haoqi Fan, Vaibhav Aggarwal, Aaron Adcock, Armand Joulin, Piotr Dollr, Christoph Feichtenhofer, Ross B. Girshick, Rohit Girdhar, Ishan Misra
2022CVPRMasked-attention Mask Transformer for Universal Image Segmentation.Bowen Cheng, Ishan Misra, Alexander G. Schwing, Alexander Kirillov, Rohit Girdhar
2022CVPROmnivore: A Single Model for Many Visual Modalities.Rohit Girdhar, Mannat Singh, Nikhila Ravi, Laurens van der Maaten, Armand Joulin, Ishan Misra
2022CVPREgo4D: Around the World in 3, 000 Hours of Egocentric Video.Kristen Grauman, Andrew Westbury, Eugene Byrne, Zachary Chavis, Antonino Furnari, Rohit Girdhar, Jackson Hamburger, Hao Jiang, Miao Liu, Xingyu Liu, Miguel Martin, Tushar Nagarajan, Ilija Radosavovic, Santhosh Kumar Ramakrishnan, Fiona Ryan, Jayant Sharma, Michael Wray, Mengmeng Xu, Eric Zhongcong Xu, Chen Zhao, Siddhant Bansal, Dhruv Batra, Vincent Cartillier, Sean Crane, Tien Do, Morrie Doulaty, Akshay Erapalli, Christoph Feichtenhofer, Adriano Fragomeni, Qichen Fu, Abrham Gebreselasie, Cristina Gonzlez, James Hillis, Xuhua Huang, Yifei Huang, Wenqi Jia, Weslie Khoo, Jchym Kolr, Satwik Kottur, Anurag Kumar, Federico Landini, Chao Li, Yanghao Li, Zhenqiang Li, Karttikeya Mangalam, Raghava Modhugu, Jonathan Munro, Tullie Murrell, Takumi Nishiyasu, Will Price, Paola Ruiz Puentes, Merey Ramazanova, Leda Sari, Kiran K. Somasundaram, Audrey Southerland, Yusuke Sugano, Ruijie Tao, Minh Vo, Yuchen Wang, Xindi Wu, Takuma Yagi, Ziwei Zhao, Yunyi Zhu, Pablo Arbelez, David Crandall, Dima Damen, Giovanni Maria Farinella, Christian Fuegen, Bernard Ghanem, Vamsi Krishna Ithapu, C. V. Jawahar, Hanbyul Joo, Kris Kitani, Haizhou Li, Richard A. Newcombe, Aude Oliva, Hyun Soo Park, James M. Rehg, Yoichi Sato, Jianbo Shi, Mike Zheng Shou, Antonio Torralba, Lorenzo Torresani, Mingfei Yan, Jitendra Malik
2022ECCVDetecting Twenty-Thousand Classes Using Image-Level Supervision.Xingyi Zhou, Rohit Girdhar, Armand Joulin, Philipp Krhenbhl, Ishan Misra
2021CVPR3D Spatial Recognition Without Spatially Labeled 3D.Zhongzheng Ren, Ishan Misra, Alexander G. Schwing, Rohit Girdhar
2021ICCVAnticipative Video Transformer.Rohit Girdhar, Kristen Grauman
2021ICCVAn End-to-End Transformer Model for 3D Object Detection.Ishan Misra, Rohit Girdhar, Armand Joulin
2021ICCVSelf-Supervised Pretraining of 3D Features on any Point-Cloud.Zaiwei Zhang, Rohit Girdhar, Armand Joulin, Ishan Misra
2020ICLRCATER: A diagnostic dataset for Compositional Actions & TEmporal Reasoning.Rohit Girdhar, Deva Ramanan
2020ICLRMetaPix: Few-Shot Video Retargeting.Jessica Lee, Deva Ramanan, Rohit Girdhar
2019CVPRVideo Action Transformer Network.Rohit Girdhar, Joo Carreira, Carl Doersch, Andrew Zisserman
2019ICCVDistInit: Learning Video Representations Without a Single Labeled Video.Rohit Girdhar, Du Tran, Lorenzo Torresani, Deva Ramanan
2018CVPRDetect-and-Track: Efficient Pose Estimation in Videos.Rohit Girdhar, Georgia Gkioxari, Lorenzo Torresani, Manohar Paluri, Du Tran
2017CVPRBinge Watching: Scaling Affordance Learning from Sitcoms.Xiaolong Wang, Rohit Girdhar, Abhinav Gupta
2017CVPRActionVLAD: Learning Spatio-Temporal Aggregation for Action Classification.Rohit Girdhar, Deva Ramanan, Abhinav Gupta, Josef Sivic, Bryan C. Russell
2016ECCVLearning a Predictable and Generative Vector Representation for Objects.Rohit Girdhar, David F. Fouhey, Mikel Rodriguez, Abhinav Gupta
2016WACVCutting through the clutter: Task-relevant features for image matching.Rohit Girdhar, David F. Fouhey, Kris M. Kitani, Abhinav Gupta, Martial Hebert
2014ACCVOptimizing Storage Intensive Vision Applications to Device Capacity.Rohit Girdhar, Jayaguru Panda, C. V. Jawahar