Skip to content

Gedas Bertasius

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

48

Venues

12

Active years

2015–2026

Best venue rank

A*

Where they publish

Papers

48 indexed papers, newest first.

YearVenueTitleAuthors
2026WACVZero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising.Yan-Bo Lin, Kevin Lin, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Chung-Ching Lin, Xiaofei Wang, Gedas Bertasius, Lijuan Wang
2026WACVTimeRefine: Temporal Grounding with Time Refining Video LLM.Xizi Wang, Feng Cheng, Ziyang Wang, Huiyu Wang, Md Mohaiminul Islam, Lorenzo Torresani, Mohit Bansal, Gedas Bertasius, David Crandall
2026WACVEnhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction.Ce Zhang, Yale Song, Ruta Desai, Michael Louis Iuzzolino, Joseph Tighe, Gedas Bertasius, Satwik Kottur
2025CVPRReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos.Tanveer Hannan, Md Mohaiminul Islam, Jindong Gu, Thomas Seidl, Gedas Bertasius
2025CVPRBIMBA: Selective-Scan Compression for Long-Range Video Question Answering.Md Mohaiminul Islam, Tushar Nagarajan, Huiyu Wang, Gedas Bertasius, Lorenzo Torresani
2025CVPRBASKET: A Large-Scale Video Dataset for Fine-Grained Skill Estimation.Yulu Pan, Ce Zhang, Gedas Bertasius
2025CVPRVideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos.Ziyang Wang, Shoubin Yu, Elias Stengel-Eskin, Jaehong Yoon, Feng Cheng, Gedas Bertasius, Mohit Bansal
2025EMNLPVideo-RTS: Rethinking Reinforcement Learning and Test-Time Scaling for Efficient and Enhanced Video Reasoning.Ziyang Wang, Jaehong Yoon, Shoubin Yu, Md Mohaiminul Islam, Gedas Bertasius, Mohit Bansal
2025IROSReBot: Scaling Robot Learning with Real-to-Sim-to-Real Robotic Video Synthesis.Yu Fang, Yue Yang, Xinghao Zhu, Kaiyuan Zheng, Gedas Bertasius, Daniel Szafir, Mingyu Ding
2025WACVDam: Dynamic Adapter Merging for Continual Video QA Learning.Feng Cheng, Ziyang Wang, Yi-Lin Sung, Yan-Bo Lin, Mohit Bansal, Gedas Bertasius
2025WACVVMAs: Video-to-Music Generation via Semantic Alignment in Web Music Videos.Yan-Bo Lin, Yu Tian, Linjie Yang, Gedas Bertasius, Heng Wang
2024ACLMementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences.Xiyao Wang, Yuhang Zhou, Xiaoyu Liu, Hongjin Lu, Yuancheng Xu, Feihong He, Jaehong Yoon, Taixi Lu, Fuxiao Liu, Gedas Bertasius, Mohit Bansal, Huaxiu Yao, Furong Huang
2024CVPRBuilding Secure and Engaging Video Communication by Using Monitor Illumination.Jun Myeong Choi, Johnathan Chi-Ho Leung, Noah Frahm, Max Christman, Gedas Bertasius, Roni Sengupta
2024CVPREgo-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives.Kristen Grauman, Andrew Westbury, Lorenzo Torresani, Kris Kitani, Jitendra Malik, Triantafyllos Afouras, Kumar Ashutosh, Vijay Baiyya, Siddhant Bansal, Bikram Boote, Eugene Byrne, Zachary Chavis, Joya Chen, Feng Cheng, Fu-Jen Chu, Sean Crane, Avijit Dasgupta, Jing Dong, Mara Escobar, Cristhian Forigua, Abrham Gebreselasie, Sanjay Haresh, Jing Huang, Md Mohaiminul Islam, Suyog Dutt Jain, Rawal Khirodkar, Devansh Kukreja, Kevin J. Liang, Jia-Wei Liu, Sagnik Majumder, Yongsen Mao, Miguel Martin, Effrosyni Mavroudi, Tushar Nagarajan, Francesco Ragusa, Santhosh Kumar Ramakrishnan, Luigi Seminara, Arjun Somayazulu, Yale Song, Shan Su, Zihui Xue, Edward Zhang, Jinxu Zhang, Angela Castillo, Changan Chen, Xinzhu Fu, Ryosuke Furuta, Cristina Gonzlez, Prince Gupta, Jiabo Hu, Yifei Huang, Yiming Huang, Weslie Khoo, Anush Kumar, Robert Kuo, Sach Lakhavani, Miao Liu, Mi Luo, Zhengyi Luo, Brighid Meredith, Austin Miller, Oluwatumininu Oguntola, Xiaqing Pan, Penny Peng, Shraman Pramanick, Merey Ramazanova, Fiona Ryan, Wei Shan, Kiran K. Somasundaram, Chenan Song, Audrey Southerland, Masatoshi Tateno, Huiyu Wang, Yuchen Wang, Takuma Yagi, Mingfei Yan, Xitong Yang, Zecheng Yu, Shengxin Cindy Zha, Chen Zhao, Ziwei Zhao, Zhifan Zhu, Jeff Zhuo, Pablo Arbelez, Gedas Bertasius, Dima Damen, Jakob J. Engel, Giovanni Maria Farinella, Antonino Furnari, Bernard Ghanem, Judy Hoffman, C. V. Jawahar, Richard A. Newcombe, Hyun Soo Park, James M. Rehg, Yoichi Sato, Manolis Savva, Jianbo Shi, Mike Zheng Shout, Michael Wray
2024CVPRVideo ReCap: Recursive Captioning of Hour-Long Videos.Md Mohaiminul Islam, Ngan Ho, Xitong Yang, Tushar Nagarajan, Lorenzo Torresani, Gedas Bertasius
2024CVPRLoCoNet: Long-Short Context Network for Active Speaker Detection.Xizi Wang, Feng Cheng, Gedas Bertasius
2024ECCV4DIFF: 3D-Aware Diffusion Model for Third-to-First Viewpoint Translation.Feng Cheng, Mi Luo, Huiyu Wang, Alex Dimakis, Lorenzo Torresani, Gedas Bertasius, Kristen Grauman
2024ECCVRGNet: A Unified Clip Retrieval and Grounding Network for Long Videos.Tanveer Hannan, Md Mohaiminul Islam, Thomas Seidl, Gedas Bertasius
2024ECCVPropose, Assess, Search: Harnessing LLMs for Goal-Oriented Planning in Instructional Videos.Md Mohaiminul Islam, Tushar Nagarajan, Huiyu Wang, Fu-Jen Chu, Kris Kitani, Gedas Bertasius, Xitong Yang
2024ECCVSiamese Vision Transformers are Scalable Audio-Visual Learners.Yan-Bo Lin, Gedas Bertasius
2024EMNLPA Simple LLM Framework for Long-Range Video Question-Answering.Ce Zhang, Taixi Lu, Md Mohaiminul Islam, Ziyang Wang, Shoubin Yu, Mohit Bansal, Gedas Bertasius
2024IROSARCADE: Scalable Demonstration Collection and Generation via Augmented Reality for Imitation Learning.Yue Yang, Bryce Ikeda, Gedas Bertasius, Daniel Szafir
2023CVPRVindLU: A Recipe for Effective Video-and-Language Pretraining.Feng Cheng, Xizi Wang, Jie Lei, David J. Crandall, Mohit Bansal, Gedas Bertasius
2023CVPREfficient Movie Scene Detection using State-Space Transformers.Md Mohaiminul Islam, Mahmudul Hasan, Kishan Shamsundar Athrey, Tony Braskich, Gedas Bertasius
2023CVPRVision Transformers are Parameter-Efficient Audio-Visual Learners.Yan-Bo Lin, Yi-Lin Sung, Jie Lei, Mohit Bansal, Gedas Bertasius
2023ECIRImproving Video Retrieval Using Multilingual Knowledge Transfer.Avinash Madasu, Estelle Aflalo, Gabriela Ben Melech Stan, Shao-Yen Tseng, Gedas Bertasius, Vasudev Lal
2023ICCVSimpleClick: Interactive Image Segmentation with Simple Vision Transformers.Qin Liu, Zhenlin Xu, Gedas Bertasius, Marc Niethammer
2023ICCVUnified Coarse-to-Fine Alignment for Video-Text Retrieval.Ziyang Wang, Yi-Lin Sung, Feng Cheng, Gedas Bertasius, Mohit Bansal
2022CVPRLearning To Recognize Procedural Activities with Distant Supervision.Xudong Lin, Fabio Petroni, Gedas Bertasius, Marcus Rohrbach, Shih-Fu Chang, Lorenzo Torresani
2022CVPRLong-Short Temporal Contrastive Learning of Video Transformers.Jue Wang, Gedas Bertasius, Du Tran, Lorenzo Torresani
2022ECCVTallFormer: Temporal Action Localization with a Long-Memory Transformer.Feng Cheng, Gedas Bertasius
2022ECCVLong Movie Clip Classification with State-Space Video Models.Md Mohaiminul Islam, Gedas Bertasius
2022ECCVEclipSE: Efficient Long-Range Video Retrieval Using Sight and Sound.Yan-Bo Lin, Jie Lei, Mohit Bansal, Gedas Bertasius
2021CVPRVx2Text: End-to-End Learning of Video-Based Text Generation From Multimodal Inputs.Xudong Lin, Gedas Bertasius, Jue Wang, Shih-Fu Chang, Devi Parikh, Lorenzo Torresani
2021ICMLIs Space-Time Attention All You Need for Video Understanding?Gedas Bertasius, Heng Wang, Lorenzo Torresani
2021WACVSupervoxel Attention Graphs for Long-Range Video Modeling.Yang Wang, Gedas Bertasius, Tae-Hyun Oh, Abhinav Gupta, Minh Hoai, Lorenzo Torresani
2020BMVCAttentive Action and Context Factorization.Yang Wang, Vinh Tran, Gedas Bertasius, Lorenzo Torresani, Minh Hoai Nguyen
2020CVPRClassifying, Segmenting, and Tracking Object Instances in Video with Mask Propagation.Gedas Bertasius, Lorenzo Torresani
2018CVPREgocentric Basketball Motion Planning From a Single First-Person Image.Gedas Bertasius, Aaron Chan, Jianbo Shi
2018ECCVObject Detection in Video with Spatiotemporal Sampling Networks.Gedas Bertasius, Lorenzo Torresani, Jianbo Shi
2017AISTATSLocal Perturb-and-MAP for Structured Prediction.Gedas Bertasius, Qiang Liu, Lorenzo Torresani, Jianbo Shi
2017CVPRConvolutional Random Walk Networks for Semantic Image Segmentation.Gedas Bertasius, Lorenzo Torresani, Stella X. Yu, Jianbo Shi
2017ICCVUnsupervised Learning of Important Objects from First-Person Videos.Gedas Bertasius, Hyun Soo Park, Stella X. Yu, Jianbo Shi
2017ICCVAm I a Baller? Basketball Performance Assessment from First-Person Videos.Gedas Bertasius, Hyun Soo Park, Stella X. Yu, Jianbo Shi
2016CVPRSemantic Segmentation with Boundary Neural Fields.Gedas Bertasius, Jianbo Shi, Lorenzo Torresani
2016MICCAIAutomatic Lymph Node Cluster Segmentation Using Holistically-Nested Neural Networks and Structured Optimization in CT Images.Isabella Nogues, Le Lu, Xiaosong Wang, Holger Roth, Gedas Bertasius, Nathan Lay, Jianbo Shi, Yohannes Tsehay, Ronald M. Summers
2015CVPRDeepEdge: A multi-scale bifurcated deep network for top-down contour detection.Gedas Bertasius, Jianbo Shi, Lorenzo Torresani
2015ICCVHigh-for-Low and Low-for-High: Efficient Boundary Detection from Deep Object Features and Its Applications to High-Level Vision.Gedas Bertasius, Jianbo Shi, Lorenzo Torresani