Gedas Bertasius
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
48
Venues
12
Active years
2015–2026
Best venue rank
A*
Where they publish
Papers
48 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | WACV | Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising. | Yan-Bo Lin, Kevin Lin, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Chung-Ching Lin, Xiaofei Wang, Gedas Bertasius, Lijuan Wang |
| 2026 | WACV | TimeRefine: Temporal Grounding with Time Refining Video LLM. | Xizi Wang, Feng Cheng, Ziyang Wang, Huiyu Wang, Md Mohaiminul Islam, Lorenzo Torresani, Mohit Bansal, Gedas Bertasius, David Crandall |
| 2026 | WACV | Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction. | Ce Zhang, Yale Song, Ruta Desai, Michael Louis Iuzzolino, Joseph Tighe, Gedas Bertasius, Satwik Kottur |
| 2025 | CVPR | ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos. | Tanveer Hannan, Md Mohaiminul Islam, Jindong Gu, Thomas Seidl, Gedas Bertasius |
| 2025 | CVPR | BIMBA: Selective-Scan Compression for Long-Range Video Question Answering. | Md Mohaiminul Islam, Tushar Nagarajan, Huiyu Wang, Gedas Bertasius, Lorenzo Torresani |
| 2025 | CVPR | BASKET: A Large-Scale Video Dataset for Fine-Grained Skill Estimation. | Yulu Pan, Ce Zhang, Gedas Bertasius |
| 2025 | CVPR | VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos. | Ziyang Wang, Shoubin Yu, Elias Stengel-Eskin, Jaehong Yoon, Feng Cheng, Gedas Bertasius, Mohit Bansal |
| 2025 | EMNLP | Video-RTS: Rethinking Reinforcement Learning and Test-Time Scaling for Efficient and Enhanced Video Reasoning. | Ziyang Wang, Jaehong Yoon, Shoubin Yu, Md Mohaiminul Islam, Gedas Bertasius, Mohit Bansal |
| 2025 | IROS | ReBot: Scaling Robot Learning with Real-to-Sim-to-Real Robotic Video Synthesis. | Yu Fang, Yue Yang, Xinghao Zhu, Kaiyuan Zheng, Gedas Bertasius, Daniel Szafir, Mingyu Ding |
| 2025 | WACV | Dam: Dynamic Adapter Merging for Continual Video QA Learning. | Feng Cheng, Ziyang Wang, Yi-Lin Sung, Yan-Bo Lin, Mohit Bansal, Gedas Bertasius |
| 2025 | WACV | VMAs: Video-to-Music Generation via Semantic Alignment in Web Music Videos. | Yan-Bo Lin, Yu Tian, Linjie Yang, Gedas Bertasius, Heng Wang |
| 2024 | ACL | Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences. | Xiyao Wang, Yuhang Zhou, Xiaoyu Liu, Hongjin Lu, Yuancheng Xu, Feihong He, Jaehong Yoon, Taixi Lu, Fuxiao Liu, Gedas Bertasius, Mohit Bansal, Huaxiu Yao, Furong Huang |
| 2024 | CVPR | Building Secure and Engaging Video Communication by Using Monitor Illumination. | Jun Myeong Choi, Johnathan Chi-Ho Leung, Noah Frahm, Max Christman, Gedas Bertasius, Roni Sengupta |
| 2024 | CVPR | Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives. | Kristen Grauman, Andrew Westbury, Lorenzo Torresani, Kris Kitani, Jitendra Malik, Triantafyllos Afouras, Kumar Ashutosh, Vijay Baiyya, Siddhant Bansal, Bikram Boote, Eugene Byrne, Zachary Chavis, Joya Chen, Feng Cheng, Fu-Jen Chu, Sean Crane, Avijit Dasgupta, Jing Dong, Mara Escobar, Cristhian Forigua, Abrham Gebreselasie, Sanjay Haresh, Jing Huang, Md Mohaiminul Islam, Suyog Dutt Jain, Rawal Khirodkar, Devansh Kukreja, Kevin J. Liang, Jia-Wei Liu, Sagnik Majumder, Yongsen Mao, Miguel Martin, Effrosyni Mavroudi, Tushar Nagarajan, Francesco Ragusa, Santhosh Kumar Ramakrishnan, Luigi Seminara, Arjun Somayazulu, Yale Song, Shan Su, Zihui Xue, Edward Zhang, Jinxu Zhang, Angela Castillo, Changan Chen, Xinzhu Fu, Ryosuke Furuta, Cristina Gonzlez, Prince Gupta, Jiabo Hu, Yifei Huang, Yiming Huang, Weslie Khoo, Anush Kumar, Robert Kuo, Sach Lakhavani, Miao Liu, Mi Luo, Zhengyi Luo, Brighid Meredith, Austin Miller, Oluwatumininu Oguntola, Xiaqing Pan, Penny Peng, Shraman Pramanick, Merey Ramazanova, Fiona Ryan, Wei Shan, Kiran K. Somasundaram, Chenan Song, Audrey Southerland, Masatoshi Tateno, Huiyu Wang, Yuchen Wang, Takuma Yagi, Mingfei Yan, Xitong Yang, Zecheng Yu, Shengxin Cindy Zha, Chen Zhao, Ziwei Zhao, Zhifan Zhu, Jeff Zhuo, Pablo Arbelez, Gedas Bertasius, Dima Damen, Jakob J. Engel, Giovanni Maria Farinella, Antonino Furnari, Bernard Ghanem, Judy Hoffman, C. V. Jawahar, Richard A. Newcombe, Hyun Soo Park, James M. Rehg, Yoichi Sato, Manolis Savva, Jianbo Shi, Mike Zheng Shout, Michael Wray |
| 2024 | CVPR | Video ReCap: Recursive Captioning of Hour-Long Videos. | Md Mohaiminul Islam, Ngan Ho, Xitong Yang, Tushar Nagarajan, Lorenzo Torresani, Gedas Bertasius |
| 2024 | CVPR | LoCoNet: Long-Short Context Network for Active Speaker Detection. | Xizi Wang, Feng Cheng, Gedas Bertasius |
| 2024 | ECCV | 4DIFF: 3D-Aware Diffusion Model for Third-to-First Viewpoint Translation. | Feng Cheng, Mi Luo, Huiyu Wang, Alex Dimakis, Lorenzo Torresani, Gedas Bertasius, Kristen Grauman |
| 2024 | ECCV | RGNet: A Unified Clip Retrieval and Grounding Network for Long Videos. | Tanveer Hannan, Md Mohaiminul Islam, Thomas Seidl, Gedas Bertasius |
| 2024 | ECCV | Propose, Assess, Search: Harnessing LLMs for Goal-Oriented Planning in Instructional Videos. | Md Mohaiminul Islam, Tushar Nagarajan, Huiyu Wang, Fu-Jen Chu, Kris Kitani, Gedas Bertasius, Xitong Yang |
| 2024 | ECCV | Siamese Vision Transformers are Scalable Audio-Visual Learners. | Yan-Bo Lin, Gedas Bertasius |
| 2024 | EMNLP | A Simple LLM Framework for Long-Range Video Question-Answering. | Ce Zhang, Taixi Lu, Md Mohaiminul Islam, Ziyang Wang, Shoubin Yu, Mohit Bansal, Gedas Bertasius |
| 2024 | IROS | ARCADE: Scalable Demonstration Collection and Generation via Augmented Reality for Imitation Learning. | Yue Yang, Bryce Ikeda, Gedas Bertasius, Daniel Szafir |
| 2023 | CVPR | VindLU: A Recipe for Effective Video-and-Language Pretraining. | Feng Cheng, Xizi Wang, Jie Lei, David J. Crandall, Mohit Bansal, Gedas Bertasius |
| 2023 | CVPR | Efficient Movie Scene Detection using State-Space Transformers. | Md Mohaiminul Islam, Mahmudul Hasan, Kishan Shamsundar Athrey, Tony Braskich, Gedas Bertasius |
| 2023 | CVPR | Vision Transformers are Parameter-Efficient Audio-Visual Learners. | Yan-Bo Lin, Yi-Lin Sung, Jie Lei, Mohit Bansal, Gedas Bertasius |
| 2023 | ECIR | Improving Video Retrieval Using Multilingual Knowledge Transfer. | Avinash Madasu, Estelle Aflalo, Gabriela Ben Melech Stan, Shao-Yen Tseng, Gedas Bertasius, Vasudev Lal |
| 2023 | ICCV | SimpleClick: Interactive Image Segmentation with Simple Vision Transformers. | Qin Liu, Zhenlin Xu, Gedas Bertasius, Marc Niethammer |
| 2023 | ICCV | Unified Coarse-to-Fine Alignment for Video-Text Retrieval. | Ziyang Wang, Yi-Lin Sung, Feng Cheng, Gedas Bertasius, Mohit Bansal |
| 2022 | CVPR | Learning To Recognize Procedural Activities with Distant Supervision. | Xudong Lin, Fabio Petroni, Gedas Bertasius, Marcus Rohrbach, Shih-Fu Chang, Lorenzo Torresani |
| 2022 | CVPR | Long-Short Temporal Contrastive Learning of Video Transformers. | Jue Wang, Gedas Bertasius, Du Tran, Lorenzo Torresani |
| 2022 | ECCV | TallFormer: Temporal Action Localization with a Long-Memory Transformer. | Feng Cheng, Gedas Bertasius |
| 2022 | ECCV | Long Movie Clip Classification with State-Space Video Models. | Md Mohaiminul Islam, Gedas Bertasius |
| 2022 | ECCV | EclipSE: Efficient Long-Range Video Retrieval Using Sight and Sound. | Yan-Bo Lin, Jie Lei, Mohit Bansal, Gedas Bertasius |
| 2021 | CVPR | Vx2Text: End-to-End Learning of Video-Based Text Generation From Multimodal Inputs. | Xudong Lin, Gedas Bertasius, Jue Wang, Shih-Fu Chang, Devi Parikh, Lorenzo Torresani |
| 2021 | ICML | Is Space-Time Attention All You Need for Video Understanding? | Gedas Bertasius, Heng Wang, Lorenzo Torresani |
| 2021 | WACV | Supervoxel Attention Graphs for Long-Range Video Modeling. | Yang Wang, Gedas Bertasius, Tae-Hyun Oh, Abhinav Gupta, Minh Hoai, Lorenzo Torresani |
| 2020 | BMVC | Attentive Action and Context Factorization. | Yang Wang, Vinh Tran, Gedas Bertasius, Lorenzo Torresani, Minh Hoai Nguyen |
| 2020 | CVPR | Classifying, Segmenting, and Tracking Object Instances in Video with Mask Propagation. | Gedas Bertasius, Lorenzo Torresani |
| 2018 | CVPR | Egocentric Basketball Motion Planning From a Single First-Person Image. | Gedas Bertasius, Aaron Chan, Jianbo Shi |
| 2018 | ECCV | Object Detection in Video with Spatiotemporal Sampling Networks. | Gedas Bertasius, Lorenzo Torresani, Jianbo Shi |
| 2017 | AISTATS | Local Perturb-and-MAP for Structured Prediction. | Gedas Bertasius, Qiang Liu, Lorenzo Torresani, Jianbo Shi |
| 2017 | CVPR | Convolutional Random Walk Networks for Semantic Image Segmentation. | Gedas Bertasius, Lorenzo Torresani, Stella X. Yu, Jianbo Shi |
| 2017 | ICCV | Unsupervised Learning of Important Objects from First-Person Videos. | Gedas Bertasius, Hyun Soo Park, Stella X. Yu, Jianbo Shi |
| 2017 | ICCV | Am I a Baller? Basketball Performance Assessment from First-Person Videos. | Gedas Bertasius, Hyun Soo Park, Stella X. Yu, Jianbo Shi |
| 2016 | CVPR | Semantic Segmentation with Boundary Neural Fields. | Gedas Bertasius, Jianbo Shi, Lorenzo Torresani |
| 2016 | MICCAI | Automatic Lymph Node Cluster Segmentation Using Holistically-Nested Neural Networks and Structured Optimization in CT Images. | Isabella Nogues, Le Lu, Xiaosong Wang, Holger Roth, Gedas Bertasius, Nathan Lay, Jianbo Shi, Yohannes Tsehay, Ronald M. Summers |
| 2015 | CVPR | DeepEdge: A multi-scale bifurcated deep network for top-down contour detection. | Gedas Bertasius, Jianbo Shi, Lorenzo Torresani |
| 2015 | ICCV | High-for-Low and Low-for-High: Efficient Boundary Detection from Deep Object Features and Its Applications to High-Level Vision. | Gedas Bertasius, Jianbo Shi, Lorenzo Torresani |