Skip to content

Difei Gao

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

22

Venues

10

Active years

2015–2025

Best venue rank

A*

Where they publish

Papers

22 indexed papers, newest first.

YearVenueTitleAuthors
2025CVPRShowUI: One Vision-Language-Action Model for GUI Visual Agent.Kevin Qinghong Lin, Linjie Li, Difei Gao, Zhengyuan Yang, Shiwei Wu, Zechen Bai, Stan Weixian Lei, Lijuan Wang, Mike Zheng Shou
2025ICCVFactorized Learning for Temporally Grounded Video-Language Models.Wenzheng Zeng, Difei Gao, Mike Zheng Shou, Hwee Tou Ng
2025ICLRGrounding Multimodal Large Language Model in GUI World.Weixian Lei, Difei Gao, Mike Zheng Shou
2024CVPRVideoLLM-online: Online Video Large Language Model for Streaming Video.Joya Chen, Zhaoyang Lv, Shiwei Wu, Kevin Qinghong Lin, Chenan Song, Difei Gao, Jia-Wei Liu, Ziteng Gao, Dongxing Mao, Mike Zheng Shou
2024CVPRAssistGUI: Task-Oriented PC Graphical User Interface Automation.Difei Gao, Lei Ji, Zechen Bai, Mingyu Ouyang, Peiran Li, Dongxing Mao, Qinchen Wu, Weichen Zhang, Peiyi Wang, Xiangwu Guo, Hengxu Wang, Luowei Zhou, Mike Zheng Shou
2024CVPRVIT-LENS: Towards Omni-modal Representations.Weixian Lei, Yixiao Ge, Kun Yi, Jianfeng Zhang, Difei Gao, Dylan Sun, Yuying Ge, Ying Shan, Mike Zheng Shou
2024ECCVLearning Video Context as Interleaved Multimodal Sequences.Kevin Qinghong Lin, Pengchuan Zhang, Difei Gao, Xide Xia, Joya Chen, Ziteng Gao, Jinheng Xie, Xuhong Xiao, Mike Zheng Shou
2024IJCAIDelocate: Detection and Localization for Deepfake Videos with Randomly-Located Tampered Traces.Juan Hu, Xin Liao, Difei Gao, Satoshi Tsutsui, Qian Wang, Zheng Qin, Mike Zheng Shou
2023AAAISymbolic Replay: Scene Graph as Prompt for Continual Learning on VQA Task.Stan Weixian Lei, Difei Gao, Jay Zhangjie Wu, Yuxuan Wang, Wei Liu, Mengmi Zhang, Mike Zheng Shou
2023ACLCONE: An Efficient COarse-to-fiNE Alignment Framework for Long Video Temporal Grounding.Zhijian Hou, Wanjun Zhong, Lei Ji, Difei Gao, Kun Yan, Wing Kwong Chan, Chong-Wah Ngo, Mike Zheng Shou, Nan Duan
2023CVPRAffordance Grounding from Demonstration Video to Target Image.Joya Chen, Difei Gao, Kevin Qinghong Lin, Mike Zheng Shou
2023CVPRMIST : Multi-modal Iterative Spatial-Temporal Transformer for Long-form Video Question Answering.Difei Gao, Luowei Zhou, Lei Ji, Linchao Zhu, Yi Yang, Mike Zheng Shou
2023EMNLPGazeVQA: A Video Question Answering Dataset for Multiview Eye-Gaze Task-Oriented Collaborations.Muhammet Furkan Ilaslan, Chenan Song, Joya Chen, Difei Gao, Weixian Lei, Qianli Xu, Joo Lim, Mike Zheng Shou
2023ICCVUniVTG: Towards Unified Video-Language Temporal Grounding.Kevin Qinghong Lin, Pengchuan Zhang, Joya Chen, Shraman Pramanick, Difei Gao, Alex Jinpeng Wang, Rui Yan, Mike Zheng Shou
2023ICCVLearning to Learn: How to Continuously Teach Humans and Machines.Parantak Singh, You Li, Ankur Sikarwar, Weixian Lei, Difei Gao, Morgan B. Talbot, Ying Sun, Mike Zheng Shou, Gabriel Kreiman, Mengmi Zhang
2022ECCVGEB+: A Benchmark for Generic Event Boundary Captioning, Grounding and Retrieval.Yuxuan Wang, Difei Gao, Licheng Yu, Weixian Lei, Matt Feiszli, Mike Zheng Shou
2022ECCVAssistQ: Affordance-Centric Question-Driven Task Completion for Egocentric Assistant.Benita Wong, Joya Chen, You Wu, Stan Weixian Lei, Dongxing Mao, Difei Gao, Mike Zheng Shou
2022EMNLPAssistSR: Task-oriented Video Segment Retrieval for Personal AI Assistant.Weixian Lei, Difei Gao, Yuxuan Wang, Dongxing Mao, Zihan Liang, Lingmin Ran, Mike Zheng Shou
2021ICCVEnv-QA: A Video Question Answering Benchmark for Comprehensive Understanding of Dynamic Environments.Difei Gao, Ruiping Wang, Ziyi Bai, Xilin Chen
2020CVPRMulti-Modal Graph Neural Network for Joint Reasoning on Vision and Scene Text.Difei Gao, Ke Li, Ruiping Wang, Shiguang Shan, Xilin Chen
2017BMVCVisual Textbook Network: Watch Carefully before Answering Visual Questions.Difei Gao, Ruiping Wang, Shiguang Shan, Xilin Chen
2015ICIPCorrelated warped Gaussian processes for gender-specific age estimation.Difei Gao, Lili Pan, Risheng Liu, Rui Chen, Mei Xie