Difei Gao
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
22
Venues
10
Active years
2015–2025
Best venue rank
A*
Where they publish
Papers
22 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2025 | CVPR | ShowUI: One Vision-Language-Action Model for GUI Visual Agent. | Kevin Qinghong Lin, Linjie Li, Difei Gao, Zhengyuan Yang, Shiwei Wu, Zechen Bai, Stan Weixian Lei, Lijuan Wang, Mike Zheng Shou |
| 2025 | ICCV | Factorized Learning for Temporally Grounded Video-Language Models. | Wenzheng Zeng, Difei Gao, Mike Zheng Shou, Hwee Tou Ng |
| 2025 | ICLR | Grounding Multimodal Large Language Model in GUI World. | Weixian Lei, Difei Gao, Mike Zheng Shou |
| 2024 | CVPR | VideoLLM-online: Online Video Large Language Model for Streaming Video. | Joya Chen, Zhaoyang Lv, Shiwei Wu, Kevin Qinghong Lin, Chenan Song, Difei Gao, Jia-Wei Liu, Ziteng Gao, Dongxing Mao, Mike Zheng Shou |
| 2024 | CVPR | AssistGUI: Task-Oriented PC Graphical User Interface Automation. | Difei Gao, Lei Ji, Zechen Bai, Mingyu Ouyang, Peiran Li, Dongxing Mao, Qinchen Wu, Weichen Zhang, Peiyi Wang, Xiangwu Guo, Hengxu Wang, Luowei Zhou, Mike Zheng Shou |
| 2024 | CVPR | VIT-LENS: Towards Omni-modal Representations. | Weixian Lei, Yixiao Ge, Kun Yi, Jianfeng Zhang, Difei Gao, Dylan Sun, Yuying Ge, Ying Shan, Mike Zheng Shou |
| 2024 | ECCV | Learning Video Context as Interleaved Multimodal Sequences. | Kevin Qinghong Lin, Pengchuan Zhang, Difei Gao, Xide Xia, Joya Chen, Ziteng Gao, Jinheng Xie, Xuhong Xiao, Mike Zheng Shou |
| 2024 | IJCAI | Delocate: Detection and Localization for Deepfake Videos with Randomly-Located Tampered Traces. | Juan Hu, Xin Liao, Difei Gao, Satoshi Tsutsui, Qian Wang, Zheng Qin, Mike Zheng Shou |
| 2023 | AAAI | Symbolic Replay: Scene Graph as Prompt for Continual Learning on VQA Task. | Stan Weixian Lei, Difei Gao, Jay Zhangjie Wu, Yuxuan Wang, Wei Liu, Mengmi Zhang, Mike Zheng Shou |
| 2023 | ACL | CONE: An Efficient COarse-to-fiNE Alignment Framework for Long Video Temporal Grounding. | Zhijian Hou, Wanjun Zhong, Lei Ji, Difei Gao, Kun Yan, Wing Kwong Chan, Chong-Wah Ngo, Mike Zheng Shou, Nan Duan |
| 2023 | CVPR | Affordance Grounding from Demonstration Video to Target Image. | Joya Chen, Difei Gao, Kevin Qinghong Lin, Mike Zheng Shou |
| 2023 | CVPR | MIST : Multi-modal Iterative Spatial-Temporal Transformer for Long-form Video Question Answering. | Difei Gao, Luowei Zhou, Lei Ji, Linchao Zhu, Yi Yang, Mike Zheng Shou |
| 2023 | EMNLP | GazeVQA: A Video Question Answering Dataset for Multiview Eye-Gaze Task-Oriented Collaborations. | Muhammet Furkan Ilaslan, Chenan Song, Joya Chen, Difei Gao, Weixian Lei, Qianli Xu, Joo Lim, Mike Zheng Shou |
| 2023 | ICCV | UniVTG: Towards Unified Video-Language Temporal Grounding. | Kevin Qinghong Lin, Pengchuan Zhang, Joya Chen, Shraman Pramanick, Difei Gao, Alex Jinpeng Wang, Rui Yan, Mike Zheng Shou |
| 2023 | ICCV | Learning to Learn: How to Continuously Teach Humans and Machines. | Parantak Singh, You Li, Ankur Sikarwar, Weixian Lei, Difei Gao, Morgan B. Talbot, Ying Sun, Mike Zheng Shou, Gabriel Kreiman, Mengmi Zhang |
| 2022 | ECCV | GEB+: A Benchmark for Generic Event Boundary Captioning, Grounding and Retrieval. | Yuxuan Wang, Difei Gao, Licheng Yu, Weixian Lei, Matt Feiszli, Mike Zheng Shou |
| 2022 | ECCV | AssistQ: Affordance-Centric Question-Driven Task Completion for Egocentric Assistant. | Benita Wong, Joya Chen, You Wu, Stan Weixian Lei, Dongxing Mao, Difei Gao, Mike Zheng Shou |
| 2022 | EMNLP | AssistSR: Task-oriented Video Segment Retrieval for Personal AI Assistant. | Weixian Lei, Difei Gao, Yuxuan Wang, Dongxing Mao, Zihan Liang, Lingmin Ran, Mike Zheng Shou |
| 2021 | ICCV | Env-QA: A Video Question Answering Benchmark for Comprehensive Understanding of Dynamic Environments. | Difei Gao, Ruiping Wang, Ziyi Bai, Xilin Chen |
| 2020 | CVPR | Multi-Modal Graph Neural Network for Joint Reasoning on Vision and Scene Text. | Difei Gao, Ke Li, Ruiping Wang, Shiguang Shan, Xilin Chen |
| 2017 | BMVC | Visual Textbook Network: Watch Carefully before Answering Visual Questions. | Difei Gao, Ruiping Wang, Shiguang Shan, Xilin Chen |
| 2015 | ICIP | Correlated warped Gaussian processes for gender-specific age estimation. | Difei Gao, Lili Pan, Risheng Liu, Rui Chen, Mei Xie |