Skip to content

Xizhou Zhu

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

39

Venues

5

Active years

2017–2025

Best venue rank

A*

Where they publish

Papers

39 indexed papers, newest first.

YearVenueTitleAuthors
2025CVPRSynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding.Hao Li, Changyao Tian, Jie Shao, Xizhou Zhu, Zhaokai Wang, Jinguo Zhu, Wenhan Dou, Xiao-Gang Wang, Hongsheng Li, Lewei Lu, Jifeng Dai
2025CVPRMono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training.Gen Luo, Xue Yang, Wenhan Dou, Zhaokai Wang, Jiawen Liu, Jifeng Dai, Yu Qiao, Xizhou Zhu
2025CVPRHoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding.Chenxin Tao, Shiqian Su, Xizhou Zhu, Chenyu Zhang, Zhe Chen, Jiawen Liu, Wenhai Wang, Lewei Lu, Gao Huang, Yu Qiao, Jifeng Dai
2025CVPRPVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models.Chenyu Yang, Xuan Dong, Xizhou Zhu, Weijie Su, Jiahao Wang, Hao Tian, Zhe Chen, Wenhai Wang, Lewei Lu, Jifeng Dai
2025ICCVV2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding.Junqi Ge, Ziyi Chen, Jintao Lin, Jinguo Zhu, Xihui Liu, Jifeng Dai, Xizhou Zhu
2025ICCVDita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy.Zhi Hou, Tianyi Zhang, Yuwen Xiong, Haonan Duan, Hengjun Pu, Ronglei Tong, Chengyang Zhao, Xizhou Zhu, Yu Qiao, Jifeng Dai, Yuntao Chen
2025ICCVLangBridge: Interpreting Image as a Combination of Language Embeddings.Jiaqi Liao, Yuwei Niu, Fanqing Meng, Hao Li, Changyao Tian, Yinuo Du, Yuwen Xiong, Dianqi Li, Xizhou Zhu, Li Yuan, Jifeng Dai, Yu Cheng
2025ICLRVision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures.Yuchen Duan, Weiyun Wang, Zhe Chen, Xizhou Zhu, Lewei Lu, Tong Lu, Yu Qiao, Hongsheng Li, Jifeng Dai, Wenhai Wang
2025ICLRMMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models.Fanqing Meng, Jin Wang, Chuanhao Li, Quanfeng Lu, Hao Tian, Tianshuo Yang, Jiaqi Liao, Xizhou Zhu, Jifeng Dai, Yu Qiao, Ping Luo, Kaipeng Zhang, Wenqi Shao
2025ICMLCoMemo: LVLMs Need Image Context with Image Memory.Shi Liu, Weijie Su, Xizhou Zhu, Wenhai Wang, Jifeng Dai
2024CVPRIntern VL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks.Zhe Chen, Jiannan Wu, Wenhai Wang, Weijie Su, Guo Chen, Sen Xing, Muyan Zhong, Qinglong Zhang, Xizhou Zhu, Lewei Lu, Bin Li, Ping Luo, Tong Lu, Yu Qiao, Jifeng Dai
2024CVPRAuto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft.Hao Li, Xue Yang, Zhaokai Wang, Xizhou Zhu, Jie Zhou, Yu Qiao, Xiaogang Wang, Hongsheng Li, Lewei Lu, Jifeng Dai
2024CVPREfficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision Applications.Yuwen Xiong, Zhiqi Li, Yuntao Chen, Feng Wang, Xizhou Zhu, Jiapeng Luo, Wenhai Wang, Tong Lu, Hongsheng Li, Yu Qiao, Lewei Lu, Jie Zhou, Jifeng Dai
2024ECCVControlLLM: Augment Language Models with Tools by Searching on Graphs.Zhaoyang Liu, Zeqiang Lai, Zhangwei Gao, Erfei Cui, Ziheng Li, Xizhou Zhu, Lewei Lu, Qifeng Chen, Yu Qiao, Jifeng Dai, Wenhai Wang
2024ECCVThe All-Seeing Project V2: Towards General Relation Comprehension of the Open World.Weiyun Wang, Yiming Ren, Haowen Luo, Tiantong Li, Chenxiang Yan, Zhe Chen, Wenhai Wang, Qingyun Li, Lewei Lu, Xizhou Zhu, Yu Qiao, Jifeng Dai
2024ICLRADDP: Learning General Representations for Image Recognition and Generation with Alternating Denoising Diffusion Process.Changyao Tian, Chenxin Tao, Jifeng Dai, Hao Li, Ziheng Li, Lewei Lu, Xiaogang Wang, Hongsheng Li, Gao Huang, Xizhou Zhu
2024ICLRThe All-Seeing Project: Towards Panoptic Visual Recognition and Understanding of the Open World.Weiyun Wang, Min Shi, Qingyun Li, Wenhai Wang, Zhenhang Huang, Linjie Xing, Zhe Chen, Hao Li, Xizhou Zhu, Zhiguo Cao, Yushi Chen, Tong Lu, Jifeng Dai, Yu Qiao
2023CVPRTowards All-in-One Pre-Training via Maximizing Multi-Modal Mutual Information.Weijie Su, Xizhou Zhu, Chenxin Tao, Lewei Lu, Bin Li, Gao Huang, Yu Qiao, Xiaogang Wang, Jie Zhou, Jifeng Dai
2023CVPRPlanning-oriented Autonomous Driving.Yihan Hu, Jiazhi Yang, Li Chen, Keyu Li, Chonghao Sima, Xizhou Zhu, Siqi Chai, Senyao Du, Tianwei Lin, Wenhai Wang, Lewei Lu, Xiaosong Jia, Qiang Liu, Jifeng Dai, Yu Qiao, Hongyang Li
2023CVPRUni-Perceiver v2: A Generalist Model for Large-Scale Vision and Vision-Language Tasks.Hao Li, Jinguo Zhu, Xiaohu Jiang, Xizhou Zhu, Hongsheng Li, Chun Yuan, Xiaohua Wang, Yu Qiao, Xiaogang Wang, Wenhai Wang, Jifeng Dai
2023CVPRSiamese Image Modeling for Self-Supervised Vision Representation Learning.Chenxin Tao, Xizhou Zhu, Weijie Su, Gao Huang, Bin Li, Jie Zhou, Yu Qiao, Xiaogang Wang, Jifeng Dai
2023CVPRInternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions.Wenhai Wang, Jifeng Dai, Zhe Chen, Zhenhang Huang, Zhiqi Li, Xizhou Zhu, Xiaowei Hu, Tong Lu, Lewei Lu, Hongsheng Li, Xiaogang Wang, Yu Qiao
2023CVPRBEVFormer v2: Adapting Modern Image Backbones to Bird's-Eye-View Recognition via Perspective Supervision.Chenyu Yang, Yuntao Chen, Hao Tian, Chenxin Tao, Xizhou Zhu, Zhaoxiang Zhang, Gao Huang, Hongyang Li, Yu Qiao, Lewei Lu, Jie Zhou, Jifeng Dai
2022CVPRAutoLoss-Zero: Searching Loss Functions from Scratch for Generic Tasks.Hao Li, Tianwen Fu, Jifeng Dai, Hongsheng Li, Gao Huang, Xizhou Zhu
2022CVPRExploring the Equivalence of Siamese Self-Supervised Learning via A Unified Gradient Framework.Chenxin Tao, Honghui Wang, Xizhou Zhu, Jiahua Dong, Shiji Song, Gao Huang, Jifeng Dai
2022CVPRUni-Perceiver: Pre-training Unified Architecture for Generic Perception for Zero-shot and Few-shot Tasks.Xizhou Zhu, Jinguo Zhu, Hao Li, Xiaoshi Wu, Hongsheng Li, Xiaohua Wang, Jifeng Dai
2022ECCVVL-LTR: Learning Class-wise Visual-Linguistic Representation for Long-Tailed Visual Recognition.Changyao Tian, Wenhai Wang, Xizhou Zhu, Jifeng Dai, Yu Qiao
2022ECCVDeciWatch: A Simple Baseline for 10˟ Efficient 2D and 3D Pose Estimation.Ailing Zeng, Xuan Ju, Lei Yang, Ruiyuan Gao, Xizhou Zhu, Bo Dai, Qiang Xu
2021CVPRUnsupervised Object Detection With LIDAR Clues.Hao Tian, Yuntao Chen, Jifeng Dai, Zhaoxiang Zhang, Xizhou Zhu
2021ICLRAuto Seg-Loss: Searching Metric Surrogates for Semantic Segmentation.Hao Li, Chenxin Tao, Xizhou Zhu, Xiaogang Wang, Gao Huang, Jifeng Dai
2021ICLRDeformable DETR: Deformable Transformers for End-to-End Object Detection.Xizhou Zhu, Weijie Su, Lewei Lu, Bin Li, Xiaogang Wang, Jifeng Dai
2020ECCVSpatially Adaptive Inference with Stochastic Feature Sampling and Interpolation.Zhenda Xie, Zheng Zhang, Xizhou Zhu, Gao Huang, Stephen Lin
2020ICLRDeformable Kernels: Adapting Effective Receptive Fields for Object Deformation.Hang Gao, Xizhou Zhu, Stephen Lin, Jifeng Dai
2020ICLRVL-BERT: Pre-training of Generic Visual-Linguistic Representations.Weijie Su, Xizhou Zhu, Yue Cao, Bin Li, Lewei Lu, Furu Wei, Jifeng Dai
2019CVPRDeformable ConvNets V2: More Deformable, Better Results.Xizhou Zhu, Han Hu, Stephen Lin, Jifeng Dai
2019ICCVAn Empirical Study of Spatial Attention Mechanisms in Deep Networks.Xizhou Zhu, Dazhi Cheng, Zheng Zhang, Stephen Lin, Jifeng Dai
2018CVPRTowards High Performance Video Object Detection.Xizhou Zhu, Jifeng Dai, Lu Yuan, Yichen Wei
2017CVPRDeep Feature Flow for Video Recognition.Xizhou Zhu, Yuwen Xiong, Jifeng Dai, Lu Yuan, Yichen Wei
2017ICCVFlow-Guided Feature Aggregation for Video Object Detection.Xizhou Zhu, Yujie Wang, Jifeng Dai, Lu Yuan, Yichen Wei