Jifeng Dai
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
76
Venues
8
Active years
2012–2026
Best venue rank
A*
Where they publish
Papers
76 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | AAAI | Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy. | Tianyi Zhang, Haonan Duan, Haoran Hao, Yu Qiao, Jifeng Dai, Zhi Hou |
| 2025 | CVPR | Docopilot: Improving Multimodal Models for Document-Level Understanding. | Yuchen Duan, Zhe Chen, Yusong Hu, Weiyun Wang, Shenglong Ye, Botian Shi, Lewei Lu, Qibin Hou, Tong Lu, Hongsheng Li, Jifeng Dai, Wenhai Wang |
| 2025 | CVPR | SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding. | Hao Li, Changyao Tian, Jie Shao, Xizhou Zhu, Zhaokai Wang, Jinguo Zhu, Wenhan Dou, Xiao-Gang Wang, Hongsheng Li, Lewei Lu, Jifeng Dai |
| 2025 | CVPR | Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training. | Gen Luo, Xue Yang, Wenhan Dou, Zhaokai Wang, Jiawen Liu, Jifeng Dai, Yu Qiao, Xizhou Zhu |
| 2025 | CVPR | MI-DETR: An Object Detection Model with Multi-time Inquiries Mechanism. | Zhixiong Nan, Xianghong Li, Jifeng Dai, Tao Xiang |
| 2025 | CVPR | HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding. | Chenxin Tao, Shiqian Su, Xizhou Zhu, Chenyu Zhang, Zhe Chen, Jiawen Liu, Wenhai Wang, Lewei Lu, Gao Huang, Yu Qiao, Jifeng Dai |
| 2025 | CVPR | PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models. | Chenyu Yang, Xuan Dong, Xizhou Zhu, Weijie Su, Jiahao Wang, Hao Tian, Zhe Chen, Wenhai Wang, Lewei Lu, Jifeng Dai |
| 2025 | ICCV | PUMA: Empowering Unified MLLM with Multi-Granular Visual Generation. | Rongyao Fang, Chengqi Duan, Kun Wang, Hao Li, Linjiang Huang, Hao Tian, Xingyu Zeng, Rui Zhao, Jifeng Dai, Hongsheng Li, Xihui Liu |
| 2025 | ICCV | V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding. | Junqi Ge, Ziyi Chen, Jintao Lin, Jinguo Zhu, Xihui Liu, Jifeng Dai, Xizhou Zhu |
| 2025 | ICCV | Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy. | Zhi Hou, Tianyi Zhang, Yuwen Xiong, Haonan Duan, Hengjun Pu, Ronglei Tong, Chengyang Zhao, Xizhou Zhu, Yu Qiao, Jifeng Dai, Yuntao Chen |
| 2025 | ICCV | LangBridge: Interpreting Image as a Combination of Language Embeddings. | Jiaqi Liao, Yuwei Niu, Fanqing Meng, Hao Li, Changyao Tian, Yinuo Du, Yuwen Xiong, Dianqi Li, Xizhou Zhu, Li Yuan, Jifeng Dai, Yu Cheng |
| 2025 | ICLR | Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures. | Yuchen Duan, Weiyun Wang, Zhe Chen, Xizhou Zhu, Lewei Lu, Tong Lu, Yu Qiao, Hongsheng Li, Jifeng Dai, Wenhai Wang |
| 2025 | ICLR | MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models. | Fanqing Meng, Jin Wang, Chuanhao Li, Quanfeng Lu, Hao Tian, Tianshuo Yang, Jiaqi Liao, Xizhou Zhu, Jifeng Dai, Yu Qiao, Ping Luo, Kaipeng Zhang, Wenqi Shao |
| 2025 | ICLR | Maintaining Structural Integrity in Parameter Spaces for Parameter Efficient Fine-tuning. | Chongjie Si, Xuehui Wang, Xue Yang, Zhengqin Xu, Qingyun Li, Jifeng Dai, Yu Qiao, Xiaokang Yang, Wei Shen |
| 2025 | ICML | CoMemo: LVLMs Need Image Context with Image Memory. | Shi Liu, Weijie Su, Xizhou Zhu, Wenhai Wang, Jifeng Dai |
| 2025 | ICML | MuLan: Adapting Multilingual Diffusion Models for Hundreds of Languages with Negligible Cost. | Sen Xing, Muyan Zhong, Zeqiang Lai, Liangchen Li, Jiawen Liu, Yaohui Wang, Jifeng Dai, Wenhai Wang |
| 2024 | CVPR | Intern VL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks. | Zhe Chen, Jiannan Wu, Wenhai Wang, Weijie Su, Guo Chen, Sen Xing, Muyan Zhong, Qinglong Zhang, Xizhou Zhu, Lewei Lu, Bin Li, Ping Luo, Tong Lu, Yu Qiao, Jifeng Dai |
| 2024 | CVPR | Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft. | Hao Li, Xue Yang, Zhaokai Wang, Xizhou Zhu, Jie Zhou, Yu Qiao, Xiaogang Wang, Hongsheng Li, Lewei Lu, Jifeng Dai |
| 2024 | CVPR | Efficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision Applications. | Yuwen Xiong, Zhiqi Li, Yuntao Chen, Feng Wang, Xizhou Zhu, Jiapeng Luo, Wenhai Wang, Tong Lu, Hongsheng Li, Yu Qiao, Lewei Lu, Jie Zhou, Jifeng Dai |
| 2024 | CVPR | Point2RBox: Combine Knowledge from Synthetic Visual Patterns for End-to-End Oriented Object Detection with Single Point Supervision. | Yi Yu, Xue Yang, Qingyun Li, Feipeng Da, Jifeng Dai, Yu Qiao, Junchi Yan |
| 2024 | ECCV | ControlLLM: Augment Language Models with Tools by Searching on Graphs. | Zhaoyang Liu, Zeqiang Lai, Zhangwei Gao, Erfei Cui, Ziheng Li, Xizhou Zhu, Lewei Lu, Qifeng Chen, Yu Qiao, Jifeng Dai, Wenhai Wang |
| 2024 | ECCV | Distilling Knowledge from Large-Scale Image Models for Object Detection. | Gang Li, Wenhai Wang, Xiang Li, Ziheng Li, Jian Yang, Jifeng Dai, Yu Qiao, Shanshan Zhang |
| 2024 | ECCV | The All-Seeing Project V2: Towards General Relation Comprehension of the Open World. | Weiyun Wang, Yiming Ren, Haowen Luo, Tiantong Li, Chenxiang Yan, Zhe Chen, Wenhai Wang, Qingyun Li, Lewei Lu, Xizhou Zhu, Yu Qiao, Jifeng Dai |
| 2024 | ICLR | ADDP: Learning General Representations for Image Recognition and Generation with Alternating Denoising Diffusion Process. | Changyao Tian, Chenxin Tao, Jifeng Dai, Hao Li, Ziheng Li, Lewei Lu, Xiaogang Wang, Hongsheng Li, Gao Huang, Xizhou Zhu |
| 2024 | ICLR | The All-Seeing Project: Towards Panoptic Visual Recognition and Understanding of the Open World. | Weiyun Wang, Min Shi, Qingyun Li, Wenhai Wang, Zhenhang Huang, Linjie Xing, Zhe Chen, Hao Li, Xizhou Zhu, Zhiguo Cao, Yushi Chen, Tong Lu, Jifeng Dai, Yu Qiao |
| 2024 | ICLR | Bounding Box Stability against Feature Dropout Reflects Detector Generalization across Environments. | Yang Yang, Wenhai Wang, Zhe Chen, Jifeng Dai, Liang Zheng |
| 2024 | ICML | RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis. | Yao Mu, Junting Chen, Qinglong Zhang, Shoufa Chen, Qiaojun Yu, Chongjian Ge, Runjian Chen, Zhixuan Liang, Mengkang Hu, Chaofan Tao, Peize Sun, Haibao Yu, Chao Yang, Wenqi Shao, Wenhai Wang, Jifeng Dai, Yu Qiao, Mingyu Ding, Ping Luo |
| 2024 | SIGGRAPH | Motion-I2V: Consistent and Controllable Image-to-Video Generation with Explicit Motion Modeling. | Xiaoyu Shi, Zhaoyang Huang, Fu-Yun Wang, Weikang Bian, Dasong Li, Yi Zhang, Manyuan Zhang, Ka Chun Cheung, Simon See, Hongwei Qin, Jifeng Dai, Hongsheng Li |
| 2023 | CVPR | Towards All-in-One Pre-Training via Maximizing Multi-Modal Mutual Information. | Weijie Su, Xizhou Zhu, Chenxin Tao, Lewei Lu, Bin Li, Gao Huang, Yu Qiao, Xiaogang Wang, Jie Zhou, Jifeng Dai |
| 2023 | CVPR | Planning-oriented Autonomous Driving. | Yihan Hu, Jiazhi Yang, Li Chen, Keyu Li, Chonghao Sima, Xizhou Zhu, Siqi Chai, Senyao Du, Tianwei Lin, Wenhai Wang, Lewei Lu, Xiaosong Jia, Qiang Liu, Jifeng Dai, Yu Qiao, Hongyang Li |
| 2023 | CVPR | Uni-Perceiver v2: A Generalist Model for Large-Scale Vision and Vision-Language Tasks. | Hao Li, Jinguo Zhu, Xiaohu Jiang, Xizhou Zhu, Hongsheng Li, Chun Yuan, Xiaohua Wang, Yu Qiao, Xiaogang Wang, Wenhai Wang, Jifeng Dai |
| 2023 | CVPR | FlowFormer++: Masked Cost Volume Autoencoding for Pretraining Optical Flow Estimation. | Xiaoyu Shi, Zhaoyang Huang, Dasong Li, Manyuan Zhang, Ka Chun Cheung, Simon See, Hongwei Qin, Jifeng Dai, Hongsheng Li |
| 2023 | CVPR | Siamese Image Modeling for Self-Supervised Vision Representation Learning. | Chenxin Tao, Xizhou Zhu, Weijie Su, Gao Huang, Bin Li, Jie Zhou, Yu Qiao, Xiaogang Wang, Jifeng Dai |
| 2023 | CVPR | InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions. | Wenhai Wang, Jifeng Dai, Zhe Chen, Zhenhang Huang, Zhiqi Li, Xizhou Zhu, Xiaowei Hu, Tong Lu, Lewei Lu, Hongsheng Li, Xiaogang Wang, Yu Qiao |
| 2023 | CVPR | Video Dehazing via a Multi-Range Temporal Alignment Network with Physical Prior. | Jiaqi Xu, Xiaowei Hu, Lei Zhu, Qi Dou, Jifeng Dai, Yu Qiao, Pheng-Ann Heng |
| 2023 | CVPR | BEVFormer v2: Adapting Modern Image Backbones to Bird's-Eye-View Recognition via Perspective Supervision. | Chenyu Yang, Yuntao Chen, Hao Tian, Chenxin Tao, Xizhou Zhu, Zhaoxiang Zhang, Gao Huang, Hongyang Li, Yu Qiao, Lewei Lu, Jie Zhou, Jifeng Dai |
| 2023 | CVPR | Learning Weather-General and Weather-Specific Features for Image Restoration Under Multiple Adverse Weather Conditions. | Yurui Zhu, Tianyu Wang, Xueyang Fu, Xuanyu Yang, Xin Guo, Jifeng Dai, Yu Qiao, Xiaowei Hu |
| 2023 | ICCV | VideoFlow: Exploiting Temporal Cues for Multi-frame Optical Flow Estimation. | Xiaoyu Shi, Zhaoyang Huang, Weikang Bian, Dasong Li, Manyuan Zhang, Ka Chun Cheung, Simon See, Hongwei Qin, Jifeng Dai, Hongsheng Li |
| 2023 | ICLR | Vision Transformer Adapter for Dense Predictions. | Zhe Chen, Yuchen Duan, Wenhai Wang, Junjun He, Tong Lu, Jifeng Dai, Yu Qiao |
| 2022 | CVPR | AutoLoss-Zero: Searching Loss Functions from Scratch for Generic Tasks. | Hao Li, Tianwen Fu, Jifeng Dai, Hongsheng Li, Gao Huang, Xizhou Zhu |
| 2022 | CVPR | Exploring the Equivalence of Siamese Self-Supervised Learning via A Unified Gradient Framework. | Chenxin Tao, Honghui Wang, Xizhou Zhu, Jiahua Dong, Shiji Song, Gao Huang, Jifeng Dai |
| 2022 | CVPR | Uni-Perceiver: Pre-training Unified Architecture for Generic Perception for Zero-shot and Few-shot Tasks. | Xizhou Zhu, Jinguo Zhu, Hao Li, Xiaoshi Wu, Hongsheng Li, Xiaohua Wang, Jifeng Dai |
| 2022 | ECCV | FlowFormer: A Transformer Architecture for Optical Flow. | Zhaoyang Huang, Xiaoyu Shi, Chao Zhang, Qiang Wang, Ka Chun Cheung, Hongwei Qin, Jifeng Dai, Hongsheng Li |
| 2022 | ECCV | Frozen CLIP Models are Efficient Video Learners. | Ziyi Lin, Shijie Geng, Renrui Zhang, Peng Gao, Gerard de Melo, Xiaogang Wang, Jifeng Dai, Yu Qiao, Hongsheng Li |
| 2022 | ECCV | BEVFormer: Learning Bird's-Eye-View Representation from Multi-camera Images via Spatiotemporal Transformers. | Zhiqi Li, Wenhai Wang, Hongyang Li, Enze Xie, Chonghao Sima, Tong Lu, Yu Qiao, Jifeng Dai |
| 2022 | ECCV | VL-LTR: Learning Class-wise Visual-Linguistic Representation for Long-Tailed Visual Recognition. | Changyao Tian, Wenhai Wang, Xizhou Zhu, Jifeng Dai, Yu Qiao |
| 2022 | ECCV | Tip-Adapter: Training-Free Adaption of CLIP for Few-Shot Classification. | Renrui Zhang, Wei Zhang, Rongyao Fang, Peng Gao, Kunchang Li, Jifeng Dai, Yu Qiao, Hongsheng Li |
| 2021 | CVPR | Unsupervised Object Detection With LIDAR Clues. | Hao Tian, Yuntao Chen, Jifeng Dai, Zhaoxiang Zhang, Xizhou Zhu |
| 2021 | ICCV | Fast Convergence of DETR with Spatially Modulated Co-Attention. | Peng Gao, Minghang Zheng, Xiaogang Wang, Jifeng Dai, Hongsheng Li |
| 2021 | ICCV | FuseFormer: Fusing Fine-Grained Information in Transformers for Video Inpainting. | Rui Liu, Hanming Deng, Yangyi Huang, Xiaoyu Shi, Lewei Lu, Wenxiu Sun, Xiaogang Wang, Jifeng Dai, Hongsheng Li |
| 2021 | ICCV | Influence Selection for Active Learning. | Zhuoming Liu, Hao Ding, Huaping Zhong, Weijia Li, Jifeng Dai, Conghui He |
| 2021 | ICCV | Exploring Cross-Image Pixel Contrast for Semantic Segmentation. | Wenguan Wang, Tianfei Zhou, Fisher Yu, Jifeng Dai, Ender Konukoglu, Luc Van Gool |
| 2021 | ICLR | Auto Seg-Loss: Searching Metric Surrogates for Semantic Segmentation. | Hao Li, Chenxin Tao, Xizhou Zhu, Xiaogang Wang, Gao Huang, Jifeng Dai |
| 2021 | ICLR | Deformable DETR: Deformable Transformers for End-to-End Object Detection. | Xizhou Zhu, Weijie Su, Lewei Lu, Bin Li, Xiaogang Wang, Jifeng Dai |
| 2020 | CVPR | Hierarchical Human Parsing With Typed Part-Relation Reasoning. | Wenguan Wang, Hailong Zhu, Jifeng Dai, Yanwei Pang, Jianbing Shen, Ling Shao |
| 2020 | CVPR | Resolution Adaptive Networks for Efficient Inference. | Le Yang, Yizeng Han, Xi Chen, Shiji Song, Jifeng Dai, Gao Huang |
| 2020 | ECCV | Mining Cross-Image Semantics for Weakly Supervised Semantic Segmentation. | Guolei Sun, Wenguan Wang, Jifeng Dai, Luc Van Gool |
| 2020 | ICLR | Deformable Kernels: Adapting Effective Receptive Fields for Object Deformation. | Hang Gao, Xizhou Zhu, Stephen Lin, Jifeng Dai |
| 2020 | ICLR | VL-BERT: Pre-training of Generic Visual-Linguistic Representations. | Weijie Su, Xizhou Zhu, Yue Cao, Bin Li, Lewei Lu, Furu Wei, Jifeng Dai |
| 2019 | CVPR | Deformable ConvNets V2: More Deformable, Better Results. | Xizhou Zhu, Han Hu, Stephen Lin, Jifeng Dai |
| 2019 | ICCV | An Empirical Study of Spatial Attention Mechanisms in Deep Networks. | Xizhou Zhu, Dazhi Cheng, Zheng Zhang, Stephen Lin, Jifeng Dai |
| 2018 | CVPR | Relation Networks for Object Detection. | Han Hu, Jiayuan Gu, Zheng Zhang, Jifeng Dai, Yichen Wei |
| 2018 | CVPR | Towards High Performance Video Object Detection. | Xizhou Zhu, Jifeng Dai, Lu Yuan, Yichen Wei |
| 2018 | ECCV | Learning Region Features for Object Detection. | Jiayuan Gu, Han Hu, Liwei Wang, Yichen Wei, Jifeng Dai |
| 2017 | CVPR | Fully Convolutional Instance-Aware Semantic Segmentation. | Yi Li, Haozhi Qi, Jifeng Dai, Xiangyang Ji, Yichen Wei |
| 2017 | CVPR | Deep Feature Flow for Video Recognition. | Xizhou Zhu, Yuwen Xiong, Jifeng Dai, Lu Yuan, Yichen Wei |
| 2017 | ICCV | Deformable Convolutional Networks. | Jifeng Dai, Haozhi Qi, Yuwen Xiong, Yi Li, Guodong Zhang, Han Hu, Yichen Wei |
| 2017 | ICCV | Flow-Guided Feature Aggregation for Video Object Detection. | Xizhou Zhu, Yujie Wang, Jifeng Dai, Lu Yuan, Yichen Wei |
| 2016 | CVPR | Instance-Aware Semantic Segmentation via Multi-task Network Cascades. | Jifeng Dai, Kaiming He, Jian Sun |
| 2016 | CVPR | ScribbleSup: Scribble-Supervised Convolutional Networks for Semantic Segmentation. | Di Lin, Jifeng Dai, Jiaya Jia, Kaiming He, Jian Sun |
| 2016 | ECCV | Instance-Sensitive Fully Convolutional Networks. | Jifeng Dai, Kaiming He, Yi Li, Shaoqing Ren, Jian Sun |
| 2015 | CVPR | Convolutional feature masking for joint object and stuff segmentation. | Jifeng Dai, Kaiming He, Jian Sun |
| 2015 | ICCV | BoxSup: Exploiting Bounding Boxes to Supervise Convolutional Networks for Semantic Segmentation. | Jifeng Dai, Kaiming He, Jian Sun |
| 2014 | CVPR | Unsupervised Learning of Dictionaries of Hierarchical Compositional Models. | Jifeng Dai, Yi Hong, Wenze Hu, Song-Chun Zhu, Ying Nian Wu |
| 2013 | ICCV | Cosegmentation and Cosketch by Unsupervised Learning. | Jifeng Dai, Ying Nian Wu, Jie Zhou, Song-Chun Zhu |
| 2012 | ICPR | Mining sub-categories for object detection. | Jifeng Dai, Jianjiang Feng, Jie Zhou |