Skip to content

Mike Zheng Shou

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

86

Venues

13

Active years

2021–2026

Best venue rank

A*

Where they publish

Papers

86 indexed papers, newest first.

YearVenueTitleAuthors
2026AAAIOptMark: Robust Multi-bit Diffusion Watermarking via Inference Time Optimization.Jiazheng Xing, Hai Ci, Hongbin Xu, Hangjie Yuan, Yong Liu, Mike Zheng Shou
2025AAAIVG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting.Muhammet Furkan Ilaslan, Ali Kksal, Kevin Qinghong Lin, Burak Satar, Mike Zheng Shou, Qianli Xu
2025ACLPhysReason: A Comprehensive Benchmark towards Physics-Based Reasoning.Xinyu Zhang, Yuxuan Dong, Yanrui Wu, Jiaxing Huang, Chengyou Jia, Basura Fernando, Mike Zheng Shou, Lingling Zhang, Jun Liu
2025CVPRMovieBench: A Hierarchical Movie Level Dataset for Long Video Generation.Weijia Wu, Mingyu Liu, Zeyu Zhu, Xi Xia, Haoen Feng, Wen Wang, Kevin Qinghong Lin, Chunhua Shen, Mike Zheng Shou
2025CVPRDoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal Cycles.Rui Zhao, Weijia Mao, Mike Zheng Shou
2025CVPRLiveCC: Learning Video LLM with Streaming Speech Transcription at Scale.Joya Chen, Ziyun Zeng, Yiqi Lin, Wei Li, Zejun Ma, Mike Zheng Shou
2025CVPRROICtrl: Boosting Instance Control for Visual Generation.Yuchao Gu, Yipin Zhou, Yunfan Ye, Yixin Nie, Licheng Yu, Pingchuan Ma, Kevin Qinghong Lin, Mike Zheng Shou
2025CVPRShowUI: One Vision-Language-Action Model for GUI Visual Agent.Kevin Qinghong Lin, Linjie Li, Difei Gao, Zhengyuan Yang, Shiwei Wu, Zechen Bai, Stan Weixian Lei, Lijuan Wang, Mike Zheng Shou
2025CVPRVLog: Video-Language Models by Generative Retrieval of Narration Vocabulary.Kevin Qinghong Lin, Mike Zheng Shou
2025CVPRSAM-I2V: Upgrading SAM to Support Promptable Video Segmentation with Less than 0.2% Training Cost.Haiyang Mei, Pengyu Zhang, Mike Zheng Shou
2025CVPRIDProtector: An Adversarial Noise Encoder to Protect Against ID-Preserving Image Generation.Yiren Song, Pei Yang, Hai Ci, Mike Zheng Shou
2025CVPRDIFIX3D+: Improving 3D Reconstructions with Single-Step Diffusion Models.Jay Zhangjie Wu, Yuxuan Zhang, Haithem Turki, Xuanchi Ren, Jun Gao, Mike Zheng Shou, Sanja Fidler, Zan Gojcic, Huan Ling
2025CVPRReCapture: Generative Video Camera Controls for User-Provided Videos using Masked Video Fine-Tuning.David Junhao Zhang, Roni Paiss, Shiran Zada, Nikhil Karnad, David E. Jacobs, Yael Pritch, Inbar Mosseri, Mike Zheng Shou, Neal Wadhwa, Nataniel Ruiz
2025EMNLPInterFeedback: Unveiling Interactive Intelligence of Large Multimodal Models with Human Feedback.Henry Hengyuan Zhao, Wenqi Pei, Yifei Tao, Haiyang Mei, Mike Zheng Shou
2025ICCVBalanced Image Stylization with Style Matching Score.Yuxin Jiang, Liming Jiang, Shuai Yang, Jia-Wei Liu, Ivor W. Tsang, Mike Zheng Shou
2025ICCVLayerTracer: Cognitive-Aligned Layered SVG Synthesis via Diffusion Transformer.Yiren Song, Danze Chen, Mike Zheng Shou
2025ICCVDiffSim: Taming Diffusion Models for Evaluating Visual Similarity.Yiren Song, Xiaokang Liu, Mike Zheng Shou
2025ICCVFactorized Learning for Temporally Grounded Video-Language Models.Wenzheng Zeng, Difei Gao, Mike Zheng Shou, Hwee Tou Ng
2025ICLRBridging Information Asymmetry in Text-video Retrieval: A Data-centric Approach.Zechen Bai, Tianjun Xiao, Tong He, Pichao Wang, Zheng Zhang, Thomas Brox, Mike Zheng Shou
2025ICLRMP-Mat: A 3D-and-Instance-Aware Human Matting and Editing Framework with Multiplane Representation.Siyi Jiao, Wenzheng Zeng, Yerong Li, Huayu Zhang, Changxin Gao, Nong Sang, Mike Zheng Shou
2025ICLRGrounding Multimodal Large Language Model in GUI World.Weixian Lei, Difei Gao, Mike Zheng Shou
2025ICLRImage Watermarks are Removable using Controllable Regeneration from Clean Noise.Yepeng Liu, Yiren Song, Hai Ci, Yu Zhang, Haofan Wang, Mike Zheng Shou, Yuheng Bu
2025ICLRShow-o: One Single Transformer to Unify Multimodal Understanding and Generation.Jinheng Xie, Weijia Mao, Zechen Bai, David Junhao Zhang, Weihao Wang, Kevin Qinghong Lin, Yuchao Gu, Zhijie Chen, Zhenheng Yang, Mike Zheng Shou
2025ICMLImpossible Videos.Zechen Bai, Hai Ci, Mike Zheng Shou
2025ICMLWMAdapter: Adding WaterMark Control to Latent Diffusion Models.Hai Ci, Yiren Song, Pei Yang, Jinheng Xie, Mike Zheng Shou
2024CVPRVideoLLM-online: Online Video Large Language Model for Streaming Video.Joya Chen, Zhaoyang Lv, Shiwei Wu, Kevin Qinghong Lin, Chenan Song, Difei Gao, Jia-Wei Liu, Ziteng Gao, Dongxing Mao, Mike Zheng Shou
2024CVPRAssistGUI: Task-Oriented PC Graphical User Interface Automation.Difei Gao, Lei Ji, Zechen Bai, Mingyu Ouyang, Peiran Li, Dongxing Mao, Qinchen Wu, Weichen Zhang, Peiyi Wang, Xiangwu Guo, Hengxu Wang, Luowei Zhou, Mike Zheng Shou
2024CVPRBootstrapping SparseFormers from Vision Foundation Models.Ziteng Gao, Zhan Tong, Kevin Qinghong Lin, Joya Chen, Mike Zheng Shou
2024CVPRRethinking the Objectives of Vector-Quantized Tokenizers for Image Synthesis.Yuchao Gu, Xintao Wang, Yixiao Ge, Ying Shan, Mike Zheng Shou
2024CVPRVideoSwap: Customized Video Subject Swapping with Interactive Semantic Point Correspondence.Yuchao Gu, Yipin Zhou, Bichen Wu, Licheng Yu, Jia-Wei Liu, Rui Zhao, Jay Zhangjie Wu, David Junhao Zhang, Mike Zheng Shou, Kevin Tang
2024CVPRVIT-LENS: Towards Omni-modal Representations.Weixian Lei, Yixiao Ge, Kun Yi, Jianfeng Zhang, Difei Gao, Dylan Sun, Yuying Ge, Ying Shan, Mike Zheng Shou
2024CVPRDynVideo-E: Harnessing Dynamic NeRF for Large-Scale Motion- and View-Change Human-Centric Video Editing.Jia-Wei Liu, Yan-Pei Cao, Jay Zhangjie Wu, Weijia Mao, Yuchao Gu, Rui Zhao, Jussi Keppo, Ying Shan, Mike Zheng Shou
2024CVPRX- Adapter: Universal Compatibility of Plugins for Upgraded Diffusion Model.Lingmin Ran, Xiaodong Cun, Jia-Wei Liu, Rui Zhao, Song Zijie, Xintao Wang, Jussi Keppo, Mike Zheng Shou
2024CVPRL4D-Track: Language-to-4D Modeling Towards 6-DoF Tracking and Shape Reconstruction in 3D Point Cloud Stream.Jingtao Sun, Yaonan Wang, Mingtao Feng, Yulan Guo, Ajmal Mian, Mike Zheng Shou
2024CVPRTune-an-Ellipse: CLIP Has Potential to Find what you Want.Jinheng Xie, Songhe Deng, Bing Li, Haozhe Liu, Yawen Huang, Yefeng Zheng, Jrgen Schmidhuber, Bernard Ghanem, Linlin Shen, Mike Zheng Shou
2024CVPRMagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model.Zhongcong Xu, Jianfeng Zhang, Jun Hao Liew, Hanshu Yan, Jia-Wei Liu, Chenxu Zhang, Jiashi Feng, Mike Zheng Shou
2024ECCVRingID: Rethinking Tree-Ring Watermarking for Enhanced Multi-key Identification.Hai Ci, Pei Yang, Yiren Song, Mike Zheng Shou
2024ECCVParrot Captions Teach CLIP to Spot Text.Yiqi Lin, Conghui He, Alex Jinpeng Wang, Bin Wang, Weijia Li, Mike Zheng Shou
2024ECCVLearning Video Context as Interleaved Multimodal Sequences.Kevin Qinghong Lin, Pengchuan Zhang, Difei Gao, Xide Xia, Joya Chen, Ziteng Gao, Jinheng Xie, Xuhong Xiao, Mike Zheng Shou
2024ECCVDragAnything: Motion Control for Anything Using Entity Representation.Weijia Wu, Zhuang Li, Yuchao Gu, Rui Zhao, Yefei He, David Junhao Zhang, Mike Zheng Shou, Yan Li, Tingting Gao, Di Zhang
2024ECCVFree-ATM: Harnessing Free Attention Masks for Representation Learning on Diffusion-Generated Images.David Junhao Zhang, Mutian Xu, Jay Zhangjie Wu, Chuhui Xue, Wenqing Zhang, Xiaoguang Han, Song Bai, Mike Zheng Shou
2024ECCVMotionDirector: Motion Customization of Text-to-Video Diffusion Models.Rui Zhao, Yuchao Gu, Jay Zhangjie Wu, David Junhao Zhang, Jia-Wei Liu, Weijia Wu, Jussi Keppo, Mike Zheng Shou
2024ECCVGENIXER: Empowering Multimodal Large Language Model as a Powerful Data Generator.Henry Hengyuan Zhao, Pan Zhou, Mike Zheng Shou
2024ICASSPSpiking-Leaf: A Learnable Auditory Front-End for Spiking Neural Networks.Zeyang Song, Jibin Wu, Malu Zhang, Mike Zheng Shou, Haizhou Li
2024ICLRSparseFormer: Sparse Visual Recognition via Limited Latent Tokens.Ziteng Gao, Zhan Tong, Limin Wang, Mike Zheng Shou
2024IJCAIDelocate: Detection and Localization for Deepfake Videos with Randomly-Located Tampered Traces.Juan Hu, Xin Liao, Difei Gao, Satoshi Tsutsui, Qian Wang, Zheng Qin, Mike Zheng Shou
2024IJCAIApprenticeship-Inspired Elegance: Synergistic Knowledge Distillation Empowers Spiking Neural Networks for Efficient Single-Eye Emotion Recognition.Yang Wang, Haiyang Mei, Qirui Bao, Ziqi Wei, Mike Zheng Shou, Haizhou Li, Bo Dong, Xin Yang
2024SiggraphAProcessPainter: Learning to draw from sequence data.Yiren Song, Shijie Huang, Chen Yao, Hai Ci, Xiaojun Ye, Jiaming Liu, Yuxuan Zhang, Mike Zheng Shou
2023AAAISymbolic Replay: Scene Graph as Prompt for Continual Learning on VQA Task.Stan Weixian Lei, Difei Gao, Jay Zhangjie Wu, Yuxuan Wang, Wei Liu, Mengmi Zhang, Mike Zheng Shou
2023AAAIVideo-Text Pre-training with Learned Regions for Retrieval.Rui Yan, Mike Zheng Shou, Yixiao Ge, Jinpeng Wang, Xudong Lin, Guanyu Cai, Jinhui Tang
2023AAAIDarwinian Model Upgrades: Model Evolving with Selective Compatibility.Binjie Zhang, Shupeng Su, Yixiao Ge, Xuyuan Xu, Yexin Wang, Chun Yuan, Mike Zheng Shou, Ying Shan
2023ACLCONE: An Efficient COarse-to-fiNE Alignment Framework for Long Video Temporal Grounding.Zhijian Hou, Wanjun Zhong, Lei Ji, Difei Gao, Kun Yan, Wing Kwong Chan, Chong-Wah Ngo, Mike Zheng Shou, Nan Duan
2023CVPRTowards Fast Adaptation of Pretrained Contrastive Models for Multi-channel Video-Language Retrieval.Xudong Lin, Simran Tiwari, Shiyuan Huang, Manling Li, Mike Zheng Shou, Heng Ji, Shih-Fu Chang
2023CVPRMaking Vision Transformers Efficient from A Token Sparsification View.Shuning Chang, Pichao Wang, Ming Lin, Fan Wang, David Junhao Zhang, Rong Jin, Mike Zheng Shou
2023CVPRDOAD: Decoupled One Stage Action Detection Network.Shuning Chang, Pichao Wang, Fan Wang, Jiashi Feng, Mike Zheng Shou
2023CVPRAffordance Grounding from Demonstration Video to Target Image.Joya Chen, Difei Gao, Kevin Qinghong Lin, Mike Zheng Shou
2023CVPRMIST : Multi-modal Iterative Spatial-Temporal Transformer for Long-form Video Question Answering.Difei Gao, Luowei Zhou, Lei Ji, Linchao Zhu, Yi Yang, Mike Zheng Shou
2023CVPRAll in One: Exploring Unified Video-Language Pre-Training.Jinpeng Wang, Yixiao Ge, Rui Yan, Yuying Ge, Kevin Qinghong Lin, Satoshi Tsutsui, Xudong Lin, Guanyu Cai, Jianping Wu, Ying Shan, Xiaohu Qie, Mike Zheng Shou
2023CVPRPosition-Guided Text Prompt for Vision-Language Pre-Training.Jinpeng Wang, Pan Zhou, Mike Zheng Shou, Shuicheng Yan
2023EMNLPGazeVQA: A Video Question Answering Dataset for Multiview Eye-Gaze Task-Oriented Collaborations.Muhammet Furkan Ilaslan, Chenan Song, Joya Chen, Difei Gao, Weixian Lei, Qianli Xu, Joo Lim, Mike Zheng Shou
2023ICCVRevisiting Vision Transformer from the View of Path Ensemble.Shuning Chang, Pichao Wang, Hao Luo, Fan Wang, Mike Zheng Shou
2023ICCVUnsupervised Open-Vocabulary Object Localization in Videos.Ke Fan, Zechen Bai, Tianjun Xiao, Dominik Zietlow, Max Horn, Zixu Zhao, Carl-Johann Simon-Gabriel, Mike Zheng Shou, Francesco Locatello, Bernt Schiele, Thomas Brox, Zheng Zhang, Yanwei Fu, Tong He
2023ICCVUniVTG: Towards Unified Video-Language Temporal Grounding.Kevin Qinghong Lin, Pengchuan Zhang, Joya Chen, Shraman Pramanick, Difei Gao, Alex Jinpeng Wang, Rui Yan, Mike Zheng Shou
2023ICCVHOSNeRF: Dynamic Human-Object-Scene Neural Radiance Fields from a Single Video.Jia-Wei Liu, Yan-Pei Cao, Tianyuan Yang, Zhongcong Xu, Jussi Keppo, Ying Shan, Xiaohu Qie, Mike Zheng Shou
2023ICCVSTPrivacy: Spatio-Temporal Privacy-Preserving Action Recognition.Ming Li, Xiangyu Xu, Hehe Fan, Pan Zhou, Jun Liu, Jia-Wei Liu, Jiahe Li, Jussi Keppo, Mike Zheng Shou, Shuicheng Yan
2023ICCVEgoVLPv2: Egocentric Video-Language Pre-training with Fusion in the Backbone.Shraman Pramanick, Yale Song, Sayan Nag, Kevin Qinghong Lin, Hardik Shah, Mike Zheng Shou, Rama Chellappa, Pengchuan Zhang
2023ICCVLearning to Learn: How to Continuously Teach Humans and Machines.Parantak Singh, You Li, Ankur Sikarwar, Weixian Lei, Difei Gao, Morgan B. Talbot, Ying Sun, Mike Zheng Shou, Gabriel Kreiman, Mengmi Zhang
2023ICCVToo Large; Data Reduction for Vision-Language Pre-Training.Alex Jinpeng Wang, Kevin Qinghong Lin, David Junhao Zhang, Stan Weixian Lei, Mike Zheng Shou
2023ICCVTune-A-Video: One-Shot Tuning of Image Diffusion Models for Text-to-Video Generation.Jay Zhangjie Wu, Yixiao Ge, Xintao Wang, Stan Weixian Lei, Yuchao Gu, Yufei Shi, Wynne Hsu, Ying Shan, Xiaohu Qie, Mike Zheng Shou
2023ICCVLabel-Efficient Online Continual Object Detection in Streaming Video.Jay Zhangjie Wu, David Junhao Zhang, Wynne Hsu, Mengmi Zhang, Mike Zheng Shou
2023ICCVDiffuMask: Synthesizing Images with Pixel-level Annotations for Semantic Segmentation Using Diffusion Models.Weijia Wu, Yuzhong Zhao, Mike Zheng Shou, Hong Zhou, Chunhua Shen
2023ICCVBoxDiff: Text-to-Image Synthesis with Training-Free Box-Constrained Diffusion.Jinheng Xie, Yuexiang Li, Yawen Huang, Haozhe Liu, Wentian Zhang, Yefeng Zheng, Mike Zheng Shou
2023ICDARICDAR 2023 Competition on Video Text Reading for Dense and Small Text.Weijia Wu, Yuzhong Zhao, Zhuang Li, Jiahong Li, Mike Zheng Shou, Umapada Pal, Dimosthenis Karatzas, Xiang Bai
2023ICDEThe Metaverse Data Deluge: What Can We Do About It?Beng Chin Ooi, Gang Chen, Mike Zheng Shou, Kian-Lee Tan, Anthony K. H. Tung, Xiaokui Xiao, James Wei Luen Yip, Bingxue Zhang, Meihui Zhang
2023ICLRPV3D: A 3D Generative Model for Portrait Video Generation.Eric Zhongcong Xu, Jianfeng Zhang, Jun Hao Liew, Wenqing Zhang, Song Bai, Jiashi Feng, Mike Zheng Shou
2022CVPREgo4D: Around the World in 3, 000 Hours of Egocentric Video.Kristen Grauman, Andrew Westbury, Eugene Byrne, Zachary Chavis, Antonino Furnari, Rohit Girdhar, Jackson Hamburger, Hao Jiang, Miao Liu, Xingyu Liu, Miguel Martin, Tushar Nagarajan, Ilija Radosavovic, Santhosh Kumar Ramakrishnan, Fiona Ryan, Jayant Sharma, Michael Wray, Mengmeng Xu, Eric Zhongcong Xu, Chen Zhao, Siddhant Bansal, Dhruv Batra, Vincent Cartillier, Sean Crane, Tien Do, Morrie Doulaty, Akshay Erapalli, Christoph Feichtenhofer, Adriano Fragomeni, Qichen Fu, Abrham Gebreselasie, Cristina Gonzlez, James Hillis, Xuhua Huang, Yifei Huang, Wenqi Jia, Weslie Khoo, Jchym Kolr, Satwik Kottur, Anurag Kumar, Federico Landini, Chao Li, Yanghao Li, Zhenqiang Li, Karttikeya Mangalam, Raghava Modhugu, Jonathan Munro, Tullie Murrell, Takumi Nishiyasu, Will Price, Paola Ruiz Puentes, Merey Ramazanova, Leda Sari, Kiran K. Somasundaram, Audrey Southerland, Yusuke Sugano, Ruijie Tao, Minh Vo, Yuchen Wang, Xindi Wu, Takuma Yagi, Ziwei Zhao, Yunyi Zhu, Pablo Arbelez, David Crandall, Dima Damen, Giovanni Maria Farinella, Christian Fuegen, Bernard Ghanem, Vamsi Krishna Ithapu, C. V. Jawahar, Hanbyul Joo, Kris Kitani, Haizhou Li, Richard A. Newcombe, Aude Oliva, Hyun Soo Park, James M. Rehg, Yoichi Sato, Jianbo Shi, Mike Zheng Shou, Antonio Torralba, Lorenzo Torresani, Mingfei Yan, Jitendra Malik
2022CVPRUnified Transformer Tracker for Object Tracking.Fan Ma, Mike Zheng Shou, Linchao Zhu, Haoqi Fan, Yilei Xu, Yi Yang, Zhicheng Yan
2022CVPRObject-aware Video-language Pre-training for Retrieval.Alex Jinpeng Wang, Yixiao Ge, Guanyu Cai, Rui Yan, Xudong Lin, Ying Shan, Xiaohu Qie, Mike Zheng Shou
2022ECCVGEB+: A Benchmark for Generic Event Boundary Captioning, Grounding and Retrieval.Yuxuan Wang, Difei Gao, Licheng Yu, Weixian Lei, Matt Feiszli, Mike Zheng Shou
2022ECCVAssistQ: Affordance-Centric Question-Driven Task Completion for Egocentric Assistant.Benita Wong, Joya Chen, You Wu, Stan Weixian Lei, Dongxing Mao, Difei Gao, Mike Zheng Shou
2022ECCVMorphMLP: An Efficient MLP-Like Backbone for Spatial-Temporal Representation Learning.David Junhao Zhang, Kunchang Li, Yali Wang, Yunpeng Chen, Shashwat Chandra, Yu Qiao, Luoqi Liu, Mike Zheng Shou
2022EMNLPAssistSR: Task-oriented Video Segment Retrieval for Personal AI Assistant.Weixian Lei, Difei Gao, Yuxuan Wang, Dongxing Mao, Zihan Liang, Lingmin Ran, Mike Zheng Shou
2021CVPRActor-Context-Actor Relation Network for Spatio-Temporal Action Localization.Junting Pan, Siyu Chen, Mike Zheng Shou, Yu Liu, Jing Shao, Hongsheng Li
2021EMNLPOn Pursuit of Designing Multi-modal Transformer for Video Grounding.Meng Cao, Long Chen, Mike Zheng Shou, Can Zhang, Yuexian Zou
2021ICCVGeneric Event Boundary Detection: A Benchmark for Event Segmentation.Mike Zheng Shou, Stan Weixian Lei, Weiyao Wang, Deepti Ghadiyaram, Matt Feiszli
2021ICCVChannel Augmented Joint Learning for Visible-Infrared Recognition.Mang Ye, Weijian Ruan, Bo Du, Mike Zheng Shou