Mike Zheng Shou
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
86
Venues
13
Active years
2021–2026
Best venue rank
A*
Where they publish
Papers
86 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | AAAI | OptMark: Robust Multi-bit Diffusion Watermarking via Inference Time Optimization. | Jiazheng Xing, Hai Ci, Hongbin Xu, Hangjie Yuan, Yong Liu, Mike Zheng Shou |
| 2025 | AAAI | VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting. | Muhammet Furkan Ilaslan, Ali Kksal, Kevin Qinghong Lin, Burak Satar, Mike Zheng Shou, Qianli Xu |
| 2025 | ACL | PhysReason: A Comprehensive Benchmark towards Physics-Based Reasoning. | Xinyu Zhang, Yuxuan Dong, Yanrui Wu, Jiaxing Huang, Chengyou Jia, Basura Fernando, Mike Zheng Shou, Lingling Zhang, Jun Liu |
| 2025 | CVPR | MovieBench: A Hierarchical Movie Level Dataset for Long Video Generation. | Weijia Wu, Mingyu Liu, Zeyu Zhu, Xi Xia, Haoen Feng, Wen Wang, Kevin Qinghong Lin, Chunhua Shen, Mike Zheng Shou |
| 2025 | CVPR | DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal Cycles. | Rui Zhao, Weijia Mao, Mike Zheng Shou |
| 2025 | CVPR | LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale. | Joya Chen, Ziyun Zeng, Yiqi Lin, Wei Li, Zejun Ma, Mike Zheng Shou |
| 2025 | CVPR | ROICtrl: Boosting Instance Control for Visual Generation. | Yuchao Gu, Yipin Zhou, Yunfan Ye, Yixin Nie, Licheng Yu, Pingchuan Ma, Kevin Qinghong Lin, Mike Zheng Shou |
| 2025 | CVPR | ShowUI: One Vision-Language-Action Model for GUI Visual Agent. | Kevin Qinghong Lin, Linjie Li, Difei Gao, Zhengyuan Yang, Shiwei Wu, Zechen Bai, Stan Weixian Lei, Lijuan Wang, Mike Zheng Shou |
| 2025 | CVPR | VLog: Video-Language Models by Generative Retrieval of Narration Vocabulary. | Kevin Qinghong Lin, Mike Zheng Shou |
| 2025 | CVPR | SAM-I2V: Upgrading SAM to Support Promptable Video Segmentation with Less than 0.2% Training Cost. | Haiyang Mei, Pengyu Zhang, Mike Zheng Shou |
| 2025 | CVPR | IDProtector: An Adversarial Noise Encoder to Protect Against ID-Preserving Image Generation. | Yiren Song, Pei Yang, Hai Ci, Mike Zheng Shou |
| 2025 | CVPR | DIFIX3D+: Improving 3D Reconstructions with Single-Step Diffusion Models. | Jay Zhangjie Wu, Yuxuan Zhang, Haithem Turki, Xuanchi Ren, Jun Gao, Mike Zheng Shou, Sanja Fidler, Zan Gojcic, Huan Ling |
| 2025 | CVPR | ReCapture: Generative Video Camera Controls for User-Provided Videos using Masked Video Fine-Tuning. | David Junhao Zhang, Roni Paiss, Shiran Zada, Nikhil Karnad, David E. Jacobs, Yael Pritch, Inbar Mosseri, Mike Zheng Shou, Neal Wadhwa, Nataniel Ruiz |
| 2025 | EMNLP | InterFeedback: Unveiling Interactive Intelligence of Large Multimodal Models with Human Feedback. | Henry Hengyuan Zhao, Wenqi Pei, Yifei Tao, Haiyang Mei, Mike Zheng Shou |
| 2025 | ICCV | Balanced Image Stylization with Style Matching Score. | Yuxin Jiang, Liming Jiang, Shuai Yang, Jia-Wei Liu, Ivor W. Tsang, Mike Zheng Shou |
| 2025 | ICCV | LayerTracer: Cognitive-Aligned Layered SVG Synthesis via Diffusion Transformer. | Yiren Song, Danze Chen, Mike Zheng Shou |
| 2025 | ICCV | DiffSim: Taming Diffusion Models for Evaluating Visual Similarity. | Yiren Song, Xiaokang Liu, Mike Zheng Shou |
| 2025 | ICCV | Factorized Learning for Temporally Grounded Video-Language Models. | Wenzheng Zeng, Difei Gao, Mike Zheng Shou, Hwee Tou Ng |
| 2025 | ICLR | Bridging Information Asymmetry in Text-video Retrieval: A Data-centric Approach. | Zechen Bai, Tianjun Xiao, Tong He, Pichao Wang, Zheng Zhang, Thomas Brox, Mike Zheng Shou |
| 2025 | ICLR | MP-Mat: A 3D-and-Instance-Aware Human Matting and Editing Framework with Multiplane Representation. | Siyi Jiao, Wenzheng Zeng, Yerong Li, Huayu Zhang, Changxin Gao, Nong Sang, Mike Zheng Shou |
| 2025 | ICLR | Grounding Multimodal Large Language Model in GUI World. | Weixian Lei, Difei Gao, Mike Zheng Shou |
| 2025 | ICLR | Image Watermarks are Removable using Controllable Regeneration from Clean Noise. | Yepeng Liu, Yiren Song, Hai Ci, Yu Zhang, Haofan Wang, Mike Zheng Shou, Yuheng Bu |
| 2025 | ICLR | Show-o: One Single Transformer to Unify Multimodal Understanding and Generation. | Jinheng Xie, Weijia Mao, Zechen Bai, David Junhao Zhang, Weihao Wang, Kevin Qinghong Lin, Yuchao Gu, Zhijie Chen, Zhenheng Yang, Mike Zheng Shou |
| 2025 | ICML | Impossible Videos. | Zechen Bai, Hai Ci, Mike Zheng Shou |
| 2025 | ICML | WMAdapter: Adding WaterMark Control to Latent Diffusion Models. | Hai Ci, Yiren Song, Pei Yang, Jinheng Xie, Mike Zheng Shou |
| 2024 | CVPR | VideoLLM-online: Online Video Large Language Model for Streaming Video. | Joya Chen, Zhaoyang Lv, Shiwei Wu, Kevin Qinghong Lin, Chenan Song, Difei Gao, Jia-Wei Liu, Ziteng Gao, Dongxing Mao, Mike Zheng Shou |
| 2024 | CVPR | AssistGUI: Task-Oriented PC Graphical User Interface Automation. | Difei Gao, Lei Ji, Zechen Bai, Mingyu Ouyang, Peiran Li, Dongxing Mao, Qinchen Wu, Weichen Zhang, Peiyi Wang, Xiangwu Guo, Hengxu Wang, Luowei Zhou, Mike Zheng Shou |
| 2024 | CVPR | Bootstrapping SparseFormers from Vision Foundation Models. | Ziteng Gao, Zhan Tong, Kevin Qinghong Lin, Joya Chen, Mike Zheng Shou |
| 2024 | CVPR | Rethinking the Objectives of Vector-Quantized Tokenizers for Image Synthesis. | Yuchao Gu, Xintao Wang, Yixiao Ge, Ying Shan, Mike Zheng Shou |
| 2024 | CVPR | VideoSwap: Customized Video Subject Swapping with Interactive Semantic Point Correspondence. | Yuchao Gu, Yipin Zhou, Bichen Wu, Licheng Yu, Jia-Wei Liu, Rui Zhao, Jay Zhangjie Wu, David Junhao Zhang, Mike Zheng Shou, Kevin Tang |
| 2024 | CVPR | VIT-LENS: Towards Omni-modal Representations. | Weixian Lei, Yixiao Ge, Kun Yi, Jianfeng Zhang, Difei Gao, Dylan Sun, Yuying Ge, Ying Shan, Mike Zheng Shou |
| 2024 | CVPR | DynVideo-E: Harnessing Dynamic NeRF for Large-Scale Motion- and View-Change Human-Centric Video Editing. | Jia-Wei Liu, Yan-Pei Cao, Jay Zhangjie Wu, Weijia Mao, Yuchao Gu, Rui Zhao, Jussi Keppo, Ying Shan, Mike Zheng Shou |
| 2024 | CVPR | X- Adapter: Universal Compatibility of Plugins for Upgraded Diffusion Model. | Lingmin Ran, Xiaodong Cun, Jia-Wei Liu, Rui Zhao, Song Zijie, Xintao Wang, Jussi Keppo, Mike Zheng Shou |
| 2024 | CVPR | L4D-Track: Language-to-4D Modeling Towards 6-DoF Tracking and Shape Reconstruction in 3D Point Cloud Stream. | Jingtao Sun, Yaonan Wang, Mingtao Feng, Yulan Guo, Ajmal Mian, Mike Zheng Shou |
| 2024 | CVPR | Tune-an-Ellipse: CLIP Has Potential to Find what you Want. | Jinheng Xie, Songhe Deng, Bing Li, Haozhe Liu, Yawen Huang, Yefeng Zheng, Jrgen Schmidhuber, Bernard Ghanem, Linlin Shen, Mike Zheng Shou |
| 2024 | CVPR | MagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model. | Zhongcong Xu, Jianfeng Zhang, Jun Hao Liew, Hanshu Yan, Jia-Wei Liu, Chenxu Zhang, Jiashi Feng, Mike Zheng Shou |
| 2024 | ECCV | RingID: Rethinking Tree-Ring Watermarking for Enhanced Multi-key Identification. | Hai Ci, Pei Yang, Yiren Song, Mike Zheng Shou |
| 2024 | ECCV | Parrot Captions Teach CLIP to Spot Text. | Yiqi Lin, Conghui He, Alex Jinpeng Wang, Bin Wang, Weijia Li, Mike Zheng Shou |
| 2024 | ECCV | Learning Video Context as Interleaved Multimodal Sequences. | Kevin Qinghong Lin, Pengchuan Zhang, Difei Gao, Xide Xia, Joya Chen, Ziteng Gao, Jinheng Xie, Xuhong Xiao, Mike Zheng Shou |
| 2024 | ECCV | DragAnything: Motion Control for Anything Using Entity Representation. | Weijia Wu, Zhuang Li, Yuchao Gu, Rui Zhao, Yefei He, David Junhao Zhang, Mike Zheng Shou, Yan Li, Tingting Gao, Di Zhang |
| 2024 | ECCV | Free-ATM: Harnessing Free Attention Masks for Representation Learning on Diffusion-Generated Images. | David Junhao Zhang, Mutian Xu, Jay Zhangjie Wu, Chuhui Xue, Wenqing Zhang, Xiaoguang Han, Song Bai, Mike Zheng Shou |
| 2024 | ECCV | MotionDirector: Motion Customization of Text-to-Video Diffusion Models. | Rui Zhao, Yuchao Gu, Jay Zhangjie Wu, David Junhao Zhang, Jia-Wei Liu, Weijia Wu, Jussi Keppo, Mike Zheng Shou |
| 2024 | ECCV | GENIXER: Empowering Multimodal Large Language Model as a Powerful Data Generator. | Henry Hengyuan Zhao, Pan Zhou, Mike Zheng Shou |
| 2024 | ICASSP | Spiking-Leaf: A Learnable Auditory Front-End for Spiking Neural Networks. | Zeyang Song, Jibin Wu, Malu Zhang, Mike Zheng Shou, Haizhou Li |
| 2024 | ICLR | SparseFormer: Sparse Visual Recognition via Limited Latent Tokens. | Ziteng Gao, Zhan Tong, Limin Wang, Mike Zheng Shou |
| 2024 | IJCAI | Delocate: Detection and Localization for Deepfake Videos with Randomly-Located Tampered Traces. | Juan Hu, Xin Liao, Difei Gao, Satoshi Tsutsui, Qian Wang, Zheng Qin, Mike Zheng Shou |
| 2024 | IJCAI | Apprenticeship-Inspired Elegance: Synergistic Knowledge Distillation Empowers Spiking Neural Networks for Efficient Single-Eye Emotion Recognition. | Yang Wang, Haiyang Mei, Qirui Bao, Ziqi Wei, Mike Zheng Shou, Haizhou Li, Bo Dong, Xin Yang |
| 2024 | SiggraphA | ProcessPainter: Learning to draw from sequence data. | Yiren Song, Shijie Huang, Chen Yao, Hai Ci, Xiaojun Ye, Jiaming Liu, Yuxuan Zhang, Mike Zheng Shou |
| 2023 | AAAI | Symbolic Replay: Scene Graph as Prompt for Continual Learning on VQA Task. | Stan Weixian Lei, Difei Gao, Jay Zhangjie Wu, Yuxuan Wang, Wei Liu, Mengmi Zhang, Mike Zheng Shou |
| 2023 | AAAI | Video-Text Pre-training with Learned Regions for Retrieval. | Rui Yan, Mike Zheng Shou, Yixiao Ge, Jinpeng Wang, Xudong Lin, Guanyu Cai, Jinhui Tang |
| 2023 | AAAI | Darwinian Model Upgrades: Model Evolving with Selective Compatibility. | Binjie Zhang, Shupeng Su, Yixiao Ge, Xuyuan Xu, Yexin Wang, Chun Yuan, Mike Zheng Shou, Ying Shan |
| 2023 | ACL | CONE: An Efficient COarse-to-fiNE Alignment Framework for Long Video Temporal Grounding. | Zhijian Hou, Wanjun Zhong, Lei Ji, Difei Gao, Kun Yan, Wing Kwong Chan, Chong-Wah Ngo, Mike Zheng Shou, Nan Duan |
| 2023 | CVPR | Towards Fast Adaptation of Pretrained Contrastive Models for Multi-channel Video-Language Retrieval. | Xudong Lin, Simran Tiwari, Shiyuan Huang, Manling Li, Mike Zheng Shou, Heng Ji, Shih-Fu Chang |
| 2023 | CVPR | Making Vision Transformers Efficient from A Token Sparsification View. | Shuning Chang, Pichao Wang, Ming Lin, Fan Wang, David Junhao Zhang, Rong Jin, Mike Zheng Shou |
| 2023 | CVPR | DOAD: Decoupled One Stage Action Detection Network. | Shuning Chang, Pichao Wang, Fan Wang, Jiashi Feng, Mike Zheng Shou |
| 2023 | CVPR | Affordance Grounding from Demonstration Video to Target Image. | Joya Chen, Difei Gao, Kevin Qinghong Lin, Mike Zheng Shou |
| 2023 | CVPR | MIST : Multi-modal Iterative Spatial-Temporal Transformer for Long-form Video Question Answering. | Difei Gao, Luowei Zhou, Lei Ji, Linchao Zhu, Yi Yang, Mike Zheng Shou |
| 2023 | CVPR | All in One: Exploring Unified Video-Language Pre-Training. | Jinpeng Wang, Yixiao Ge, Rui Yan, Yuying Ge, Kevin Qinghong Lin, Satoshi Tsutsui, Xudong Lin, Guanyu Cai, Jianping Wu, Ying Shan, Xiaohu Qie, Mike Zheng Shou |
| 2023 | CVPR | Position-Guided Text Prompt for Vision-Language Pre-Training. | Jinpeng Wang, Pan Zhou, Mike Zheng Shou, Shuicheng Yan |
| 2023 | EMNLP | GazeVQA: A Video Question Answering Dataset for Multiview Eye-Gaze Task-Oriented Collaborations. | Muhammet Furkan Ilaslan, Chenan Song, Joya Chen, Difei Gao, Weixian Lei, Qianli Xu, Joo Lim, Mike Zheng Shou |
| 2023 | ICCV | Revisiting Vision Transformer from the View of Path Ensemble. | Shuning Chang, Pichao Wang, Hao Luo, Fan Wang, Mike Zheng Shou |
| 2023 | ICCV | Unsupervised Open-Vocabulary Object Localization in Videos. | Ke Fan, Zechen Bai, Tianjun Xiao, Dominik Zietlow, Max Horn, Zixu Zhao, Carl-Johann Simon-Gabriel, Mike Zheng Shou, Francesco Locatello, Bernt Schiele, Thomas Brox, Zheng Zhang, Yanwei Fu, Tong He |
| 2023 | ICCV | UniVTG: Towards Unified Video-Language Temporal Grounding. | Kevin Qinghong Lin, Pengchuan Zhang, Joya Chen, Shraman Pramanick, Difei Gao, Alex Jinpeng Wang, Rui Yan, Mike Zheng Shou |
| 2023 | ICCV | HOSNeRF: Dynamic Human-Object-Scene Neural Radiance Fields from a Single Video. | Jia-Wei Liu, Yan-Pei Cao, Tianyuan Yang, Zhongcong Xu, Jussi Keppo, Ying Shan, Xiaohu Qie, Mike Zheng Shou |
| 2023 | ICCV | STPrivacy: Spatio-Temporal Privacy-Preserving Action Recognition. | Ming Li, Xiangyu Xu, Hehe Fan, Pan Zhou, Jun Liu, Jia-Wei Liu, Jiahe Li, Jussi Keppo, Mike Zheng Shou, Shuicheng Yan |
| 2023 | ICCV | EgoVLPv2: Egocentric Video-Language Pre-training with Fusion in the Backbone. | Shraman Pramanick, Yale Song, Sayan Nag, Kevin Qinghong Lin, Hardik Shah, Mike Zheng Shou, Rama Chellappa, Pengchuan Zhang |
| 2023 | ICCV | Learning to Learn: How to Continuously Teach Humans and Machines. | Parantak Singh, You Li, Ankur Sikarwar, Weixian Lei, Difei Gao, Morgan B. Talbot, Ying Sun, Mike Zheng Shou, Gabriel Kreiman, Mengmi Zhang |
| 2023 | ICCV | Too Large; Data Reduction for Vision-Language Pre-Training. | Alex Jinpeng Wang, Kevin Qinghong Lin, David Junhao Zhang, Stan Weixian Lei, Mike Zheng Shou |
| 2023 | ICCV | Tune-A-Video: One-Shot Tuning of Image Diffusion Models for Text-to-Video Generation. | Jay Zhangjie Wu, Yixiao Ge, Xintao Wang, Stan Weixian Lei, Yuchao Gu, Yufei Shi, Wynne Hsu, Ying Shan, Xiaohu Qie, Mike Zheng Shou |
| 2023 | ICCV | Label-Efficient Online Continual Object Detection in Streaming Video. | Jay Zhangjie Wu, David Junhao Zhang, Wynne Hsu, Mengmi Zhang, Mike Zheng Shou |
| 2023 | ICCV | DiffuMask: Synthesizing Images with Pixel-level Annotations for Semantic Segmentation Using Diffusion Models. | Weijia Wu, Yuzhong Zhao, Mike Zheng Shou, Hong Zhou, Chunhua Shen |
| 2023 | ICCV | BoxDiff: Text-to-Image Synthesis with Training-Free Box-Constrained Diffusion. | Jinheng Xie, Yuexiang Li, Yawen Huang, Haozhe Liu, Wentian Zhang, Yefeng Zheng, Mike Zheng Shou |
| 2023 | ICDAR | ICDAR 2023 Competition on Video Text Reading for Dense and Small Text. | Weijia Wu, Yuzhong Zhao, Zhuang Li, Jiahong Li, Mike Zheng Shou, Umapada Pal, Dimosthenis Karatzas, Xiang Bai |
| 2023 | ICDE | The Metaverse Data Deluge: What Can We Do About It? | Beng Chin Ooi, Gang Chen, Mike Zheng Shou, Kian-Lee Tan, Anthony K. H. Tung, Xiaokui Xiao, James Wei Luen Yip, Bingxue Zhang, Meihui Zhang |
| 2023 | ICLR | PV3D: A 3D Generative Model for Portrait Video Generation. | Eric Zhongcong Xu, Jianfeng Zhang, Jun Hao Liew, Wenqing Zhang, Song Bai, Jiashi Feng, Mike Zheng Shou |
| 2022 | CVPR | Ego4D: Around the World in 3, 000 Hours of Egocentric Video. | Kristen Grauman, Andrew Westbury, Eugene Byrne, Zachary Chavis, Antonino Furnari, Rohit Girdhar, Jackson Hamburger, Hao Jiang, Miao Liu, Xingyu Liu, Miguel Martin, Tushar Nagarajan, Ilija Radosavovic, Santhosh Kumar Ramakrishnan, Fiona Ryan, Jayant Sharma, Michael Wray, Mengmeng Xu, Eric Zhongcong Xu, Chen Zhao, Siddhant Bansal, Dhruv Batra, Vincent Cartillier, Sean Crane, Tien Do, Morrie Doulaty, Akshay Erapalli, Christoph Feichtenhofer, Adriano Fragomeni, Qichen Fu, Abrham Gebreselasie, Cristina Gonzlez, James Hillis, Xuhua Huang, Yifei Huang, Wenqi Jia, Weslie Khoo, Jchym Kolr, Satwik Kottur, Anurag Kumar, Federico Landini, Chao Li, Yanghao Li, Zhenqiang Li, Karttikeya Mangalam, Raghava Modhugu, Jonathan Munro, Tullie Murrell, Takumi Nishiyasu, Will Price, Paola Ruiz Puentes, Merey Ramazanova, Leda Sari, Kiran K. Somasundaram, Audrey Southerland, Yusuke Sugano, Ruijie Tao, Minh Vo, Yuchen Wang, Xindi Wu, Takuma Yagi, Ziwei Zhao, Yunyi Zhu, Pablo Arbelez, David Crandall, Dima Damen, Giovanni Maria Farinella, Christian Fuegen, Bernard Ghanem, Vamsi Krishna Ithapu, C. V. Jawahar, Hanbyul Joo, Kris Kitani, Haizhou Li, Richard A. Newcombe, Aude Oliva, Hyun Soo Park, James M. Rehg, Yoichi Sato, Jianbo Shi, Mike Zheng Shou, Antonio Torralba, Lorenzo Torresani, Mingfei Yan, Jitendra Malik |
| 2022 | CVPR | Unified Transformer Tracker for Object Tracking. | Fan Ma, Mike Zheng Shou, Linchao Zhu, Haoqi Fan, Yilei Xu, Yi Yang, Zhicheng Yan |
| 2022 | CVPR | Object-aware Video-language Pre-training for Retrieval. | Alex Jinpeng Wang, Yixiao Ge, Guanyu Cai, Rui Yan, Xudong Lin, Ying Shan, Xiaohu Qie, Mike Zheng Shou |
| 2022 | ECCV | GEB+: A Benchmark for Generic Event Boundary Captioning, Grounding and Retrieval. | Yuxuan Wang, Difei Gao, Licheng Yu, Weixian Lei, Matt Feiszli, Mike Zheng Shou |
| 2022 | ECCV | AssistQ: Affordance-Centric Question-Driven Task Completion for Egocentric Assistant. | Benita Wong, Joya Chen, You Wu, Stan Weixian Lei, Dongxing Mao, Difei Gao, Mike Zheng Shou |
| 2022 | ECCV | MorphMLP: An Efficient MLP-Like Backbone for Spatial-Temporal Representation Learning. | David Junhao Zhang, Kunchang Li, Yali Wang, Yunpeng Chen, Shashwat Chandra, Yu Qiao, Luoqi Liu, Mike Zheng Shou |
| 2022 | EMNLP | AssistSR: Task-oriented Video Segment Retrieval for Personal AI Assistant. | Weixian Lei, Difei Gao, Yuxuan Wang, Dongxing Mao, Zihan Liang, Lingmin Ran, Mike Zheng Shou |
| 2021 | CVPR | Actor-Context-Actor Relation Network for Spatio-Temporal Action Localization. | Junting Pan, Siyu Chen, Mike Zheng Shou, Yu Liu, Jing Shao, Hongsheng Li |
| 2021 | EMNLP | On Pursuit of Designing Multi-modal Transformer for Video Grounding. | Meng Cao, Long Chen, Mike Zheng Shou, Can Zhang, Yuexian Zou |
| 2021 | ICCV | Generic Event Boundary Detection: A Benchmark for Event Segmentation. | Mike Zheng Shou, Stan Weixian Lei, Weiyao Wang, Deepti Ghadiyaram, Matt Feiszli |
| 2021 | ICCV | Channel Augmented Joint Learning for Visible-Infrared Recognition. | Mang Ye, Weijian Ruan, Bo Du, Mike Zheng Shou |