Skip to content

Hengshuang Zhao

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

85

Venues

12

Active years

2016–2026

Best venue rank

A*

Where they publish

Papers

85 indexed papers, newest first.

YearVenueTitleAuthors
2026AAAIGame Ground Bench: Probing the Limits of LVLMs in Complex Semantic Grounding Across Game Universes.Zhangyang Qi, Jinsong Li, Hongjian Wu, Jiaqi Wang, Hengshuang Zhao
2026SIGGRAPHSCOPE: Scale-Consistent One-Pass Estimation of 3D Geometry.Zheng Zhang, Lihe Yang, Tianyu Yang, Chaohui Yu, Yixing Lao, Xiaoyang Guo, Biao Gong, Fan Wang, Hengshuang Zhao
2025CVPRSpatialCLIP: Learning 3D-aware Image Representations from Spatially Discriminative Language.Zehan Wang, Sashuai Zhou, Shaoxuan He, Haifeng Huang, Lihe Yang, Ziang Zhang, Xize Cheng, Shengpeng Ji, Tao Jin, Hengshuang Zhao, Zhou Zhao
2025CVPRSonata: Self-Supervised Learning of Reliable Point Representations.Xiaoyang Wu, Daniel DeTone, Duncan P. Frost, Tianwei Shen, Chris Xie, Nan Yang, Jakob J. Engel, Richard A. Newcombe, Hengshuang Zhao, Julian Straub
2025CVPRPanDA: Towards Panoramic Depth Anything with Unlabeled Panoramas and Mobius Spatial Augmentation.Zidong Cao, Jinjing Zhu, Weiming Zhang, Hao Ai, Haotian Bai, Hengshuang Zhao, Lin Wang
2025CVPREMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions.Kai Chen, Yunhao Gou, Runhui Huang, Zhili Liu, Daxin Tan, Jing Xu, Chunwei Wang, Yi Zhu, Yihan Zeng, Kuo Yang, Dingdong Wang, Kun Xiang, Haoyuan Li, Haoli Bai, Jianhua Han, Xiaohui Li, Weike Jin, Nian Xie, Yu Zhang, James T. Kwok, Hengshuang Zhao, Xiaodan Liang, Dit-Yan Yeung, Xiao Chen, Zhenguo Li, Wei Zhang, Qun Liu, Lanqing Hong, Lu Hou, Hang Xu
2025CVPRUniReal: Universal Image Generation and Editing via Learning Real-world Dynamics.Xi Chen, Zhifei Zhang, He Zhang, Yuqian Zhou, Soo Ye Kim, Qing Liu, Yijun Li, Jianming Zhang, Nanxuan Zhao, Yilin Wang, Hui Ding, Zhe Lin, Hengshuang Zhao
2025CVPRHiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models.Runhui Huang, Xinpeng Ding, Chunwei Wang, Jianhua Han, Yulong Liu, Hengshuang Zhao, Hang Xu, Lu Hou, Wei Zhang, Xiaodan Liang
2025CVPRDriveGPT4-V2: Harnessing Large Language Model Capabilities for Enhanced Closed-Loop Autonomous Driving.Zhenhua Xu, Yan Bai, Yujia Zhang, Zhuoling Li, Fei Xia, Kwan-Yee K. Wong, Jianqiang Wang, Hengshuang Zhao
2025CVPREmpowering Large Language Models with 3D Situation Awareness.Zhihao Yuan, Yibo Peng, Jinke Ren, Yinghong Liao, Yatong Han, Chun-Mei Feng, Hengshuang Zhao, Guanbin Li, Shuguang Cui, Zhen Li
2025EMNLPEnhancing LLM Knowledge Learning through Generalization.Mingkang Zhu, Xi Chen, Zhongdao Wang, Bei Yu, Hengshuang Zhao, Jiaya Jia
2025ICCVDiffDoctor: Diagnosing Image Diffusion Models Before Treating.Yiyang Wang, Xi Chen, Xiaogang Xu, Sihui Ji, Yu Liu, Yujun Shen, Hengshuang Zhao
2025ICCVStableDepth: Scene-Consistent and Scale-Invariant Monocular Depth.Zheng Zhang, Lihe Yang, Tianyu Yang, Chaohui Yu, Xiaoyang Guo, Yixing Lao, Hengshuang Zhao
2025ICCVDisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs.Jiahe Zhao, Rongkun Zheng, Yi Wang, Helin Wang, Hengshuang Zhao
2025ICCVViLLa: Video Reasoning Segmentation with Large Language Model.Rongkun Zheng, Lu Qi, Xi Chen, Yi Wang, Kun Wang, Hengshuang Zhao
2025ICCVHERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation.Xin Zhou, Dingkang Liang, Sifan Tu, Xiwu Chen, Yikang Ding, Dingyuan Zhang, Feiyang Tan, Hengshuang Zhao, Xiang Bai
2025ICLROmniBind: Large-scale Omni Multimodal Representation via Binding Spaces.Zehan Wang, Ziang Zhang, Minjie Hong, Hang Zhang, Luping Liu, Rongjie Huang, Xize Cheng, Shengpeng Ji, Tao Jin, Hengshuang Zhao, Zhou Zhao
2025ICMLOrient Anything: Learning Robust Object Orientation Estimation from Rendering 3D Models.Zehan Wang, Ziang Zhang, Tianyu Pang, Chao Du, Hengshuang Zhao, Zhou Zhao
2025ICMLHaploVL: A Single-Transformer Baseline for Multi-Modal Understanding.Rui Yang, Lin Song, Yicheng Xiao, Runhui Huang, Yixiao Ge, Ying Shan, Hengshuang Zhao
2025ICMLLARM: Large Auto-Regressive Model for Long-Horizon Embodied Intelligence.Zhuoling Li, Xiaogang Xu, Zhenhua Xu, Ser-Nam Lim, Hengshuang Zhao
2025ICMLBOOD: Boundary-based Out-Of-Distribution Data Generation.Qilin Liao, Shuo Yang, Bo Zhao, Ping Luo, Hengshuang Zhao
2025ICMLVIP: Vision Instructed Pre-training for Robotic Manipulation.Zhuoling Li, Liangliang Ren, Jinrong Yang, Yong Zhao, Xiaoyang Wu, Zhenhua Xu, Xiang Bai, Hengshuang Zhao
2025ICMLTGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization.Mingkang Zhu, Xi Chen, Zhongdao Wang, Bei Yu, Hengshuang Zhao, Jiaya Jia
2025SIGGRAPHLayerFlow: A Unified Model for Layer-aware Video Generation.Sihui Ji, Hao Luo, Xi Chen, Yuanpeng Tu, Yiyang Wang, Hengshuang Zhao
2025SIGGRAPHFashionComposer: Compositional Fashion Image Generation.Sihui Ji, Yiyang Wang, Xi Chen, Xiaogang Xu, Hao Luo, Hengshuang Zhao
2025SIGGRAPHDreamMask: Boosting Open-vocabulary Panoptic Segmentation with Synthetic Data.Yuanpeng Tu, Xi Chen, Ser-Nam Lim, Hengshuang Zhao
2025SIGGRAPHVideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control.Yuanpeng Tu, Hao Luo, Xi Chen, Sihui Ji, Xiang Bai, Hengshuang Zhao
2025SiggraphADiffCamera: Arbitrary Refocusing on Images.Yiyang Wang, Xi Chen, Xiaogang Xu, Yu Liu, Hengshuang Zhao
2024CVPRPoint Transformer V3: Simpler, Faster, Stronger.Xiaoyang Wu, Li Jiang, Peng-Shuai Wang, Zhijian Liu, Xihui Liu, Yu Qiao, Wanli Ouyang, Tong He, Hengshuang Zhao
2024CVPRAnyDoor: Zero-shot Object-level Image Customization.Xi Chen, Lianghua Huang, Yu Liu, Yujun Shen, Deli Zhao, Hengshuang Zhao
2024CVPRUniMODE: Unified Monocular 3D Object Detection.Zhuoling Li, Xiaogang Xu, Ser-Nam Lim, Hengshuang Zhao
2024CVPROA-CNNs: Omni-Adaptive Sparse CNNs for 3D Semantic Segmentation.Bohao Peng, Xiaoyang Wu, Li Jiang, Yukang Chen, Hengshuang Zhao, Zhuotao Tian, Jiaya Jia
2024CVPRGPT4Point: A Unified Framework for Point-Language Understanding and Generation.Zhangyang Qi, Ye Fang, Zeyi Sun, Xiaoyang Wu, Tong Wu, Jiaqi Wang, Dahua Lin, Hengshuang Zhao
2024CVPRGroupContrast: Semantic-Aware Self-Supervised Representation Learning for 3D Understanding.Chengyao Wang, Li Jiang, Xiaoyang Wu, Zhuotao Tian, Bohao Peng, Hengshuang Zhao, Jiaya Jia
2024CVPRTowards Large-Scale 3D Representation Learning with Multi-Dataset Point Prompt Training.Xiaoyang Wu, Zhuotao Tian, Xin Wen, Bohao Peng, Xihui Liu, Kaicheng Yu, Hengshuang Zhao
2024CVPRDreamComposer: Controllable 3D Object Generation via Multi-View Conditions.Yunhan Yang, Yukun Huang, Xiaoyang Wu, Yuan-Chen Guo, Song-Hai Zhang, Hengshuang Zhao, Tong He, Xihui Liu
2024CVPRDepth Anything: Unleashing the Power of Large-Scale Unlabeled Data.Lihe Yang, Bingyi Kang, Zilong Huang, Xiaogang Xu, Jiashi Feng, Hengshuang Zhao
2024CVPRUniPAD: A Universal Pre-Training Paradigm for Autonomous Driving.Honghui Yang, Sha Zhang, Di Huang, Xiaoyang Wu, Haoyi Zhu, Tong He, Shixiang Tang, Hengshuang Zhao, Qibo Qiu, Binbin Lin, Xiaofei He, Wanli Ouyang
2024CVPRVisual Programming for Zero-Shot Open-Vocabulary 3D Visual Grounding.Zhihao Yuan, Jinke Ren, Chun-Mei Feng, Hengshuang Zhao, Shuguang Cui, Zhen Li
2024ECCVLivePhoto: Real Image Animation with Text-Guided Motion Control.Xi Chen, Zhiheng Liu, Mengting Chen, Yutong Feng, Yu Liu, Yujun Shen, Hengshuang Zhao
2024ECCVOpenIns3D: Snap and Lookup for 3D Open-Vocabulary Instance Segmentation.Zhening Huang, Xiaoyang Wu, Xi Chen, Hengshuang Zhao, Lei Zhu, Joan Lasenby
2024ECCVMind the Interference: Retaining Pre-trained Knowledge in Parameter Efficient Continual Learning of Vision-Language Models.Longxiang Tang, Zhuotao Tian, Kai Li, Chunming He, Hantao Zhou, Hengshuang Zhao, Xiu Li, Jiaya Jia
2024ECCVOV-Uni3DETR: Towards Unified Open-Vocabulary 3D Object Detection via Cycle-Modality Propagation.Zhenyu Wang, Yali Li, Taichi Liu, Hengshuang Zhao, Shengjin Wang
2024ECCVInsMapper: Exploring Inner-Instance Information for Vectorized HD Mapping.Zhenhua Xu, Kwan-Yee K. Wong, Hengshuang Zhao
2024ECCVPixel-GS: Density Control with Pixel-Aware Gradient for 3D Gaussian Splatting.Zheng Zhang, Wenbo Hu, Yixing Lao, Tong He, Hengshuang Zhao
2024ECCVLogoSticker: Inserting Logos Into Diffusion Models for Customized Generation.Mingkang Zhu, Xi Chen, Zhongdao Wang, Hengshuang Zhao, Jiaya Jia
2024ICLRInfluencer Backdoor Attack on Semantic Segmentation.Haoheng Lan, Jindong Gu, Philip Torr, Hengshuang Zhao
2023AAAISemantics-Aware Dynamic Localization and Refinement for Referring Image Segmentation.Zhao Yang, Jiaqi Wang, Yansong Tang, Kai Chen, Hengshuang Zhao, Philip H. S. Torr
2023CVPRMasked Scene Contrast: A Scalable Framework for Unsupervised 3D Representation Learning.Xiaoyang Wu, Xin Wen, Xihui Liu, Hengshuang Zhao
2023CVPRDetecting Everything in the Open World: Towards Universal Object Detection.Zhenyu Wang, Yali Li, Xi Chen, Ser-Nam Lim, Antonio Torralba, Hengshuang Zhao, Shengjin Wang
2023CVPRMod-Squad: Designing Mixtures of Experts As Modular Multi-Task Learners.Zitian Chen, Yikang Shen, Mingyu Ding, Zhenfang Chen, Hengshuang Zhao, Erik G. Learned-Miller, Chuang Gan
2023ICCVOpen-vocabulary Panoptic Segmentation with Embedding Modulation.Xi Chen, Shuang Li, Ser-Nam Lim, Antonio Torralba, Hengshuang Zhao
2023ICCVShrinking Class Space for Enhanced Certainty in Semi-Supervised Learning.Lihe Yang, Zhen Zhao, Lei Qi, Yu Qiao, Yinghuan Shi, Hengshuang Zhao
2023ICCVBTYifei Zhou, Zilu Li, Abhinav Shrivastava, Hengshuang Zhao, Antonio Torralba, Tai-Peng Tian, Ser-Nam Lim
2023IJCAIUniversal Adaptive Data Augmentation.Xiaogang Xu, Hengshuang Zhao
2022CVPRLAVT: Language-Aware Vision Transformer for Referring Image Segmentation.Zhao Yang, Jiaqi Wang, Yansong Tang, Kai Chen, Hengshuang Zhao, Philip H. S. Torr
2022CVPRFocalClick: Towards Practical Interactive Image Segmentation.Xi Chen, Zhiyan Zhao, Yilei Zhang, Manni Duan, Donglian Qi, Hengshuang Zhao
2022CVPRStratified Transformer for 3D Point Cloud Segmentation.Xin Lai, Jianhui Liu, Li Jiang, Liwei Wang, Hengshuang Zhao, Shu Liu, Xiaojuan Qi, Jiaya Jia
2022CVPRGeneralized Few-shot Semantic Segmentation.Zhuotao Tian, Xin Lai, Li Jiang, Shu Liu, Michelle Shu, Hengshuang Zhao, Jiaya Jia
2022CVPRPhysFormer: Facial Video-based Physiological Measurement with Temporal Difference Transformer.Zitong Yu, Yuming Shen, Jingang Shi, Hengshuang Zhao, Philip H. S. Torr, Guoying Zhao
2022ECCVSegPGD: An Effective and Efficient Adversarial Attack for Evaluating and Boosting Segmentation Robustness.Jindong Gu, Hengshuang Zhao, Volker Tresp, Philip H. S. Torr
2022ECCVDecoupleNet: Decoupled Network for Domain Adaptive Semantic Segmentation.Xin Lai, Zhuotao Tian, Xiaogang Xu, Ying-Cong Chen, Shu Liu, Hengshuang Zhao, Liwei Wang, Jiaya Jia
2022ECCVMTFormer: Multi-task Learning via Transformer and Cross-Task Reasoning.Xiaogang Xu, Hengshuang Zhao, Vibhav Vineet, Ser-Nam Lim, Antonio Torralba
2022ICRAPrototype-Voxel Contrastive Learning for LiDAR Point Cloud Panoptic Segmentation.Minzhe Liu, Qiang Zhou, Hengshuang Zhao, Jianing Li, Yuan Du, Kurt Keutzer, Li Du, Shanghang Zhang
2021BMVCHierarchical Interaction Network for Video Object Segmentation from Referring Expressions.Zhao Yang, Yansong Tang, Luca Bertinetto, Hengshuang Zhao, Philip H. S. Torr
2021CVPRDistilling Knowledge via Knowledge Review.Pengguang Chen, Shu Liu, Hengshuang Zhao, Jiaya Jia
2021CVPRBidirectional Projection Network for Cross Dimension Scene Understanding.Wenbo Hu, Hengshuang Zhao, Li Jiang, Jiaya Jia, Tien-Tsin Wong
2021CVPRSemi-Supervised Semantic Segmentation With Directional Context-Aware Consistency.Xin Lai, Zhuotao Tian, Li Jiang, Shu Liu, Hengshuang Zhao, Liwei Wang, Jiaya Jia
2021CVPRFully Convolutional Networks for Panoptic Segmentation.Yanwei Li, Hengshuang Zhao, Xiaojuan Qi, Liwei Wang, Zeming Li, Jian Sun, Jiaya Jia
2021CVPRPAConv: Position Adaptive Convolution With Dynamic Kernel Assembling on Point Clouds.Mutian Xu, Runyu Ding, Hengshuang Zhao, Xiaojuan Qi
2021CVPRRethinking Semantic Segmentation From a Sequence-to-Sequence Perspective With Transformers.Sixiao Zheng, Jiachen Lu, Hengshuang Zhao, Xiatian Zhu, Zekun Luo, Yabiao Wang, Yanwei Fu, Jianfeng Feng, Tao Xiang, Philip H. S. Torr, Li Zhang
2021ICCVDynamic Divide-and-Conquer Adversarial Training for Robust Semantic Segmentation.Xiaogang Xu, Hengshuang Zhao, Jiaya Jia
2021ICCVPoint Transformer.Hengshuang Zhao, Li Jiang, Jiaya Jia, Philip H. S. Torr, Vladlen Koltun
2021IJCAIDual-Cross Central Difference Network for Face Anti-Spoofing.Zitong Yu, Yunxiao Qin, Hengshuang Zhao, Xiaobai Li, Guoying Zhao
2020CVPRPointGroup: Dual-Set Point Grouping for 3D Instance Segmentation.Li Jiang, Hengshuang Zhao, Shaoshuai Shi, Shu Liu, Chi-Wing Fu, Jiaya Jia
2020CVPRExploring Self-Attention for Image Recognition.Hengshuang Zhao, Jiaya Jia, Vladlen Koltun
2019CVPRUPSNet: A Unified Panoptic Segmentation Network.Yuwen Xiong, Renjie Liao, Hengshuang Zhao, Rui Hu, Min Bai, Ersin Yumer, Raquel Urtasun
2019CVPRPointWeb: Enhancing Local Neighborhood Features for Point Cloud Processing.Hengshuang Zhao, Li Jiang, Chi-Wing Fu, Jiaya Jia
2019ICCVHierarchical Point-Edge Interaction Network for Point Cloud Semantic Segmentation.Li Jiang, Hengshuang Zhao, Shu Liu, Xiaoyong Shen, Chi-Wing Fu, Jiaya Jia
2018ECCVSegStereo: Exploiting Semantic Information for Disparity Estimation.Guorun Yang, Hengshuang Zhao, Jianping Shi, Zhidong Deng, Jiaya Jia
2018ECCVICNet for Real-Time Semantic Segmentation on High-Resolution Images.Hengshuang Zhao, Xiaojuan Qi, Xiaoyong Shen, Jianping Shi, Jiaya Jia
2018ECCVCompositing-Aware Image Search.Hengshuang Zhao, Xiaohui Shen, Zhe Lin, Kalyan Sunkavalli, Brian L. Price, Jiaya Jia
2018ECCVPSANet: Point-wise Spatial Attention Network for Scene Parsing.Hengshuang Zhao, Yi Zhang, Shu Liu, Jianping Shi, Chen Change Loy, Dahua Lin, Jiaya Jia
2017CVPRPyramid Scene Parsing Network.Hengshuang Zhao, Jianping Shi, Xiaojuan Qi, Xiaogang Wang, Jiaya Jia
2016ECCVAugmented Feedback in Semantic Segmentation Under Image Level Supervision.Xiaojuan Qi, Zhengzhe Liu, Jianping Shi, Hengshuang Zhao, Jiaya Jia