Hengshuang Zhao
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
85
Venues
12
Active years
2016–2026
Best venue rank
A*
Where they publish
Papers
85 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | AAAI | Game Ground Bench: Probing the Limits of LVLMs in Complex Semantic Grounding Across Game Universes. | Zhangyang Qi, Jinsong Li, Hongjian Wu, Jiaqi Wang, Hengshuang Zhao |
| 2026 | SIGGRAPH | SCOPE: Scale-Consistent One-Pass Estimation of 3D Geometry. | Zheng Zhang, Lihe Yang, Tianyu Yang, Chaohui Yu, Yixing Lao, Xiaoyang Guo, Biao Gong, Fan Wang, Hengshuang Zhao |
| 2025 | CVPR | SpatialCLIP: Learning 3D-aware Image Representations from Spatially Discriminative Language. | Zehan Wang, Sashuai Zhou, Shaoxuan He, Haifeng Huang, Lihe Yang, Ziang Zhang, Xize Cheng, Shengpeng Ji, Tao Jin, Hengshuang Zhao, Zhou Zhao |
| 2025 | CVPR | Sonata: Self-Supervised Learning of Reliable Point Representations. | Xiaoyang Wu, Daniel DeTone, Duncan P. Frost, Tianwei Shen, Chris Xie, Nan Yang, Jakob J. Engel, Richard A. Newcombe, Hengshuang Zhao, Julian Straub |
| 2025 | CVPR | PanDA: Towards Panoramic Depth Anything with Unlabeled Panoramas and Mobius Spatial Augmentation. | Zidong Cao, Jinjing Zhu, Weiming Zhang, Hao Ai, Haotian Bai, Hengshuang Zhao, Lin Wang |
| 2025 | CVPR | EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions. | Kai Chen, Yunhao Gou, Runhui Huang, Zhili Liu, Daxin Tan, Jing Xu, Chunwei Wang, Yi Zhu, Yihan Zeng, Kuo Yang, Dingdong Wang, Kun Xiang, Haoyuan Li, Haoli Bai, Jianhua Han, Xiaohui Li, Weike Jin, Nian Xie, Yu Zhang, James T. Kwok, Hengshuang Zhao, Xiaodan Liang, Dit-Yan Yeung, Xiao Chen, Zhenguo Li, Wei Zhang, Qun Liu, Lanqing Hong, Lu Hou, Hang Xu |
| 2025 | CVPR | UniReal: Universal Image Generation and Editing via Learning Real-world Dynamics. | Xi Chen, Zhifei Zhang, He Zhang, Yuqian Zhou, Soo Ye Kim, Qing Liu, Yijun Li, Jianming Zhang, Nanxuan Zhao, Yilin Wang, Hui Ding, Zhe Lin, Hengshuang Zhao |
| 2025 | CVPR | HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models. | Runhui Huang, Xinpeng Ding, Chunwei Wang, Jianhua Han, Yulong Liu, Hengshuang Zhao, Hang Xu, Lu Hou, Wei Zhang, Xiaodan Liang |
| 2025 | CVPR | DriveGPT4-V2: Harnessing Large Language Model Capabilities for Enhanced Closed-Loop Autonomous Driving. | Zhenhua Xu, Yan Bai, Yujia Zhang, Zhuoling Li, Fei Xia, Kwan-Yee K. Wong, Jianqiang Wang, Hengshuang Zhao |
| 2025 | CVPR | Empowering Large Language Models with 3D Situation Awareness. | Zhihao Yuan, Yibo Peng, Jinke Ren, Yinghong Liao, Yatong Han, Chun-Mei Feng, Hengshuang Zhao, Guanbin Li, Shuguang Cui, Zhen Li |
| 2025 | EMNLP | Enhancing LLM Knowledge Learning through Generalization. | Mingkang Zhu, Xi Chen, Zhongdao Wang, Bei Yu, Hengshuang Zhao, Jiaya Jia |
| 2025 | ICCV | DiffDoctor: Diagnosing Image Diffusion Models Before Treating. | Yiyang Wang, Xi Chen, Xiaogang Xu, Sihui Ji, Yu Liu, Yujun Shen, Hengshuang Zhao |
| 2025 | ICCV | StableDepth: Scene-Consistent and Scale-Invariant Monocular Depth. | Zheng Zhang, Lihe Yang, Tianyu Yang, Chaohui Yu, Xiaoyang Guo, Yixing Lao, Hengshuang Zhao |
| 2025 | ICCV | DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs. | Jiahe Zhao, Rongkun Zheng, Yi Wang, Helin Wang, Hengshuang Zhao |
| 2025 | ICCV | ViLLa: Video Reasoning Segmentation with Large Language Model. | Rongkun Zheng, Lu Qi, Xi Chen, Yi Wang, Kun Wang, Hengshuang Zhao |
| 2025 | ICCV | HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation. | Xin Zhou, Dingkang Liang, Sifan Tu, Xiwu Chen, Yikang Ding, Dingyuan Zhang, Feiyang Tan, Hengshuang Zhao, Xiang Bai |
| 2025 | ICLR | OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces. | Zehan Wang, Ziang Zhang, Minjie Hong, Hang Zhang, Luping Liu, Rongjie Huang, Xize Cheng, Shengpeng Ji, Tao Jin, Hengshuang Zhao, Zhou Zhao |
| 2025 | ICML | Orient Anything: Learning Robust Object Orientation Estimation from Rendering 3D Models. | Zehan Wang, Ziang Zhang, Tianyu Pang, Chao Du, Hengshuang Zhao, Zhou Zhao |
| 2025 | ICML | HaploVL: A Single-Transformer Baseline for Multi-Modal Understanding. | Rui Yang, Lin Song, Yicheng Xiao, Runhui Huang, Yixiao Ge, Ying Shan, Hengshuang Zhao |
| 2025 | ICML | LARM: Large Auto-Regressive Model for Long-Horizon Embodied Intelligence. | Zhuoling Li, Xiaogang Xu, Zhenhua Xu, Ser-Nam Lim, Hengshuang Zhao |
| 2025 | ICML | BOOD: Boundary-based Out-Of-Distribution Data Generation. | Qilin Liao, Shuo Yang, Bo Zhao, Ping Luo, Hengshuang Zhao |
| 2025 | ICML | VIP: Vision Instructed Pre-training for Robotic Manipulation. | Zhuoling Li, Liangliang Ren, Jinrong Yang, Yong Zhao, Xiaoyang Wu, Zhenhua Xu, Xiang Bai, Hengshuang Zhao |
| 2025 | ICML | TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization. | Mingkang Zhu, Xi Chen, Zhongdao Wang, Bei Yu, Hengshuang Zhao, Jiaya Jia |
| 2025 | SIGGRAPH | LayerFlow: A Unified Model for Layer-aware Video Generation. | Sihui Ji, Hao Luo, Xi Chen, Yuanpeng Tu, Yiyang Wang, Hengshuang Zhao |
| 2025 | SIGGRAPH | FashionComposer: Compositional Fashion Image Generation. | Sihui Ji, Yiyang Wang, Xi Chen, Xiaogang Xu, Hao Luo, Hengshuang Zhao |
| 2025 | SIGGRAPH | DreamMask: Boosting Open-vocabulary Panoptic Segmentation with Synthetic Data. | Yuanpeng Tu, Xi Chen, Ser-Nam Lim, Hengshuang Zhao |
| 2025 | SIGGRAPH | VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control. | Yuanpeng Tu, Hao Luo, Xi Chen, Sihui Ji, Xiang Bai, Hengshuang Zhao |
| 2025 | SiggraphA | DiffCamera: Arbitrary Refocusing on Images. | Yiyang Wang, Xi Chen, Xiaogang Xu, Yu Liu, Hengshuang Zhao |
| 2024 | CVPR | Point Transformer V3: Simpler, Faster, Stronger. | Xiaoyang Wu, Li Jiang, Peng-Shuai Wang, Zhijian Liu, Xihui Liu, Yu Qiao, Wanli Ouyang, Tong He, Hengshuang Zhao |
| 2024 | CVPR | AnyDoor: Zero-shot Object-level Image Customization. | Xi Chen, Lianghua Huang, Yu Liu, Yujun Shen, Deli Zhao, Hengshuang Zhao |
| 2024 | CVPR | UniMODE: Unified Monocular 3D Object Detection. | Zhuoling Li, Xiaogang Xu, Ser-Nam Lim, Hengshuang Zhao |
| 2024 | CVPR | OA-CNNs: Omni-Adaptive Sparse CNNs for 3D Semantic Segmentation. | Bohao Peng, Xiaoyang Wu, Li Jiang, Yukang Chen, Hengshuang Zhao, Zhuotao Tian, Jiaya Jia |
| 2024 | CVPR | GPT4Point: A Unified Framework for Point-Language Understanding and Generation. | Zhangyang Qi, Ye Fang, Zeyi Sun, Xiaoyang Wu, Tong Wu, Jiaqi Wang, Dahua Lin, Hengshuang Zhao |
| 2024 | CVPR | GroupContrast: Semantic-Aware Self-Supervised Representation Learning for 3D Understanding. | Chengyao Wang, Li Jiang, Xiaoyang Wu, Zhuotao Tian, Bohao Peng, Hengshuang Zhao, Jiaya Jia |
| 2024 | CVPR | Towards Large-Scale 3D Representation Learning with Multi-Dataset Point Prompt Training. | Xiaoyang Wu, Zhuotao Tian, Xin Wen, Bohao Peng, Xihui Liu, Kaicheng Yu, Hengshuang Zhao |
| 2024 | CVPR | DreamComposer: Controllable 3D Object Generation via Multi-View Conditions. | Yunhan Yang, Yukun Huang, Xiaoyang Wu, Yuan-Chen Guo, Song-Hai Zhang, Hengshuang Zhao, Tong He, Xihui Liu |
| 2024 | CVPR | Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data. | Lihe Yang, Bingyi Kang, Zilong Huang, Xiaogang Xu, Jiashi Feng, Hengshuang Zhao |
| 2024 | CVPR | UniPAD: A Universal Pre-Training Paradigm for Autonomous Driving. | Honghui Yang, Sha Zhang, Di Huang, Xiaoyang Wu, Haoyi Zhu, Tong He, Shixiang Tang, Hengshuang Zhao, Qibo Qiu, Binbin Lin, Xiaofei He, Wanli Ouyang |
| 2024 | CVPR | Visual Programming for Zero-Shot Open-Vocabulary 3D Visual Grounding. | Zhihao Yuan, Jinke Ren, Chun-Mei Feng, Hengshuang Zhao, Shuguang Cui, Zhen Li |
| 2024 | ECCV | LivePhoto: Real Image Animation with Text-Guided Motion Control. | Xi Chen, Zhiheng Liu, Mengting Chen, Yutong Feng, Yu Liu, Yujun Shen, Hengshuang Zhao |
| 2024 | ECCV | OpenIns3D: Snap and Lookup for 3D Open-Vocabulary Instance Segmentation. | Zhening Huang, Xiaoyang Wu, Xi Chen, Hengshuang Zhao, Lei Zhu, Joan Lasenby |
| 2024 | ECCV | Mind the Interference: Retaining Pre-trained Knowledge in Parameter Efficient Continual Learning of Vision-Language Models. | Longxiang Tang, Zhuotao Tian, Kai Li, Chunming He, Hantao Zhou, Hengshuang Zhao, Xiu Li, Jiaya Jia |
| 2024 | ECCV | OV-Uni3DETR: Towards Unified Open-Vocabulary 3D Object Detection via Cycle-Modality Propagation. | Zhenyu Wang, Yali Li, Taichi Liu, Hengshuang Zhao, Shengjin Wang |
| 2024 | ECCV | InsMapper: Exploring Inner-Instance Information for Vectorized HD Mapping. | Zhenhua Xu, Kwan-Yee K. Wong, Hengshuang Zhao |
| 2024 | ECCV | Pixel-GS: Density Control with Pixel-Aware Gradient for 3D Gaussian Splatting. | Zheng Zhang, Wenbo Hu, Yixing Lao, Tong He, Hengshuang Zhao |
| 2024 | ECCV | LogoSticker: Inserting Logos Into Diffusion Models for Customized Generation. | Mingkang Zhu, Xi Chen, Zhongdao Wang, Hengshuang Zhao, Jiaya Jia |
| 2024 | ICLR | Influencer Backdoor Attack on Semantic Segmentation. | Haoheng Lan, Jindong Gu, Philip Torr, Hengshuang Zhao |
| 2023 | AAAI | Semantics-Aware Dynamic Localization and Refinement for Referring Image Segmentation. | Zhao Yang, Jiaqi Wang, Yansong Tang, Kai Chen, Hengshuang Zhao, Philip H. S. Torr |
| 2023 | CVPR | Masked Scene Contrast: A Scalable Framework for Unsupervised 3D Representation Learning. | Xiaoyang Wu, Xin Wen, Xihui Liu, Hengshuang Zhao |
| 2023 | CVPR | Detecting Everything in the Open World: Towards Universal Object Detection. | Zhenyu Wang, Yali Li, Xi Chen, Ser-Nam Lim, Antonio Torralba, Hengshuang Zhao, Shengjin Wang |
| 2023 | CVPR | Mod-Squad: Designing Mixtures of Experts As Modular Multi-Task Learners. | Zitian Chen, Yikang Shen, Mingyu Ding, Zhenfang Chen, Hengshuang Zhao, Erik G. Learned-Miller, Chuang Gan |
| 2023 | ICCV | Open-vocabulary Panoptic Segmentation with Embedding Modulation. | Xi Chen, Shuang Li, Ser-Nam Lim, Antonio Torralba, Hengshuang Zhao |
| 2023 | ICCV | Shrinking Class Space for Enhanced Certainty in Semi-Supervised Learning. | Lihe Yang, Zhen Zhao, Lei Qi, Yu Qiao, Yinghuan Shi, Hengshuang Zhao |
| 2023 | ICCV | BT | Yifei Zhou, Zilu Li, Abhinav Shrivastava, Hengshuang Zhao, Antonio Torralba, Tai-Peng Tian, Ser-Nam Lim |
| 2023 | IJCAI | Universal Adaptive Data Augmentation. | Xiaogang Xu, Hengshuang Zhao |
| 2022 | CVPR | LAVT: Language-Aware Vision Transformer for Referring Image Segmentation. | Zhao Yang, Jiaqi Wang, Yansong Tang, Kai Chen, Hengshuang Zhao, Philip H. S. Torr |
| 2022 | CVPR | FocalClick: Towards Practical Interactive Image Segmentation. | Xi Chen, Zhiyan Zhao, Yilei Zhang, Manni Duan, Donglian Qi, Hengshuang Zhao |
| 2022 | CVPR | Stratified Transformer for 3D Point Cloud Segmentation. | Xin Lai, Jianhui Liu, Li Jiang, Liwei Wang, Hengshuang Zhao, Shu Liu, Xiaojuan Qi, Jiaya Jia |
| 2022 | CVPR | Generalized Few-shot Semantic Segmentation. | Zhuotao Tian, Xin Lai, Li Jiang, Shu Liu, Michelle Shu, Hengshuang Zhao, Jiaya Jia |
| 2022 | CVPR | PhysFormer: Facial Video-based Physiological Measurement with Temporal Difference Transformer. | Zitong Yu, Yuming Shen, Jingang Shi, Hengshuang Zhao, Philip H. S. Torr, Guoying Zhao |
| 2022 | ECCV | SegPGD: An Effective and Efficient Adversarial Attack for Evaluating and Boosting Segmentation Robustness. | Jindong Gu, Hengshuang Zhao, Volker Tresp, Philip H. S. Torr |
| 2022 | ECCV | DecoupleNet: Decoupled Network for Domain Adaptive Semantic Segmentation. | Xin Lai, Zhuotao Tian, Xiaogang Xu, Ying-Cong Chen, Shu Liu, Hengshuang Zhao, Liwei Wang, Jiaya Jia |
| 2022 | ECCV | MTFormer: Multi-task Learning via Transformer and Cross-Task Reasoning. | Xiaogang Xu, Hengshuang Zhao, Vibhav Vineet, Ser-Nam Lim, Antonio Torralba |
| 2022 | ICRA | Prototype-Voxel Contrastive Learning for LiDAR Point Cloud Panoptic Segmentation. | Minzhe Liu, Qiang Zhou, Hengshuang Zhao, Jianing Li, Yuan Du, Kurt Keutzer, Li Du, Shanghang Zhang |
| 2021 | BMVC | Hierarchical Interaction Network for Video Object Segmentation from Referring Expressions. | Zhao Yang, Yansong Tang, Luca Bertinetto, Hengshuang Zhao, Philip H. S. Torr |
| 2021 | CVPR | Distilling Knowledge via Knowledge Review. | Pengguang Chen, Shu Liu, Hengshuang Zhao, Jiaya Jia |
| 2021 | CVPR | Bidirectional Projection Network for Cross Dimension Scene Understanding. | Wenbo Hu, Hengshuang Zhao, Li Jiang, Jiaya Jia, Tien-Tsin Wong |
| 2021 | CVPR | Semi-Supervised Semantic Segmentation With Directional Context-Aware Consistency. | Xin Lai, Zhuotao Tian, Li Jiang, Shu Liu, Hengshuang Zhao, Liwei Wang, Jiaya Jia |
| 2021 | CVPR | Fully Convolutional Networks for Panoptic Segmentation. | Yanwei Li, Hengshuang Zhao, Xiaojuan Qi, Liwei Wang, Zeming Li, Jian Sun, Jiaya Jia |
| 2021 | CVPR | PAConv: Position Adaptive Convolution With Dynamic Kernel Assembling on Point Clouds. | Mutian Xu, Runyu Ding, Hengshuang Zhao, Xiaojuan Qi |
| 2021 | CVPR | Rethinking Semantic Segmentation From a Sequence-to-Sequence Perspective With Transformers. | Sixiao Zheng, Jiachen Lu, Hengshuang Zhao, Xiatian Zhu, Zekun Luo, Yabiao Wang, Yanwei Fu, Jianfeng Feng, Tao Xiang, Philip H. S. Torr, Li Zhang |
| 2021 | ICCV | Dynamic Divide-and-Conquer Adversarial Training for Robust Semantic Segmentation. | Xiaogang Xu, Hengshuang Zhao, Jiaya Jia |
| 2021 | ICCV | Point Transformer. | Hengshuang Zhao, Li Jiang, Jiaya Jia, Philip H. S. Torr, Vladlen Koltun |
| 2021 | IJCAI | Dual-Cross Central Difference Network for Face Anti-Spoofing. | Zitong Yu, Yunxiao Qin, Hengshuang Zhao, Xiaobai Li, Guoying Zhao |
| 2020 | CVPR | PointGroup: Dual-Set Point Grouping for 3D Instance Segmentation. | Li Jiang, Hengshuang Zhao, Shaoshuai Shi, Shu Liu, Chi-Wing Fu, Jiaya Jia |
| 2020 | CVPR | Exploring Self-Attention for Image Recognition. | Hengshuang Zhao, Jiaya Jia, Vladlen Koltun |
| 2019 | CVPR | UPSNet: A Unified Panoptic Segmentation Network. | Yuwen Xiong, Renjie Liao, Hengshuang Zhao, Rui Hu, Min Bai, Ersin Yumer, Raquel Urtasun |
| 2019 | CVPR | PointWeb: Enhancing Local Neighborhood Features for Point Cloud Processing. | Hengshuang Zhao, Li Jiang, Chi-Wing Fu, Jiaya Jia |
| 2019 | ICCV | Hierarchical Point-Edge Interaction Network for Point Cloud Semantic Segmentation. | Li Jiang, Hengshuang Zhao, Shu Liu, Xiaoyong Shen, Chi-Wing Fu, Jiaya Jia |
| 2018 | ECCV | SegStereo: Exploiting Semantic Information for Disparity Estimation. | Guorun Yang, Hengshuang Zhao, Jianping Shi, Zhidong Deng, Jiaya Jia |
| 2018 | ECCV | ICNet for Real-Time Semantic Segmentation on High-Resolution Images. | Hengshuang Zhao, Xiaojuan Qi, Xiaoyong Shen, Jianping Shi, Jiaya Jia |
| 2018 | ECCV | Compositing-Aware Image Search. | Hengshuang Zhao, Xiaohui Shen, Zhe Lin, Kalyan Sunkavalli, Brian L. Price, Jiaya Jia |
| 2018 | ECCV | PSANet: Point-wise Spatial Attention Network for Scene Parsing. | Hengshuang Zhao, Yi Zhang, Shu Liu, Jianping Shi, Chen Change Loy, Dahua Lin, Jiaya Jia |
| 2017 | CVPR | Pyramid Scene Parsing Network. | Hengshuang Zhao, Jianping Shi, Xiaojuan Qi, Xiaogang Wang, Jiaya Jia |
| 2016 | ECCV | Augmented Feedback in Semantic Segmentation Under Image Level Supervision. | Xiaojuan Qi, Zhengzhe Liu, Jianping Shi, Hengshuang Zhao, Jiaya Jia |