| 2026 | AAAI | Aligning Cross-View Visual Geometries in LVLMs Through Human-Like Reasoning Learning. | Yuming Qiao, Liang Luo, Dan Meng, Yifan Yang, Qingyuan Wang, Juntuo Wang, Yuwei Zhang, Ru Zhen, Yanhao Zhang, Haonan Lu, Xudong Zhang |
| 2026 | AAAI | OwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward. | Chunlin Zhong, Qiuxia Hou, Zhangjun Zhou, Yanhao Zhang, Shuang Hao, Haonan Lu, He Tang, Xiang Bai |
| 2026 | AAAI | Mobile-Agent-RAG: Driving Smart Multi-Agent Coordination with Contextual Knowledge Empowerment for Long-Horizon Mobile Automation. | Yuxiang Zhou, Jichang Li, Yanhao Zhang, Haonan Lu, Guanbin Li |
| 2026 | WWW | Click-to-Ask: An AI Live Streaming Assistant with Offline Copywriting and Online Interactive QA. | Ruizhi Yu, Keyang Zhong, Peng Liu, Qi Wu, Haoran Zhang, Yanhao Zhang, Chen Chen, Haonan Lu |
| 2025 | CVPR | HEIE: MLLM-Based Hierarchical Explainable AIGC Image Implausibility Evaluator. | Fan Yang, Ru Zhen, Jianing Wang, Yanhao Zhang, Haoxiang Chen, Haonan Lu, Sicheng Zhao, Guiguang Ding |
| 2025 | ICCV | Free-Moref: Instantly Multiplexing Context Perception Capabilities of Video-Mllms Within Single Inference. | Kuo Wang, Quanlong Zheng, Junlin Xie, Yanhao Zhang, Jinguo Luo, Haonan Lu, Liang Lin, Fan Zhou, Guanbin Li |
| 2025 | ICML | Best Subset Selection: Optimal Pursuit for Feature Selection and Elimination. | Zhihan Zhu, Yanhao Zhang, Yong Xia |
| 2025 | IROS | Self-supervised 3D Reconstruction of Tibia and Fibula from Biplanar X-rays. | Kai Pan, Yanhao Zhang, Liang Zhao, Shoudong Huang |
| 2024 | AAAI | BARET: Balanced Attention Based Real Image Editing Driven by Target-Text Inversion. | Yuming Qiao, Fanyi Wang, Jingwen Su, Yanhao Zhang, Yunjie Yu, Siyu Wu, Guo-Jun Qi |
| 2024 | CVPR | View from Above: Orthogonal-View Aware Cross-View Localization. | Shan Wang, Chuong Nguyen, Jiawei Liu, Yanhao Zhang, Sundaram Muthu, Fahira Afzal Maken, Kaihao Zhang, Hongdong Li |
| 2024 | ICASSP | Lightweight High-Resolution Subject Matting in the Real World. | Peng Liu, Fanyi Wang, Jingwen Su, Yanhao Zhang, Guojun Qi |
| 2024 | IJCAI | Zero-shot High-fidelity and Pose-controllable Character Animation. | Bingwen Zhu, Fanyi Wang, Tianyi Lu, Peng Liu, Jingwen Su, Jinxiu Liu, Yanhao Zhang, Zuxuan Wu, Guo-Jun Qi, Yu-Gang Jiang |
| 2024 | ICRA | Increasing SLAM Pose Accuracy by Ground-to-Satellite Image Registration. | Yanhao Zhang, Yujiao Shi, Shan Wang, Ankit Vora, Akhil Perincherry, Yongbo Chen, Hongdong Li |
| 2023 | AAAI | GAM: Gradient Attention Module of Optimization for Point Clouds Analysis. | Haotian Hu, Fanyi Wang, Zhiwang Zhang, Yaonong Wang, Laifeng Hu, Yanhao Zhang |
| 2023 | CVPR | Learning Audio-Visual Source Localization via False Negative Aware Contrastive Learning. | Weixuan Sun, Jiayi Zhang, Jianyuan Wang, Zheyuan Liu, Yiran Zhong, Tianpeng Feng, Yandong Guo, Yanhao Zhang, Nick Barnes |
| 2023 | ICCV | Homography Guided Temporal Fusion for Road Line and Marking Segmentation. | Shan Wang, Chuong Nguyen, Jiawei Liu, Kaihao Zhang, Wenhan Luo, Yanhao Zhang, Sundaram Muthu, Fahira Afzal Maken, Hongdong Li |
| 2023 | ICCV | View Consistent Purification for Accurate Cross-View Localization. | Shan Wang, Yanhao Zhang, Akhil Perincherry, Ankit Vora, Hongdong Li |
| 2023 | ICCV | TALL: Thumbnail Layout for Deepfake Video Detection. | Yuting Xu, Jian Liang, Gengyun Jia, Ziming Yang, Yanhao Zhang, Ran He |
| 2023 | IJCAI | Matting Moments: A Unified Data-Driven Matting Engine for Mobile AIGC in Photo Gallery. | Yanhao Zhang, Fanyi Wang, Weixuan Sun, Jingwen Su, Peng Liu, Yaqian Li, Xinjie Feng, Zhengxia Zou |
| 2023 | ICRA | 3D Reconstruction of Tibia and Fibula using One General Model and Two X-ray Images. | Kai Pan, Shuai Zhang, Liang Zhao, Shoudong Huang, Yanhao Zhang, Hua Wang, Qi Luo |
| 2023 | ICRA | Satellite Image Based Cross-view Localization for Autonomous Vehicle. | Shan Wang, Yanhao Zhang, Ankit Vora, Akhil Perincherry, Hengdong Li |
| 2022 | CVPR | RCL: Recurrent Continuous Localization for Temporal Action Detection. | Qiang Wang, Yanhao Zhang, Yun Zheng, Pan Pan |
| 2022 | MICCAI | NAF: Neural Attenuation Fields for Sparse-View CBCT Reconstruction. | Ruyi Zha, Yanhao Zhang, Hongdong Li |
| 2022 | WWW | FastClip: An Efficient Video Understanding System with Heterogeneous Computing and Coarse-to-fine Processing. | Liming Zhao, Siyang Sun, Yanhao Zhang, Yun Zheng, Pan Pan |
| 2022 | SIGIR | An Intelligent Advertisement Short Video Production System via Multi-Modal Retrieval. | Yanheng Wei, Lianghua Huang, Yanhao Zhang, Yun Zheng, Pan Pan |
| 2021 | AAAI | Fashion Focus: Multi-modal Retrieval System for Video Commodity Localization in E-commerce. | Yanhao Zhang, Qiang Wang, Pan Pan, Yun Zheng, Cheng Da, Siyang Sun, Yinghui Xu |
| 2021 | ICASSP | Exploring Visual-Audio Composition Alignment Network for Quality Fashion Retrieval in Video. | Yanhao Zhang, Jianmin Wu, Xiong Xiong, Dangwei Li, Chenwei Xie, Yun Zheng, Pan Pan, Yinghui Xu |
| 2021 | IROS | Some Research Questions for SLAM in Deformable Environments. | Shoudong Huang, Yongbo Chen, Liang Zhao, Yanhao Zhang, Mengya Xu |
| 2020 | ICRA | Aortic 3D Deformation Reconstruction using 2D X-ray Fluoroscopy and 3D Pre-operative Data for Endovascular Interventions. | Yanhao Zhang, Liang Zhao, Shoudong Huang |
| 2020 | MICCAI | Deep Learning Assisted Automatic Intra-operative 3D Aortic Deformation Reconstruction. | Yanhao Zhang, Raphael Falque, Liang Zhao, Shoudong Huang, Boni Hu |
| 2019 | CIKM | Virtual ID Discovery from E-commerce Media at Alibaba: Exploiting Richness of User Click Behavior for Visual Search Relevance. | Yanhao Zhang, Pan Pan, Yun Zheng, Kang Zhao, Jianmin Wu, Yinghui Xu, Rong Jin |
| 2019 | CIKM | Large-Scale Visual Search with Binary Distributed Graph at Alibaba. | Kang Zhao, Pan Pan, Yun Zheng, Yanhao Zhang, Changxu Wang, Yingya Zhang, Yinghui Xu, Rong Jin |
| 2018 | KDD | Visual Search at Alibaba. | Yanhao Zhang, Pan Pan, Yun Zheng, Kang Zhao, Yingya Zhang, Xiaofeng Ren, Rong Jin |
| 2015 | ICIP | Histograms of locally aggregated oriented gradients. | Xiusheng Lu, Shengping Zhang, Hongxun Yao, Xin Sun, Yanhao Zhang |
| 2014 | ICIP | "Clustering by saliency" - Unsupervised discovery of crowd activities. | Tingting Han, Hongxun Yao, Xiaoshuai Sun, Yanhao Zhang |
| 2014 | ICIP | DA-CCD: A novel action representation by Deep Architecture of local depth feature. | Yi Liu, Lei Qin, Zhongwei Cheng, Yanhao Zhang, Weigang Zhang, Qingming Huang |
| 2014 | ICIP | Weakly supervised cross-view action recognition via sequential motion accumulation. | Yi Liu, Lei Qin, Zhongwei Cheng, Yanhao Zhang, Weigang Zhang, Qingming Huang |
| 2014 | ICIP | Structure-aware multi-object discovery for weakly supervised tracking. | Yuankai Qi, Hongxun Yao, Xiaoshuai Sun, Xin Sun, Yanhao Zhang, Qingming Huang |
| 2013 | ICIP | A spatial-temporal constraint-based action recognition method. | Tingting Han, Hongxun Yao, Yanhao Zhang, Pengfei Xu |
| 2013 | ICIP | On dense sampling size. | Xue Li, Hongxun Yao, Xiaoshuai Sun, Yanhao Zhang |
| 2013 | ICIP | Structured Textons for texture representation. | Pengfei Xu, Xianming Liu, Hongxun Yao, Yanhao Zhang, Shaopeng Tang |
| 2013 | ICIP | Beyond particle flow: Bag of Trajectory Graphs for dense crowd event recognition. | Yanhao Zhang, Lei Qin, Hongxun Yao, Pengfei Xu, Qingming Huang |
| 2012 | ICIP | Abnormal crowd behavior detection based on social attribute-aware force model. | Yanhao Zhang, Lei Qin, Hongxun Yao, Qingming Huang |
| 2012 | ICIP | Aesthetic composition represetation for portrait photographing recommendation. | Yanhao Zhang, Xiaoshuai Sun, Hongxun Yao, Lei Qin, Qingming Huang |