| 2026 | AAAI | RegionRAG: Region-level Retrieval-Augmented Generation for Visual Document Understanding. | Yinglu Li, Zhiying Lu, Zhihang Liu, Yiwei Sun, Chuanbin Liu, Hongtao Xie |
| 2026 | AAAI | SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability. | Jiankang Wang, Zhihan Zhang, Zhihang Liu, Yang Li, Jiannan Ge, Hongtao Xie, Yongdong Zhang |
| 2026 | SIGCOMM | Open the Floodgates in a Digital Twin: Experiences of Building Spillway for 100M+-User Signaling Storms in Cellular Core Network. | Hongtao Xie, Jianmin Liu, Ce Yang, Yu He, Li Chen, Dan Li, Mineng Fu, Xi Chen, Siyu Chen |
| 2025 | AAAI | IDseq: Decoupled and Sequentially Detecting and Grounding Multi-Modal Media Manipulation. | Runxin Liu, Tian Xie, Jiaming Li, Lingyun Yu, Hongtao Xie |
| 2025 | CVPR | PosterMaker: Towards High-Quality Product Poster Generation with Accurate Text Rendering. | Yifan Gao, Zihang Lin, Chuanbin Liu, Min Zhou, Tiezheng Ge, Bo Zheng, Hongtao Xie |
| 2025 | CVPR | Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models. | Zhihang Liu, Chen-Wei Xie, Pandeng Li, Liming Zhao, Longxiang Tang, Yun Zheng, Chuanbin Liu, Hongtao Xie |
| 2025 | CVPR | Mask^2DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation. | Tianhao Qi, Jianlong Yuan, Wanquan Feng, Shancheng Fang, Jiawei Liu, SiYu Zhou, Qian He, Hongtao Xie, Yongdong Zhang |
| 2025 | CVPR | SynTab-LLaVA: Enhancing Multimodal Table Understanding with Decoupled Synthesis. | Bangbang Zhou, Zuan Gao, Zixiao Wang, Boqiang Zhang, Yuxin Wang, Zhineng Chen, Hongtao Xie |
| 2025 | ICASSP | CPL: Curriculum Pseudo Labeling for Weakly Supervised Temporal Forgery Localization. | Dijia Zhang, Mingqi Fang, Zhiying Lu, Hongtao Xie |
| 2025 | ICCV | SVTRv2: CTC Beats Encoder-Decoder Models in Scene Text Recognition. | Yongkun Du, Zhineng Chen, Hongtao Xie, Caiyan Jia, Yu-Gang Jiang |
| 2025 | ICCV | Forensic-MoE: Exploring Comprehensive Synthetic Image Detection Traces With Mixture of Experts. | Mingqi Fang, Ziguang Li, Lingyun Yu, Quanwei Yang, Hongtao Xie, Yongdong Zhang |
| 2025 | ICCV | CLIP-Adapted Region-to-Text Learning for Generative Open-Vocabulary Semantic Segmentation. | Jiannan Ge, Lingxi Xie, Hongtao Xie, Pandeng Li, Sun-Ao Liu, Xiaopeng Zhang, Qi Tian, Yongdong Zhang |
| 2025 | ICCV | Igd: Instructional Graphic Design With Multimodal Layer Generatio. | Yadong Qu, Hongtao Xie, Yongdong Zhang, Shancheng Fang, Yuxin Wang, Xiaorui Wang, Zhineng Chen |
| 2025 | ICCV | Invisible Watermarks, Visible Gains: Steering Machine Unlearning with Bi-Level Watermarking Design. | Yuhao Sun, Yihua Zhang, Gaowen Liu, Hongtao Xie, Sijia Liu |
| 2025 | ICCV | GestureHYDRA: Semantic Co-Speech Gesture Synthesis via Hybrid Modality Diffusion Transformer and Cascaded-Synchronized Retrieval-Augmented Generation. | Quanwei Yang, Luying Huang, Kaisiyuan Wang, Jiazhi Guan, Shengyi He, Fengguo Li, Hang Zhou, Lingyun Yu, Yingying Li, Haocheng Feng, Hongtao Xie |
| 2025 | IJCAI | IterMeme: Expert-Guided Multimodal LLM for Interactive Meme Creation with Layout-Aware Generation. | Yaqi Cai, Shancheng Fang, Yadong Qu, Xiaorui Wang, Meng Shao, Hongtao Xie |
| 2024 | AAAI | Towards Balanced Alignment: Modal-Enhanced Semantic Modeling for Video Moment Retrieval. | Zhihang Liu, Jun Li, Hongtao Xie, Pandeng Li, Jiannan Ge, Sun'ao Liu, Guoqing Jin |
| 2024 | ACL | Knowledge Context Modeling with Pre-trained Language Models for Contrastive Knowledge Graph Completion. | Guangqian Yang, Yi Liu, Lei Zhang, Licheng Zhang, Hongtao Xie, Zhendong Mao |
| 2024 | CVPR | DEADiff: An Efficient Stylization Diffusion Model with Disentangled Representations. | Tianhao Qi, Shancheng Fang, Yanze Wu, Hongtao Xie, Jiawei Liu, Lang Chen, Qian He, Yongdong Zhang |
| 2024 | CVPR | DiffAM: Diffusion-Based Adversarial Makeup Transfer for Facial Privacy Protection. | Yuhao Sun, Lingyun Yu, Hongtao Xie, Jiaming Li, Yongdong Zhang |
| 2024 | CVPR | OTE: Exploring Accurate Scene Text Recognition Using One Token. | Jianjun Xu, Yuxin Wang, Hongtao Xie, Yongdong Zhang |
| 2024 | CVPR | Choose What You Need: Disentangled Representation Learning for Scene Text Recognition, Removal and Editing. | Boqiang Zhang, Hongtao Xie, Zuan Gao, Yuxin Wang |
| 2024 | ECCV | AlignZeg: Mitigating Objective Misalignment for Zero-Shot Semantic Segmentation. | Jiannan Ge, Lingxi Xie, Hongtao Xie, Pandeng Li, Xiaopeng Zhang, Yong-Dong Zhang, Qi Tian |
| 2024 | ECCV | Leveraging Text Localization for Scene Text Removal via Text-Aware Masked Image Modeling. | Zixiao Wang, Hongtao Xie, Yuxin Wang, Yadong Qu, Fengjun Guo, Pengwei Liu |
| 2024 | IJCAI | Self-Supervised Pre-training with Symmetric Superimposition Modeling for Scene Text Recognition. | Zuan Gao, Yuxin Wang, Yadong Qu, Boqiang Zhang, Zixiao Wang, Jianjun Xu, Hongtao Xie |
| 2024 | IJCAI | Focus on the Whole Character: Discriminative Character Modeling for Scene Text Recognition. | Bangbang Zhou, Yadong Qu, Zixiao Wang, Zicheng Li, Boqiang Zhang, Hongtao Xie |
| 2024 | ISCAS | LATextSpotter: Empowering Transformer Decoder with Length Perception Ability. | Zicheng Li, Yadong Qu, Hongtao Xie, Yongdong Zhang |
| 2024 | SiggraphA | TALK-Act: Enhance Textural-Awareness for 2D Speaking Avatar Reenactment with Diffusion Model. | Jiazhi Guan, Quanwei Yang, Kaisiyuan Wang, Hang Zhou, Shengyi He, Zhiliang Xu, Haocheng Feng, Errui Ding, Jingdong Wang, Hongtao Xie, Youjian Zhao, Ziwei Liu |
| 2023 | AAAI | Exploring Stroke-Level Modifications for Scene Text Editing. | Yadong Qu, Qingfeng Tan, Hongtao Xie, Jianjun Xu, YuXin Wang, Yongdong Zhang |
| 2023 | CVPR | Learning Orthogonal Prototypes for Generalized Few-Shot Semantic Segmentation. | Sun'ao Liu, Yiheng Zhang, Zhaofan Qiu, Hongtao Xie, Yongdong Zhang, Ting Yao |
| 2023 | ICCV | Progressive Spatio-Temporal Prototype Matching for Text-Video Retrieval. | Pandeng Li, Chen-Wei Xie, Liming Zhao, Hongtao Xie, Jiannan Ge, Yun Zheng, Deli Zhao, Yongdong Zhang |
| 2023 | IJCAI | Linguistic More: Taking a Further Step toward Efficient and Accurate Scene Text Recognition. | Boqiang Zhang, Hongtao Xie, Yuxin Wang, Jianjun Xu, Yongdong Zhang |
| 2023 | IJCAI | TPS++: Attention-Enhanced Thin-Plate Spline for Scene Text Recognition. | Tianlun Zheng, Zhineng Chen, Jinfeng Bai, Hongtao Xie, Yu-Gang Jiang |
| 2022 | AAAI | Neighborhood-Adaptive Structure Augmented Metric Learning. | Pandeng Li, Yan Li, Hongtao Xie, Lei Zhang |
| 2022 | CVPR | Partial Class Activation Attention for Semantic Segmentation. | Sun'ao Liu, Hongtao Xie, Hai Xu, Yongdong Zhang, Qi Tian |
| 2022 | ECCV | Dual-Stream Knowledge-Preserving Hashing for Unsupervised Video Retrieval. | Pandeng Li, Hongtao Xie, Jiannan Ge, Lei Zhang, Shaobo Min, Yongdong Zhang |
| 2022 | ECCV | Detecting Tampered Scene Text in the Wild. | Yuxin Wang, Hongtao Xie, Mengting Xing, Jing Wang, Shenggao Zhu, Yongdong Zhang |
| 2021 | AAAI | Semantic-guided Reinforced Region Embedding for Generalized Zero-Shot Learning. | Jiannan Ge, Hongtao Xie, Shaobo Min, Yongdong Zhang |
| 2021 | AAAI | Query-Memory Re-Aggregation for Weakly-supervised Video Object Segmentation. | Fanchao Lin, Hongtao Xie, Yan Li, Yongdong Zhang |
| 2021 | CVPR | Read Like Humans: Autonomous, Bidirectional and Iterative Language Modeling for Scene Text Recognition. | Shancheng Fang, Hongtao Xie, Yuxin Wang, Zhendong Mao, Yongdong Zhang |
| 2021 | CVPR | Frequency-Aware Discriminative Feature Learning Supervised by Single-Center Loss for Face Forgery Detection. | Jiaming Li, Hongtao Xie, Jiahong Li, Zhongyuan Wang, Yongdong Zhang |
| 2021 | ICCV | From Two to One: A New Scene Text Recognizer with Visual Language Modeling Network. | Yuxin Wang, Hongtao Xie, Shancheng Fang, Jing Wang, Shenggao Zhu, Yongdong Zhang |
| 2021 | ICIG | Global Characteristic Guided Landmark Detection for Genu Valgus and Varus Diagnosis. | Lingfeng Ma, Chuanbin Liu, Sicheng Zhang, Yizhi Liu, Hongtao Xie |
| 2021 | IJCAI | Dynamic Inconsistency-aware DeepFake Video Detection. | Ziheng Hu, Hongtao Xie, Yuxin Wang, Jiahong Li, Zhongyuan Wang, Yongdong Zhang |
| 2020 | AAAI | Filtration and Distillation: Enhancing Region Attention for Fine-Grained Visual Categorization. | Chuanbin Liu, Hongtao Xie, Zheng-Jun Zha, Lingfeng Ma, Lingyun Yu, Yongdong Zhang |
| 2020 | AAAI | CircleNet for Hip Landmark Detection. | Hai Wu, Hongtao Xie, Chuanbin Liu, Zheng-Jun Zha, Jun Sun, Yongdong Zhang |
| 2020 | ACL | Curriculum Learning for Natural Language Understanding. | Benfeng Xu, Licheng Zhang, Zhendong Mao, Quan Wang, Hongtao Xie, Yongdong Zhang |
| 2020 | CVPR | Graph Structured Network for Image-Text Matching. | Chunxiao Liu, Zhendong Mao, Tianzhu Zhang, Hongtao Xie, Bin Wang, Yongdong Zhang |
| 2020 | CVPR | Domain-Aware Visual Bias Eliminating for Generalized Zero-Shot Learning. | Shaobo Min, Hantao Yao, Hongtao Xie, Chaoqun Wang, Zheng-Jun Zha, Yongdong Zhang |
| 2020 | CVPR | ContourNet: Taking a Further Step Toward Accurate Arbitrary-Shaped Scene Text Detection. | Yuxin Wang, Hongtao Xie, Zheng-Jun Zha, Mengting Xing, Zilong Fu, Yongdong Zhang |
| 2020 | IJCAI | Real-World Automatic Makeup via Identity Preservation Makeup Net. | Zhikun Huang, Zhedong Zheng, Chenggang Yan, Hongtao Xie, Yaoqi Sun, Jianzhong Wang, Jiyong Zhang |
| 2020 | ICPR | Hierarchical Consistency and Refinement for Semi-supervised Medical Segmentation. | Zixiao Wang, Hai Xu, Youliang Tian, Hongtao Xie |
| 2020 | MICCAI | Learning Rich Attention for Pediatric Bone Age Assessment. | Chuanbin Liu, Hongtao Xie, Yunyan Yan, Zhendong Mao, Yongdong Zhang |
| 2020 | MMM | Law Is Order: Protecting Multimedia Network Transmission by Game Theory and Mechanism Design. | Chuanbin Liu, Youliang Tian, Hongtao Xie |
| 2020 | MMM | Improving Brain Tumor Segmentation with Dilated Pseudo-3D Convolution and Multi-direction Fusion. | Sun'ao Liu, Hai Xu, Yizhi Liu, Hongtao Xie |
| 2019 | AAAI | Robust Deep Co-Saliency Detection with Group Semantic. | Chong Wang, Zheng-Jun Zha, Dong Liu, Hongtao Xie |
| 2019 | ICIP | Accurate Segmentation of Synaptic Cleft with Contour Growing Concatenated with a Convnet. | Shaobo Min, Xuejin Chen, Hongtao Xie, Zheng-Jun Zha, Guoqiang Bi, Feng Wu, Yongdong Zhang |
| 2019 | IJCAI | Semi-supervised User Profiling with Heterogeneous Graph Attention Networks. | Weijian Chen, Yulong Gu, Zhaochun Ren, Xiangnan He, Hongtao Xie, Tong Guo, Dawei Yin, Yongdong Zhang |
| 2019 | IJCAI | Learning to Draw Text in Natural Images with Conditional Adversarial Networks. | Shancheng Fang, Hongtao Xie, Jianjun Chen, Jianlong Tan, Yongdong Zhang |
| 2019 | IJCAI | DSRN: A Deep Scale Relationship Network for Scene Text Detection. | Yuxin Wang, Hongtao Xie, Zilong Fu, Yongdong Zhang |
| 2019 | MICCAI | Extract Bone Parts Without Human Prior: End-to-end Convolutional Neural Network for Pediatric Bone Age Assessment. | Chuanbin Liu, Hongtao Xie, Yizhi Liu, Zheng-Jun Zha, Fanchao Lin, Yongdong Zhang |
| 2019 | MICCAI | Misshapen Pelvis Landmark Detection by Spatial Local Correlation Mining for Diagnosing Developmental Dysplasia of the Hip. | Chuanbin Liu, Hongtao Xie, Sicheng Zhang, Jingyuan Xu, Jun Sun, Yongdong Zhang |
| 2019 | MICCAI | Deep Cascaded Attention Network for Multi-task Brain Tumor Segmentation. | Hai Xu, Hongtao Xie, Yizhi Liu, Chuandong Cheng, Chaoshi Niu, Yongdong Zhang |
| 2019 | MICCAI | ACE-Net: Biomedical Image Segmentation with Augmented Contracting and Expansive Paths. | Yanhao Zhu, Zhineng Chen, Shuai Zhao, Hongtao Xie, Wenming Guo, Yongdong Zhang |
| 2019 | MMM | Adaptive Alignment Network for Person Re-identification. | Xierong Zhu, Jiawei Liu, Hongtao Xie, Zheng-Jun Zha |
| 2018 | KSEM | Deep Convolutional Nets for Pulmonary Nodule Detection and Classification. | Nannan Sun, Dongbao Yang, Shancheng Fang, Hongtao Xie |
| 2018 | MMM | Uyghur Text Localization with Fast Component Detection. | Jianjun Chen, Hongtao Xie, Yue Hu, Chenggang Yan |
| 2018 | VCIP | Potential of Attention Mechanism for Classification of Optical Coherence Tomography Images. | Zhihua Shang, Zilong Fu, Chuanbin Liu, Hongtao Xie, Yongdong Zhang |
| 2017 | ICASSP | Double-bit quantization and weighting for nearest neighbor search. | Han Deng, Hongtao Xie, Wei Ma, Zhendong Mao, Chuan Zhou |
| 2017 | IJCNN | CPMF: A collective pairwise matrix factorization model for upcoming event recommendation. | Chun-Yi Liu, Chuan Zhou, Jia Wu, Hongtao Xie, Yue Hu, Li Guo |
| 2017 | MMM | Uyghur Language Text Detection in Complex Background Images Using Enhanced MSERs. | Shun Liu, Hongtao Xie, Chuan Zhou, Zhendong Mao |
| 2014 | MMM | Video to Article Hyperlinking by Multiple Tag Property Exploration. | Zhineng Chen, Bailan Feng, Hongtao Xie, Rong Zheng, Bo Xu |
| 2011 | ICIP | Local geometric consistency constraint for image retrieval. | Hongtao Xie, Ke Gao, Yongdong Zhang, Jintao Li |
| 2010 | ECCV | Effective and Efficient Image Copy Detection Based on GPU. | Hongtao Xie, Ke Gao, Yongdong Zhang, Jintao Li, Yizhi Liu, Huamin Ren |
| 2010 | ICASSP | GPU-based fast scale invariant interest point detector. | Hongtao Xie, Ke Gao, Yongdong Zhang, Jintao Li, Yizhi Liu |