| 2026 | AAAI | ViType: High-Fidelity Visual Text Rendering via Glyph-Aware Multimodal Diffusion. | Lishuai Gao, Jun-Yan He, Yingsen Zeng, Yujie Zhong, Xiaopeng Sun, Jie Hu, Zan Gao, Xiaoming Wei |
| 2025 | CVPR | HyperSeg: Hybrid Segmentation Assistant with Fine-grained Visual Perceiver. | Cong Wei, Yujie Zhong, Haoxian Tan, Yong Liu, Jie Hu, Dengjie Li, Zheng Zhao, Yujiu Yang |
| 2025 | CVPR | v-CLR: View-Consistent Learning for Open-World Instance Segmentation. | Chang-Bin Zhang, Jinhong Ni, Yujie Zhong, Kai Han |
| 2025 | CVPR | Mr. DETR: Instructive Multi-Route Training for Detection Transformers. | Chang-Bin Zhang, Yujie Zhong, Kai Han |
| 2025 | ICCV | RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving. | Zhijian Huang, Chengjian Feng, Feng Yan, Baihui Xiao, Zequn Jie, Yujie Zhong, Xiaodan Liang, Lin Ma |
| 2025 | ICCV | Instructseg: Unifying Instructed Visual Segmentation with Multi-Modal Large Language Models. | Cong Wei, Yujie Zhong, Haoxian Tan, Yingsen Zeng, Yong Liu, Hongfa Wang, Yujiu Yang |
| 2025 | ICCV | Advancing Visual Large Language Model for Multi-Granular Versatile Perception. | Wentao Xiang, Haoxian Tan, Yujie Zhong, Cong Wei, Dengjie Li, Yujiu Yang |
| 2025 | ICCV | RoboTron-Sim: Improving Real-World Driving via Simulated Hard-Case. | Baihui Xiao, Chengjian Feng, Zhijian Huang, Feng Yan, Yujie Zhong, Lin Ma |
| 2025 | ICCV | DisTime: Distribution-Based Time Representation for Video Large Language Models. | Yingsen Zeng, Zepeng Huang, Yujie Zhong, Chengjian Feng, Jie Hu, Lin Ma, Yang Liu |
| 2025 | ICCV | Layer-Wise Vision Injection With Disentangled Attention for Efficient LVLMs. | Xuange Zhang, Dengjie Li, Bo Liu, Zenghao Bao, Yao Zhou, Baisong Yang, Zhongying Liu, Yujie Zhong, Tongtong Yuan |
| 2025 | ICLR | CO-MOT: Boosting End-to-end Transformer-based Multi-Object Tracking via Coopetition Label Assignment and Shadow Sets. | Feng Yan, Weixin Luo, Yujie Zhong, Yiyang Gan, Lin Ma |
| 2024 | ACL | When Phrases Meet Probabilities: Enabling Open Relation Extraction with Cooperating Large Language Models. | Jiaxin Wang, Lingling Zhang, Wee Sun Lee, Yujie Zhong, Liwei Kang, Jun Liu |
| 2024 | CVPR | InstaGen: Enhancing Object Detection by Training on Synthetic Dataset. | Chengjian Feng, Yujie Zhong, Zequn Jie, Weidi Xie, Lin Ma |
| 2024 | CVPR | Intelligent Grimm - Open-ended Visual Storytelling via Latent Diffusion Models. | Chang Liu, Haoning Wu, Yujie Zhong, Xiaoyun Zhang, Yanfeng Wang, Weidi Xie |
| 2024 | ECCV | UniMD: Towards Unifying Moment Retrieval and Temporal Action Detection. | Yingsen Zeng, Yujie Zhong, Chengjian Feng, Lin Ma |
| 2023 | CVPR | AeDet: Azimuth-Invariant Multi-View 3D Object Detection. | Chengjian Feng, Zequn Jie, Yujie Zhong, Xiangxiang Chu, Lin Ma |
| 2023 | CVPR | TriDet: Temporal Action Detection with Relative Boundary Modeling. | Dingfeng Shi, Yujie Zhong, Qiong Cao, Lin Ma, Jia Li, Dacheng Tao |
| 2023 | CVPR | Adaptive Sparse Pairwise Loss for Object Re-Identification. | Xiao Zhou, Yujie Zhong, Zhen Cheng, Fan Liang, Lin Ma |
| 2023 | ICCV | Open-Vocabulary Semantic Segmentation with Decoupled One-Pass Network. | Cong Han, Yujie Zhong, Dengjie Li, Kai Han, Lin Ma |
| 2022 | AAAI | InsCLR: Improving Instance Retrieval with Self-Supervision. | Zelu Deng, Yujie Zhong, Sheng Guo, Weilin Huang |
| 2022 | BMVC | CounTR: Transformer-based Generalised Visual Counting. | Chang Liu, Yujie Zhong, Andrew Zisserman, Weidi Xie |
| 2022 | CVPR | Cross-Architecture Self-supervised Video Representation Learning. | Sheng Guo, Zihua Xiong, Yujie Zhong, Limin Wang, Xiaobo Guo, Bing Han, Weilin Huang |
| 2022 | CVPR | DearKD: Data-Efficient Early Knowledge Distillation for Vision Transformers. | Xianing Chen, Qiong Cao, Yujie Zhong, Jing Zhang, Shenghua Gao, Dacheng Tao |
| 2022 | ECCV | PromptDet: Towards Open-Vocabulary Detection Using Uncurated Images. | Chengjian Feng, Yujie Zhong, Zequn Jie, Xiangxiang Chu, Haibing Ren, Xiaolin Wei, Weidi Xie, Lin Ma |
| 2022 | ECCV | ReAct: Temporal Action Detection with Relational Queries. | Dingfeng Shi, Yujie Zhong, Qiong Cao, Jing Zhang, Lin Ma, Jia Li, Dacheng Tao |
| 2022 | EMNLP | MatchPrompt: Prompt-based Open Relation Extraction with Semantic Consistency Guided Clustering. | Jiaxin Wang, Lingling Zhang, Jun Liu, Xi Liang, Yujie Zhong, Yaqiang Wu |
| 2022 | IJCNLP | Contrastive Video-Language Learning with Fine-grained Frame Sampling. | Zixu Wang, Yujie Zhong, Yishu Miao, Lin Ma, Lucia Specia |
| 2021 | AAAI | Unchain the Search Space with Hierarchical Differentiable Architecture Search. | Guanting Liu, Yujie Zhong, Sheng Guo, Matthew R. Scott, Weilin Huang |
| 2021 | ICCV | TOOD: Task-aligned One-stage Object Detection. | Chengjian Feng, Yujie Zhong, Yu Gao, Matthew R. Scott, Weilin Huang |
| 2021 | ICCV | Exploring Classification Equilibrium in Long-Tailed Object Detection. | Chengjian Feng, Yujie Zhong, Weilin Huang |
| 2020 | ECCV | Representation Sharing for Fast Object Detector Search and Beyond. | Yujie Zhong, Zelu Deng, Sheng Guo, Matthew R. Scott, Weilin Huang |
| 2018 | ACCV | GhostVLAD for Set-Based Face Recognition. | Yujie Zhong, Relja Arandjelovic, Andrew Zisserman |
| 2018 | ECCV | Compact Deep Aggregation for Set Retrieval. | Yujie Zhong, Relja Arandjelovic, Andrew Zisserman |
| 2016 | BMVC | Faces in Places: compound query retrieval. | Yujie Zhong, Relja Arandjelovic, Andrew Zisserman |