| 2026 | AAAI | Zooming In on Fakes: A Novel Dataset for Localized AI-Generated Image Detection with Forgery Amplification Approach. | Lvpan Cai, Haowei Wang, Jiayi Ji, YanShu ZhouMen, Shen Chen, Taiping Yao, Xiaoshuai Sun |
| 2026 | ACL | CSMCIR: CoT-Enhanced Symmetric Alignment with Memory Bank for Composed Image Retrieval. | Zhipeng Qian, Zihan Liang, Yufei Ma, Ben Chen, Huangyu Dai, Yiwei Ma, Jiayi Ji, Chenyi Lei, Han Li, Xiaoshuai Sun |
| 2025 | AAAI | StoryWeaver: A Unified World Model for Knowledge-Enhanced Story Character Customization. | Jinlu Zhang, Jiji Tang, Rongsheng Zhang, Tangjie Lv, Xiaoshuai Sun |
| 2025 | AAAI | IPDN: Image-enhanced Prompt Decoding Network for 3D Referring Expression Segmentation. | Qi Chen, Changli Wu, Jiayi Ji, Yiwei Ma, Danni Yang, Xiaoshuai Sun |
| 2025 | CVPR | Towards General Visual-Linguistic Face Forgery Detection. | Ke Sun, Shen Chen, Taiping Yao, Ziyin Zhou, Jiayi Ji, Xiaoshuai Sun, Chia-Wen Lin, Rongrong Ji |
| 2025 | CVPR | ACL: Activating Capability of Linear Attention for Image Restoration. | Yubin Gu, Yuan Meng, Jiayi Ji, Xiaoshuai Sun |
| 2025 | CVPR | FlashSloth : Lightning Multimodal Large Language Models via Embedded Visual Compression. | Bo Tong, Bokai Lai, Yiyi Zhou, Gen Luo, Yunhang Shen, Ke Li, Xiaoshuai Sun, Rongrong Ji |
| 2025 | ICCV | Aigi-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models. | Ziyin Zhou, Yunpeng Luo, Yuanchen Wu, Ke Sun, Jiayi Ji, Ke Yan, Shouhong Ding, Xiaoshuai Sun, Yunsheng Wu, Rongrong Ji |
| 2025 | ICLR | Routing Experts: Learning to Route Dynamic Experts in Existing Multi-modal Large Language Models. | Qiong Wu, Zhaoxi Ke, Yiyi Zhou, Xiaoshuai Sun, Rongrong Ji |
| 2025 | ICLR | γ-MoD: Exploring Mixture-of-Depth Adaptation for Multimodal Large Language Models. | Yaxin Luo, Gen Luo, Jiayi Ji, Yiyi Zhou, Xiaoshuai Sun, Zhiqiang Shen, Rongrong Ji |
| 2025 | ICLR | Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models. | Gen Luo, Yiyi Zhou, Yuxin Zhang, Xiawu Zheng, Xiaoshuai Sun, Rongrong Ji |
| 2024 | AAAI | Improving Panoptic Narrative Grounding by Harnessing Semantic Relationships and Visual Confirmation. | Tianyu Guo, Haowei Wang, Yiwei Ma, Jiayi Ji, Xiaoshuai Sun |
| 2024 | AAAI | X-RefSeg3D: Enhancing Referring 3D Instance Segmentation via Structured Cross-Modal Graph Neural Networks. | Zhipeng Qian, Yiwei Ma, Jiayi Ji, Xiaoshuai Sun |
| 2024 | AAAI | Toward Open-Set Human Object Interaction Detection. | Mingrui Wu, Yuqi Liu, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji |
| 2024 | AAAI | 3D-STMN: Dependency-Driven Superpoint-Text Matching Network for End-to-End 3D Referring Expression Segmentation. | Changli Wu, Yiwei Ma, Qi Chen, Haowei Wang, Gen Luo, Jiayi Ji, Xiaoshuai Sun |
| 2024 | AAAI | Towards Efficient Diffusion-Based Image Editing with Instant Attention Masks. | Siyu Zou, Jiji Tang, Yiyi Zhou, Jing He, Chaoyi Zhao, Rongsheng Zhang, Zhipeng Hu, Xiaoshuai Sun |
| 2024 | CVPR | Rotated Multi-Scale Interaction Network for Referring Remote Sensing Image Segmentation. | Sihan Liu, Yiwei Ma, Xiaoqing Zhang, Haowei Wang, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji |
| 2024 | ECCV | Multi-branch Collaborative Learning Network for 3D Visual Grounding. | Zhipeng Qian, Yiwei Ma, Zhekai Lin, Jiayi Ji, Xiawu Zheng, Xiaoshuai Sun, Rongrong Ji |
| 2024 | ECCV | Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model. | Danni Yang, Ruohan Dong, Jiayi Ji, Yiwei Ma, Haowei Wang, Xiaoshuai Sun, Rongrong Ji |
| 2024 | EMNLP | AnyTrans: Translate AnyText in the Image with Large Scale Models. | Zhipeng Qian, Pei Zhang, Baosong Yang, Kai Fan, Yiwei Ma, Derek F. Wong, Xiaoshuai Sun, Rongrong Ji |
| 2024 | ICML | Fast Text-to-3D-Aware Face Generation and Manipulation via Direct Cross-modal Mapping and Geometric Regularization. | Jinlu Zhang, Yiyi Zhou, Qiancheng Zheng, Xiaoxiong Du, Gen Luo, Jun Peng, Xiaoshuai Sun, Rongrong Ji |
| 2024 | ICML | X-Oscar: A Progressive Framework for High-quality Text-guided 3D Animatable Avatar Generation. | Yiwei Ma, Zhekai Lin, Jiayi Ji, Yijun Fan, Xiaoshuai Sun, Rongrong Ji |
| 2024 | ICML | Evaluating and Analyzing Relationship Hallucinations in Large Vision-Language Models. | Mingrui Wu, Jiayi Ji, Oucheng Huang, Jiale Li, Yuhang Wu, Xiaoshuai Sun, Rongrong Ji |
| 2024 | ICML | SAM as the Guide: Mastering Pseudo-Label Refinement in Semi-Supervised Referring Expression Segmentation. | Danni Yang, Jiayi Ji, Yiwei Ma, Tianyu Guo, Haowei Wang, Xiaoshuai Sun, Rongrong Ji |
| 2023 | AAAI | Towards Real-Time Panoptic Narrative Grounding by an End-to-End Grounding Network. | Haowei Wang, Jiayi Ji, Yiyi Zhou, Yongjian Wu, Xiaoshuai Sun |
| 2023 | AAAI | End-to-End Zero-Shot HOI Detection via Vision and Language Knowledge Distillation. | Mingrui Wu, Jiaxin Gu, Yunhang Shen, Mingbao Lin, Chao Chen, Xiaoshuai Sun |
| 2023 | CVPR | Clover: Towards A Unified Video-Language Alignment and Fusion Model. | Jingjia Huang, Yinan Li, Jiashi Feng, Xinglong Wu, Xiaoshuai Sun, Rongrong Ji |
| 2023 | CVPR | RefCLIP: A Universal Teacher for Weakly Supervised Referring Expression Comprehension. | Lei Jin, Gen Luo, Yiyi Zhou, Xiaoshuai Sun, Guannan Jiang, Annan Shu, Rongrong Ji |
| 2023 | CVPR | RefTeacher: A Strong Baseline for Semi-Supervised Referring Expression Comprehension. | Jiamu Sun, Gen Luo, Yiyi Zhou, Xiaoshuai Sun, Guannan Jiang, Zhiyu Wang, Rongrong Ji |
| 2023 | ICCV | X-Mesh: Towards Fast and Accurate Text-driven 3D Stylization via Dynamic Textual Guidance. | Yiwei Ma, Haowei Wang, Xiaoqing Zhang, Guannan Jiang, Xiaoshuai Sun, Weilin Zhuang, Jiayi Ji, Rongrong Ji |
| 2022 | CVPR | Active Teacher for Semi-Supervised Object Detection. | Peng Mi, Jianghang Lin, Yiyi Zhou, Yunhang Shen, Gen Luo, Xiaoshuai Sun, Liujuan Cao, Rongrong Fu, Qiang Xu, Rongrong Ji |
| 2022 | CVPR | DIFNet: Boosting Visual Information Flow for Image Captioning. | Mingrui Wu, Xuying Zhang, Xiaoshuai Sun, Yiyi Zhou, Chao Chen, Jiaxin Gu, Xing Sun, Rongrong Ji |
| 2022 | ECCV | PixelFolder: An Efficient Progressive Pixel Synthesis Network for Image Generation. | Jing He, Yiyi Zhou, Qi Zhang, Jun Peng, Yunhang Shen, Xiaoshuai Sun, Chao Chen, Rongrong Ji |
| 2022 | ECCV | An Information Theoretic Approach for Attention-Driven Face Forgery Detection. | Ke Sun, Hong Liu, Taiping Yao, Xiaoshuai Sun, Shen Chen, Shouhong Ding, Rongrong Ji |
| 2022 | ECCV | SeqTR: A Simple Yet Universal Network for Visual Grounding. | Chaoyang Zhu, Yiyi Zhou, Yunhang Shen, Gen Luo, Xingjia Pan, Mingbao Lin, Chao Chen, Liujuan Cao, Xiaoshuai Sun, Rongrong Ji |
| 2021 | AAAI | Improving Image Captioning by Leveraging Intra- and Inter-layer Global Representation in Transformer Network. | Jiayi Ji, Yunpeng Luo, Xiaoshuai Sun, Fuhai Chen, Gen Luo, Yongjian Wu, Yue Gao, Rongrong Ji |
| 2021 | AAAI | Dual-level Collaborative Transformer for Image Captioning. | Yunpeng Luo, Jiayi Ji, Xiaoshuai Sun, Liujuan Cao, Yongjian Wu, Feiyue Huang, Chia-Wen Lin, Rongrong Ji |
| 2021 | CVPR | RSTNet: Captioning With Adaptive Attention on Visual and Non-Visual Words. | Xuying Zhang, Xiaoshuai Sun, Yunpeng Luo, Jiayi Ji, Yiyi Zhou, Yongjian Wu, Feiyue Huang, Rongrong Ji |
| 2021 | ICCV | TRAR: Routing the Attention Spans in Transformer for Visual Question Answering. | Yiyi Zhou, Tianhe Ren, Chaoyang Zhu, Xiaoshuai Sun, Jianzhuang Liu, Xinghao Ding, Mingliang Xu, Rongrong Ji |
| 2020 | AAAI | SSAH: Semi-Supervised Adversarial Deep Hashing with Self-Paced Hard Sample Generation. | Sheng Jin, Shangchen Zhou, Yao Liu, Chao Chen, Xiaoshuai Sun, Hongxun Yao, Xian-Sheng Hua |
| 2020 | CVPR | Multi-Task Collaborative Network for Joint Referring Expression Comprehension and Segmentation. | Gen Luo, Yiyi Zhou, Xiaoshuai Sun, Liujuan Cao, Chenglin Wu, Cheng Deng, Rongrong Ji |
| 2019 | AAAI | Towards Optimal Discrete Online Hashing with Balanced Similarity. | Mingbao Lin, Rongrong Ji, Hong Liu, Xiaoshuai Sun, Yongjian Wu, Yunsheng Wu |
| 2019 | AAAI | Towards Optimal Fine Grained Retrieval via Decorrelated Centralized Loss with Normalize-Scale Layer. | Xiawu Zheng, Rongrong Ji, Xiaoshuai Sun, Baochang Zhang, Yongjian Wu, Feiyue Huang |
| 2019 | AAAI | Free VQA Models from Knowledge Inertia by Pairwise Inconformity Learning. | Yiyi Zhou, Rongrong Ji, Jinsong Su, Xiangming Li, Xiaoshuai Sun |
| 2019 | AAAI | Dynamic Capsule Attention for Visual Question Answering. | Yiyi Zhou, Rongrong Ji, Jinsong Su, Xiaoshuai Sun, Weiqiu Chen |
| 2019 | ICASSP | Towards Cross-modality Topic Modelling via Deep Topical Correlation Analysis. | Jun Peng, Yiyi Zhou, Liujuan Cao, Xiaoshuai Sun, Jinsong Su, Rongrong Ji |
| 2019 | ICCV | Pix2Vox: Context-Aware 3D Reconstruction From Single and Multi-View Images. | Haozhe Xie, Hongxun Yao, Xiaoshuai Sun, Shangchen Zhou, Shengping Zhang |
| 2019 | IJCAI | Hypergraph Induced Convolutional Manifold Networks. | Taisong Jin, Liujuan Cao, Baochang Zhang, Xiaoshuai Sun, Cheng Deng, Rongrong Ji |
| 2018 | BMVC | Strong Baseline for Single Image Dehazing with Deep Features and Instance Normalization. | Zheng Xu, Xitong Yang, Xue Li, Xiaoshuai Sun |
| 2018 | CVPR | GroupCap: Group-Based Image Captioning With Structured Relevance and Diversity Constraints. | Fuhai Chen, Rongrong Ji, Xiaoshuai Sun, Yongjian Wu, Jinsong Su |
| 2018 | DASFAA | Restricted Boltzmann Machine Based Active Learning for Sparse Recommendation. | Weiqing Wang, Hongzhi Yin, Zi Huang, Xiaoshuai Sun, Nguyen Quoc Viet Hung |
| 2018 | ICIP | Cycle-Consistency Based Hierarchical Dense Semantic Correspondence. | Chuang Lin, Hongxun Yao, Wei Yu, Xiaoshuai Sun |
| 2018 | IJCAI | Centralized Ranking Loss with Weakly Supervised Localization for Fine-Grained Object Retrieval. | Xiawu Zheng, Rongrong Ji, Xiaoshuai Sun, Yongjian Wu, Feiyue Huang, Yanhua Yang |
| 2017 | AAAI | Web-Based Semantic Fragment Discovery for On-Line Lingual-Visual Similarity. | Xiaoshuai Sun, Jiewei Cao, Chao Li, Lei Zhu, Heng Tao Shen |
| 2017 | AAAI | An Integrated Model for Effective Saliency Prediction. | Xiaoshuai Sun, Zi Huang, Hongzhi Yin, Heng Tao Shen |
| 2017 | ICDM | SPTF: A Scalable Probabilistic Tensor Factorization Model for Semantic-Aware Behavior Prediction. | Hongzhi Yin, Hongxu Chen, Xiaoshuai Sun, Hao Wang, Yang Wang, Quoc Viet Hung Nguyen |
| 2017 | ICIP | Dancing like a superstar: Action guidance based on pose estimation and conditional pose alignment. | Yuxin Hou, Hongxun Yao, Haoran Li, Xiaoshuai Sun |
| 2017 | ICIP | Gated additive skip context connection for object detection. | Haoran Li, Hongxun Yao, Yuxin Hou, Xiaoshuai Sun |
| 2016 | ICASSP | Mining representative actions for actor identification. | Wenlong Xie, Hongxun Yao, Xiaoshuai Sun, Sicheng Zhao, Tingting Han, Cheng Pang |
| 2015 | ICIP | Predicting discrete probability distribution of image emotions. | Sicheng Zhao, Hongxun Yao, Xiaolei Jiang, Xiaoshuai Sun |
| 2015 | ICIP | Distinctive action sketch. | Ying Zheng, Hongxun Yao, Xiaoshuai Sun, Sicheng Zhao |
| 2014 | ICIP | "Clustering by saliency" - Unsupervised discovery of crowd activities. | Tingting Han, Hongxun Yao, Xiaoshuai Sun, Yanhao Zhang |
| 2014 | ICIP | Structure-aware multi-object discovery for weakly supervised tracking. | Yuankai Qi, Hongxun Yao, Xiaoshuai Sun, Xin Sun, Yanhao Zhang, Qingming Huang |
| 2014 | ICIP | Exploring covert attention for generic boosting of saliency models. | Xiaoshuai Sun, Hongxun Yao |
| 2013 | CVPR | Exploring Implicit Image Statistics for Visual Representativeness Modeling. | Xiaoshuai Sun, Xin-Jing Wang, Hongxun Yao, Lei Zhang |
| 2013 | ICIP | On dense sampling size. | Xue Li, Hongxun Yao, Xiaoshuai Sun, Yanhao Zhang |
| 2013 | MMM | Flexible Presentation of Videos Based on Affective Content Analysis. | Sicheng Zhao, Hongxun Yao, Xiaoshuai Sun, Xiaolei Jiang, Pengfei Xu |
| 2012 | CVPR | What are we looking for: Towards statistical modeling of saccadic eye movements and visual saliency. | Xiaoshuai Sun, Hongxun Yao, Rongrong Ji |
| 2012 | ICIP | Aesthetic composition represetation for portrait photographing recommendation. | Yanhao Zhang, Xiaoshuai Sun, Hongxun Yao, Lei Qin, Qingming Huang |
| 2012 | VCIP | Action retrieval based on generalized dynamic depth data matching. | Lujun Chen, Hongxun Yao, Xiaoshuai Sun |
| 2011 | ICIG | Saliency Detection: A Self-Adaption Sparse Representation Approach. | Gaoxiang Zhang, Feng Jiang, Debin Zhao, Xiaoshuai Sun, Shaohui Liu |
| 2011 | ICIG | Affective Video Classification Based on Spatio-temporal Feature Fusion. | Sicheng Zhao, Hongxun Yao, Xiaoshuai Sun |
| 2011 | ICIP | Sparse representation based visual element analysis. | Xue Li, Hongxun Yao, Xiaoshuai Sun, Rongrong Ji, Xianming Liu, Pengfei Xu |
| 2010 | CVPR | Towards semantic embedding in visual vocabulary. | Rongrong Ji, Hongxun Yao, Xiaoshuai Sun, Bineng Zhong, Wen Gao |
| 2010 | ICASSP | Mining actor correlations with hierarchical concurrence parsing. | Kun Yuan, Hongxun Yao, Rongrong Ji, Xiaoshuai Sun |
| 2010 | ICIP | Visual saliency as sequential eye fixation probability. | Xiaoshuai Sun, Hongxun Yao, Rongrong Ji, Pengfei Xu, Xianming Liu, Shaohui Liu |
| 2010 | ICIP | Saliency detection based on short-term sparse representation. | Xiaoshuai Sun, Hongxun Yao, Rongrong Ji, Pengfei Xu, Xianming Liu, Shaohui Liu |
| 2010 | VCIP | A rotation and scale invariant texture description approach. | Pengfei Xu, Hongxun Yao, Rongrong Ji, Xiaoshuai Sun, Xianming Liu |