| 2026 | AAAI | Vision-language Incremental Learning with Dual Class-individual Memory. | Fuhai Chen, Feng Zhang, Xiaoguang Ma, Yiyi Zhou, Jiarong Liu, Xuri Ge |
| 2025 | AAAI | What Kind of Visual Tokens Do We Need? Training-Free Visual Token Pruning for Multi-Modal Large Language Models from the Perspective of Graph. | Yutao Jiang, Qiong Wu, Wenhao Lin, Wei Yu, Yiyi Zhou |
| 2025 | AAAI | Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models. | Weihao Ye, Qiong Wu, Wenhao Lin, Yiyi Zhou |
| 2025 | CVPR | DViN: Dynamic Visual Routing Network for Weakly Supervised Referring Expression Comprehension. | Xiaofu Chen, Yaxin Luo, Gen Luo, Jiayi Ji, Henghui Ding, Yiyi Zhou |
| 2025 | CVPR | FlashSloth : Lightning Multimodal Large Language Models via Embedded Visual Compression. | Bo Tong, Bokai Lai, Yiyi Zhou, Gen Luo, Yunhang Shen, Ke Li, Xiaoshuai Sun, Rongrong Ji |
| 2025 | CVPR | SVFR: A Unified Framework for Generalized Video Face Restoration. | Zhiyao Wang, Xu Chen, Chengming Xu, Junwei Zhu, Xiaobin Hu, Jiangning Zhang, Chengjie Wang, Yuqi Liu, Yiyi Zhou, Rongrong Ji |
| 2025 | ICLR | Routing Experts: Learning to Route Dynamic Experts in Existing Multi-modal Large Language Models. | Qiong Wu, Zhaoxi Ke, Yiyi Zhou, Xiaoshuai Sun, Rongrong Ji |
| 2025 | ICLR | γ-MoD: Exploring Mixture-of-Depth Adaptation for Multimodal Large Language Models. | Yaxin Luo, Gen Luo, Jiayi Ji, Yiyi Zhou, Xiaoshuai Sun, Zhiqiang Shen, Rongrong Ji |
| 2025 | ICLR | Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models. | Gen Luo, Yiyi Zhou, Yuxin Zhang, Xiawu Zheng, Xiaoshuai Sun, Rongrong Ji |
| 2024 | AAAI | Towards Efficient Diffusion-Based Image Editing with Instant Attention Masks. | Siyu Zou, Jiji Tang, Yiyi Zhou, Jing He, Chaoyi Zhao, Rongsheng Zhang, Zhipeng Hu, Xiaoshuai Sun |
| 2024 | COLING | MMAPS: End-to-End Multi-Grained Multi-Modal Attribute-Aware Product Summarization. | Tao Chen, Ze Lin, Hui Li, Jiayi Ji, Yiyi Zhou, Guanbin Li, Rongrong Ji |
| 2024 | ICML | Fast Text-to-3D-Aware Face Generation and Manipulation via Direct Cross-modal Mapping and Geometric Regularization. | Jinlu Zhang, Yiyi Zhou, Qiancheng Zheng, Xiaoxiong Du, Gen Luo, Jun Peng, Xiaoshuai Sun, Rongrong Ji |
| 2024 | IJCNN | Adapting Pre-trained Language Models to Vision-Language Tasksvia Dynamic Visual Prompting. | Shubin Huang, Qiong Wu, Yiyi Zhou |
| 2023 | AAAI | Towards Real-Time Panoptic Narrative Grounding by an End-to-End Grounding Network. | Haowei Wang, Jiayi Ji, Yiyi Zhou, Yongjian Wu, Xiaoshuai Sun |
| 2023 | CVPR | RefCLIP: A Universal Teacher for Weakly Supervised Referring Expression Comprehension. | Lei Jin, Gen Luo, Yiyi Zhou, Xiaoshuai Sun, Guannan Jiang, Annan Shu, Rongrong Ji |
| 2023 | CVPR | RefTeacher: A Strong Baseline for Semi-Supervised Referring Expression Comprehension. | Jiamu Sun, Gen Luo, Yiyi Zhou, Xiaoshuai Sun, Guannan Jiang, Zhiyu Wang, Rongrong Ji |
| 2022 | CVPR | Active Teacher for Semi-Supervised Object Detection. | Peng Mi, Jianghang Lin, Yiyi Zhou, Yunhang Shen, Gen Luo, Xiaoshuai Sun, Liujuan Cao, Rongrong Fu, Qiang Xu, Rongrong Ji |
| 2022 | CVPR | DIFNet: Boosting Visual Information Flow for Image Captioning. | Mingrui Wu, Xuying Zhang, Xiaoshuai Sun, Yiyi Zhou, Chao Chen, Jiaxin Gu, Xing Sun, Rongrong Ji |
| 2022 | ECCV | PixelFolder: An Efficient Progressive Pixel Synthesis Network for Image Generation. | Jing He, Yiyi Zhou, Qi Zhang, Jun Peng, Yunhang Shen, Xiaoshuai Sun, Chao Chen, Rongrong Ji |
| 2022 | ECCV | SeqTR: A Simple Yet Universal Network for Visual Grounding. | Chaoyang Zhu, Yiyi Zhou, Yunhang Shen, Gen Luo, Xingjia Pan, Mingbao Lin, Chao Chen, Liujuan Cao, Xiaoshuai Sun, Rongrong Ji |
| 2021 | CVPR | RSTNet: Captioning With Adaptive Attention on Visual and Non-Visual Words. | Xuying Zhang, Xiaoshuai Sun, Yunpeng Luo, Jiayi Ji, Yiyi Zhou, Yongjian Wu, Feiyue Huang, Rongrong Ji |
| 2021 | ICCV | TRAR: Routing the Attention Spans in Transformer for Visual Question Answering. | Yiyi Zhou, Tianhe Ren, Chaoyang Zhu, Xiaoshuai Sun, Jianzhuang Liu, Xinghao Ding, Mingliang Xu, Rongrong Ji |
| 2020 | CVPR | Multi-Task Collaborative Network for Joint Referring Expression Comprehension and Segmentation. | Gen Luo, Yiyi Zhou, Xiaoshuai Sun, Liujuan Cao, Chenglin Wu, Cheng Deng, Rongrong Ji |
| 2019 | AAAI | Free VQA Models from Knowledge Inertia by Pairwise Inconformity Learning. | Yiyi Zhou, Rongrong Ji, Jinsong Su, Xiangming Li, Xiaoshuai Sun |
| 2019 | AAAI | Dynamic Capsule Attention for Visual Question Answering. | Yiyi Zhou, Rongrong Ji, Jinsong Su, Xiaoshuai Sun, Weiqiu Chen |
| 2019 | ICASSP | Towards Cross-modality Topic Modelling via Deep Topical Correlation Analysis. | Jun Peng, Yiyi Zhou, Liujuan Cao, Xiaoshuai Sun, Jinsong Su, Rongrong Ji |