| 2025 | CVPR | Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model. | Lu Xu, Sijie Zhu, Chunyuan Li, Chia-Wen Kuo, Fan Chen, Xinyao Wang, Guang Chen, Dawei Du, Ye Yuan, Longyin Wen |
| 2025 | ICCV | $\mathcal{D}$-Attn: Decomposed Attention for Large Vision-and-Language Models. | Chia-Wen Kuo, Sijie Zhu, Fan Chen, Xiaohui Shen, Longyin Wen |
| 2025 | ICCV | SuperEdit: Rectifying and Facilitating Supervision for Instruction-Based Image Editing. | Ming Li, Xin Gu, Fan Chen, Xiaoying Xing, Longyin Wen, Chen Chen, Sijie Zhu |
| 2025 | ICLR | Multi-Reward as Condition for Instruction-based Image Editing. | Xin Gu, Ming Li, Libo Zhang, Fan Chen, Longyin Wen, Tiejian Luo, Sijie Zhu |
| 2023 | CVPR | TopNet: Transformer-Based Object Placement Network for Image Compositing. | Sijie Zhu, Zhe Lin, Scott Cohen, Jason Kuen, Zhifei Zhang, Chen Chen |
| 2023 | CVPR | $R^{2}$ Former: Unified Retrieval and Reranking Transformer for Place Recognition. | Sijie Zhu, Linjie Yang, Chen Chen, Mubarak Shah, Xiaohui Shen, Heng Wang |
| 2022 | CVPR | Consistency-based Active Learning for Object Detection. | Weiping Yu, Sijie Zhu, Taojiannan Yang, Chen Chen |
| 2022 | CVPR | TransGeo: Transformer Is All You Need for Cross-view Image Geo-localization. | Sijie Zhu, Mubarak Shah, Chen Chen |
| 2022 | ECCV | GALA: Toward Geometry-and-Lighting-Aware Object Search for Compositing. | Sijie Zhu, Zhe Lin, Scott Cohen, Jason Kuen, Zhifei Zhang, Chen Chen |
| 2021 | CVPR | VIGOR: Cross-View Image Geo-Localization Beyond One-to-One Retrieval. | Sijie Zhu, Taojiannan Yang, Chen Chen |
| 2021 | ICCV | 3D Human Pose Estimation with Spatial and Temporal Transformers. | Ce Zheng, Sijie Zhu, Matas Mendieta, Taojiannan Yang, Chen Chen, Zhengming Ding |
| 2021 | ISWC | MOTUS: Rendering Emotions with a Wrist-worn Tactile Display. | Verindi Vekemans, Ward Leenders, Sijie Zhu, Rong-Hao Liang |
| 2021 | WACV | Revisiting Street-to-Aerial View Image Geo-localization and Orientation Estimation. | Sijie Zhu, Taojiannan Yang, Chen Chen |
| 2020 | CVPR | Density Map Guided Object Detection in Aerial Images. | Changlin Li, Taojiannan Yang, Sijie Zhu, Chen Chen, Shanyue Guan |
| 2020 | ECCV | MutualNet: Adaptive ConvNet via Mutual Learning from Network Width and Resolution. | Taojiannan Yang, Sijie Zhu, Chen Chen, Shen Yan, Mi Zhang, Andrew R. Willis |
| 2019 | VTC | Evaluation Platform of Platoon Control Algorithms in Complex Communication Scenarios. | Sijie Zhu, Dip Goswami, Hong Li |