| 2025 | EMNLP | Taking Notes Brings Focus? Towards Multi-Turn Multimodal Dialogue Learning. | Jiazheng Liu, Sipeng Zheng, Brje F. Karlsson, Zongqing Lu |
| 2025 | ICCV | MotionCtrl: A Real-Time Controllable Vision-Language-Motion Model. | Bin Cao, Sipeng Zheng, Ye Wang, Lujie Xia, Qianshan Wei, Qin Jin, Jing Liu, Zongqing Lu |
| 2025 | ICCV | VideoOrion: Tokenizing Object Dynamics in Videos. | Yicheng Feng, Yijiang Li, Wanpeng Zhang, Sipeng Zheng, Hao Luo, Zihao Yue, Zongqing Lu |
| 2025 | ICCV | Unified Multimodal Understanding via Byte-Pair Visual Encoding. | Wanpeng Zhang, Yicheng Feng, Hao Luo, Yijiang Li, Zihao Yue, Sipeng Zheng, Zongqing Lu |
| 2025 | ICLR | From Pixels to Tokens: Byte-Pair Encoding on Quantized Visual Modalities. | Wanpeng Zhang, Zilong Xie, Yicheng Feng, Yijiang Li, Xingrun Xing, Sipeng Zheng, Zongqing Lu |
| 2025 | ICLR | Do Egocentric Video-Language Models Truly Understand Hand-Object Interactions? | Boshen Xu, Ziheng Wang, Yang Du, Zhinan Song, Sipeng Zheng, Qin Jin |
| 2025 | ICML | Scaling Large Motion Models with Million-Level Human Motions. | Ye Wang, Sipeng Zheng, Bin Cao, Qianshan Wei, Weishuai Zeng, Qin Jin, Zongqing Lu |
| 2024 | ECCV | UniCode: Learning a Unified Codebook for Multimodal Large Language Models. | Sipeng Zheng, Bohan Zhou, Yicheng Feng, Ye Wang, Zongqing Lu |
| 2024 | ICLR | Steve-Eye: Equipping LLM-based Embodied Agents with Visual Perception in Open Worlds. | Sipeng Zheng, Jiazheng Liu, Yicheng Feng, Zongqing Lu |
| 2024 | NAACL | LLaMA-Rider: Spurring Large Language Models to Explore the Open World. | Yicheng Feng, Yuxuan Wang, Jiazheng Liu, Sipeng Zheng, Zongqing Lu |
| 2023 | AAAI | Accommodating Audio Modality in CLIP for Multimodal Processing. | Ludan Ruan, Anwen Hu, Yuqing Song, Liang Zhang, Sipeng Zheng, Qin Jin |
| 2023 | CVPR | Open-Category Human-Object Interaction Pre-training via Language Modeling Framework. | Sipeng Zheng, Boshen Xu, Qin Jin |
| 2022 | CVPR | VRDFormer: End-to-End Video Visual Relation Detection with Transformers. | Sipeng Zheng, Shizhe Chen, Qin Jin |
| 2022 | ECCV | Few-Shot Action Recognition with Hierarchical Matching and Contrastive Learning. | Sipeng Zheng, Shizhe Chen, Qin Jin |