Skip to content

Sipeng Zheng

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

14

Venues

8

Active years

2022–2025

Best venue rank

A*

Where they publish

Papers

14 indexed papers, newest first.

YearVenueTitleAuthors
2025EMNLPTaking Notes Brings Focus? Towards Multi-Turn Multimodal Dialogue Learning.Jiazheng Liu, Sipeng Zheng, Brje F. Karlsson, Zongqing Lu
2025ICCVMotionCtrl: A Real-Time Controllable Vision-Language-Motion Model.Bin Cao, Sipeng Zheng, Ye Wang, Lujie Xia, Qianshan Wei, Qin Jin, Jing Liu, Zongqing Lu
2025ICCVVideoOrion: Tokenizing Object Dynamics in Videos.Yicheng Feng, Yijiang Li, Wanpeng Zhang, Sipeng Zheng, Hao Luo, Zihao Yue, Zongqing Lu
2025ICCVUnified Multimodal Understanding via Byte-Pair Visual Encoding.Wanpeng Zhang, Yicheng Feng, Hao Luo, Yijiang Li, Zihao Yue, Sipeng Zheng, Zongqing Lu
2025ICLRFrom Pixels to Tokens: Byte-Pair Encoding on Quantized Visual Modalities.Wanpeng Zhang, Zilong Xie, Yicheng Feng, Yijiang Li, Xingrun Xing, Sipeng Zheng, Zongqing Lu
2025ICLRDo Egocentric Video-Language Models Truly Understand Hand-Object Interactions?Boshen Xu, Ziheng Wang, Yang Du, Zhinan Song, Sipeng Zheng, Qin Jin
2025ICMLScaling Large Motion Models with Million-Level Human Motions.Ye Wang, Sipeng Zheng, Bin Cao, Qianshan Wei, Weishuai Zeng, Qin Jin, Zongqing Lu
2024ECCVUniCode: Learning a Unified Codebook for Multimodal Large Language Models.Sipeng Zheng, Bohan Zhou, Yicheng Feng, Ye Wang, Zongqing Lu
2024ICLRSteve-Eye: Equipping LLM-based Embodied Agents with Visual Perception in Open Worlds.Sipeng Zheng, Jiazheng Liu, Yicheng Feng, Zongqing Lu
2024NAACLLLaMA-Rider: Spurring Large Language Models to Explore the Open World.Yicheng Feng, Yuxuan Wang, Jiazheng Liu, Sipeng Zheng, Zongqing Lu
2023AAAIAccommodating Audio Modality in CLIP for Multimodal Processing.Ludan Ruan, Anwen Hu, Yuqing Song, Liang Zhang, Sipeng Zheng, Qin Jin
2023CVPROpen-Category Human-Object Interaction Pre-training via Language Modeling Framework.Sipeng Zheng, Boshen Xu, Qin Jin
2022CVPRVRDFormer: End-to-End Video Visual Relation Detection with Transformers.Sipeng Zheng, Shizhe Chen, Qin Jin
2022ECCVFew-Shot Action Recognition with Hierarchical Matching and Contrastive Learning.Sipeng Zheng, Shizhe Chen, Qin Jin