Skip to content

SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability.

Jiankang Wang, Zhihan Zhang, Zhihang Liu, Yang Li, Jiannan Ge, Hongtao Xie, Yongdong Zhang

VenueA*AAAI
Year2026
ProceedingsAAAI

Browse the full AAAI paper archive.