LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding.
Hongyu Li, Jinyu Chen, Ziyu Wei, Shaofei Huang, Tianrui Hui, Jialin Gao, Xiaoming Wei, Si Liu
Browse the full CVPR paper archive.
Hongyu Li, Jinyu Chen, Ziyu Wei, Shaofei Huang, Tianrui Hui, Jialin Gao, Xiaoming Wei, Si Liu
Browse the full CVPR paper archive.