Skip to content

LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models.

Yanwei Li, Chengyao Wang, Jiaya Jia

VenueA*ECCV
Year2024
ProceedingsECCV (46)

Browse the full ECCV paper archive.