Skip to content

LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token.

Shaolei Zhang, Qingkai Fang, Zhe Yang, Yang Feng

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.