Video-LLaVA: Learning United Visual Representation by Alignment Before Projection.
Bin Lin, Yang Ye, Bin Zhu, Jiaxi Cui, Munan Ning, Peng Jin, Li Yuan
Browse the full EMNLP paper archive.
Bin Lin, Yang Ye, Bin Zhu, Jiaxi Cui, Munan Ning, Peng Jin, Li Yuan
Browse the full EMNLP paper archive.