VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks.
Ziyan Jiang, Rui Meng, Xinyi Yang, Semih Yavuz, Yingbo Zhou, Wenhu Chen
Browse the full ICLR paper archive.
Ziyan Jiang, Rui Meng, Xinyi Yang, Semih Yavuz, Yingbo Zhou, Wenhu Chen
Browse the full ICLR paper archive.