DINOv2 Meets Text: A Unified Framework for Image- and Pixel-Level Vision-Language Alignment.
Cijo Jose, Tho Moutakanni, Dahyun Kang, Federico Baldassarre, Timothe Darcet, Hu Xu, Daniel Li, Marc Szafraniec, Michal Ramamonjisoa, Maxime Oquab, Oriane Simoni, Huy V. Vo, Patrick Labatut, Piotr Bojanowski
Browse the full CVPR paper archive.