Skip to content

DINOv2 Meets Text: A Unified Framework for Image- and Pixel-Level Vision-Language Alignment.

Cijo Jose, Tho Moutakanni, Dahyun Kang, Federico Baldassarre, Timothe Darcet, Hu Xu, Daniel Li, Marc Szafraniec, Michal Ramamonjisoa, Maxime Oquab, Oriane Simoni, Huy V. Vo, Patrick Labatut, Piotr Bojanowski

VenueA*CVPR
Year2025
ProceedingsCVPR

Browse the full CVPR paper archive.