Doubling down: sparse grounding with an additional, almost-matching caption for detection-oriented multimodal pretraining.
Giacomo Nebbia, Adriana Kovashka
Browse the full CVPR paper archive.
Giacomo Nebbia, Adriana Kovashka
Browse the full CVPR paper archive.