Skip to content

Enhancing Vision-Language Compositional Understanding with Multimodal Synthetic Data.

Haoxin Li, Boyang Li

VenueA*CVPR
Year2025
ProceedingsCVPR

Browse the full CVPR paper archive.