Skip to content

Seeing Through Words, Speaking Through Pixels: Deep Representational Alignment Between Vision and Language Models.

Zoe Wanying He, Sean Trott, Meenakshi Khosla

VenueA*EMNLP
Year2025
ProceedingsEMNLP

Browse the full EMNLP paper archive.