Skip to content

TAP-VL: Text Layout Aware Pretraining for Enriched Vision-Language Models.

Jonathan Fhima, Elad Ben-Avraham, Oren Nuriel, Yair Kittenplon, Roy Ganz, Aviad Aberdam, Ron Litman

VenueA*ICCV
Year2025
ProceedingsICCVW

Browse the full ICCV paper archive.