TAP-VL: Text Layout Aware Pretraining for Enriched Vision-Language Models.
Jonathan Fhima, Elad Ben-Avraham, Oren Nuriel, Yair Kittenplon, Roy Ganz, Aviad Aberdam, Ron Litman
Browse the full ICCV paper archive.
Jonathan Fhima, Elad Ben-Avraham, Oren Nuriel, Yair Kittenplon, Roy Ganz, Aviad Aberdam, Ron Litman
Browse the full ICCV paper archive.