Skip to content

VCR: A Task for Pixel-Level Complex Reasoning in Vision Language Models via Restoring Occluded Text.

Tianyu Zhang, Suyuchen Wang, Lu Li, Ge Zhang, Perouz Taslakian, Sai Rajeswar, Jie Fu, Bang Liu, Yoshua Bengio

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.