VCR: A Task for Pixel-Level Complex Reasoning in Vision Language Models via Restoring Occluded Text.
Tianyu Zhang, Suyuchen Wang, Lu Li, Ge Zhang, Perouz Taslakian, Sai Rajeswar, Jie Fu, Bang Liu, Yoshua Bengio
Browse the full ICLR paper archive.
Tianyu Zhang, Suyuchen Wang, Lu Li, Ge Zhang, Perouz Taslakian, Sai Rajeswar, Jie Fu, Bang Liu, Yoshua Bengio
Browse the full ICLR paper archive.