Embodied Scene Understanding for Vision Language Models via MetaVQA.
Weizhen Wang, Chenda Duan, Zhenghao Peng, Yuxin Liu, Bolei Zhou
Browse the full CVPR paper archive.
Weizhen Wang, Chenda Duan, Zhenghao Peng, Yuxin Liu, Bolei Zhou
Browse the full CVPR paper archive.