TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models.
Ziyao Shangguan, Chuhan Li, Yuxuan Ding, Yanan Zheng, Yilun Zhao, Tesca Fitzgerald, Arman Cohan
Browse the full ICLR paper archive.
Ziyao Shangguan, Chuhan Li, Yuxuan Ding, Yanan Zheng, Yilun Zhao, Tesca Fitzgerald, Arman Cohan
Browse the full ICLR paper archive.