Skip to content

TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models.

Ziyao Shangguan, Chuhan Li, Yuxuan Ding, Yanan Zheng, Yilun Zhao, Tesca Fitzgerald, Arman Cohan

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.