An Empirical Study of End-to-End Video-Language Transformers with Masked Visual Modeling.
Tsu-Jui Fu, Linjie Li, Zhe Gan, Kevin Lin, William Yang Wang, Lijuan Wang, Zicheng Liu
Browse the full CVPR paper archive.
Tsu-Jui Fu, Linjie Li, Zhe Gan, Kevin Lin, William Yang Wang, Lijuan Wang, Zicheng Liu
Browse the full CVPR paper archive.