Skip to content

Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization.

Yang Jin, Zhicheng Sun, Kun Xu, Kun Xu, Liwei Chen, Hao Jiang, Quzhe Huang, Chengru Song, Yuliang Liu, Di Zhang, Yang Song, Kun Gai, Yadong Mu

VenueA*ICML
Year2024
ProceedingsICML

Browse the full ICML paper archive.