ε-ViLM : Efficient Video-Language Model via Masked Video Modeling with Semantic Vector-Quantized Tokenizer.
Jacob Zhiyuan Fang, Skyler Zheng, Vasu Sharma, Robinson Piramuthu
Browse the full WACV paper archive.
Jacob Zhiyuan Fang, Skyler Zheng, Vasu Sharma, Robinson Piramuthu
Browse the full WACV paper archive.