Skip to content

Taming Image-Based Vision-Language Pre-training Model with Bootstrapped Auxiliary Tasks for Video Captioning.

Ziyu Chen, Hanli Wang

VenueBMMM
Year2026
ProceedingsMMM (1)

Browse the full MMM paper archive.