Skip to content

VLTinT: Visual-Linguistic Transformer-in-Transformer for Coherent Video Paragraph Captioning.

Kashu Yamazaki, Khoa Vo, Quang Sang Truong, Bhiksha Raj, Ngan Le

VenueA*AAAI
Year2023
ProceedingsAAAI

Browse the full AAAI paper archive.