Skip to content

Synchronized Audio-Visual Frames with Fractional Positional Encoding for Transformers in Video-to-Text Translation.

Philipp Harzig, Moritz Einfalt, Rainer Lienhart

VenueBICIP
Year2022
ProceedingsICIP

Browse the full ICIP paper archive.