Skip to content

Av-Data2Vec: Self-Supervised Learning of Audio-Visual Speech Representations with Contextualized Target Representations.

Jiachen Lian, Alexei Baevski, Wei-Ning Hsu, Michael Auli

VenueCASRU
Year2023
ProceedingsASRU

Browse the full ASRU paper archive.