Av-Data2Vec: Self-Supervised Learning of Audio-Visual Speech Representations with Contextualized Target Representations.
Jiachen Lian, Alexei Baevski, Wei-Ning Hsu, Michael Auli
Browse the full ASRU paper archive.
Jiachen Lian, Alexei Baevski, Wei-Ning Hsu, Michael Auli
Browse the full ASRU paper archive.