Skip to content

Transformer-Based Video Front-Ends for Audio-Visual Speech Recognition for Single and Muti-Person Video.

Dmitriy Serdyuk, Otavio Braga, Olivier Siohan

Year2022
ProceedingsINTERSPEECH

Browse the full Interspeech paper archive.