Audio-Visual Praise Estimation for Conversational Video based on Synchronization-Guided Multimodal Transformer.
Nobukatsu Hojo, Saki Mizuno, Satoshi Kobashikawa, Ryo Masumura, Mana Ihori, Hiroshi Sato, Tomohiro Tanaka
Browse the full Interspeech paper archive.