Skip to content

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model.

Yong Ren, Chenxing Li, Le Xu, Hao Gu, Duzhen Zhang, Yujie Chen, Manjie Xu, Ruibo Fu, Shan Yang, Dong Yu

Year2025
ProceedingsINTERSPEECH

Browse the full Interspeech paper archive.