Skip to content

Sound of Vision: Audio Generation from Visual Text Embedding through Training Domain Discriminator.

Jaewon Kim, Won-Gook Choi, Seyun Ahn, Joon-Hyuk Chang

Year2024
ProceedingsINTERSPEECH

Browse the full Interspeech paper archive.