Speech Guided Masked Image Modeling for Visually Grounded Speech.
Jongbhin Woo, Hyeonggon Ryu, Arda Senocak, Joon Son Chung
Browse the full ICASSP paper archive.
Jongbhin Woo, Hyeonggon Ryu, Arda Senocak, Joon Son Chung
Browse the full ICASSP paper archive.