Skip to content

Unsupervised Audio-Caption Aligning Learns Correspondences Between Individual Sound Events and Textual Phrases.

Huang Xie, Okko Rsnen, Konstantinos Drossos, Tuomas Virtanen

Year2022
ProceedingsICASSP

Browse the full ICASSP paper archive.