Skip to content

Audio-text Retrieval with Transformer-based Hierarchical Alignment and Disentangled Cross-modal Representation.

Yifei Xin, Zhihong Zhu, Xuxin Cheng, Xusheng Yang, Yuexian Zou

Year2024
ProceedingsINTERSPEECH

Browse the full Interspeech paper archive.