Audio-text Retrieval with Transformer-based Hierarchical Alignment and Disentangled Cross-modal Representation.
Yifei Xin, Zhihong Zhu, Xuxin Cheng, Xusheng Yang, Yuexian Zou
Browse the full Interspeech paper archive.
Yifei Xin, Zhihong Zhu, Xuxin Cheng, Xusheng Yang, Yuexian Zou
Browse the full Interspeech paper archive.