Audio-Enhanced Vision-Language Modeling with Latent Space Broadening for High Quality Data Expansion.
Yu Sun, Yin Li, Ruixiao Sun, Chunhui Liu, Fangming Zhou, Ze Jin, Linjie Wang, Xiang Shen, Zhuolin Hao, Hongyu Xiong
Browse the full KDD paper archive.