FAM: Fine-Grained Alignment Matters in Multimodal Embedding Learning with Large Vision-Language Models.
Tianhang Xiang, Yirui Li, Lizhao Liu, Hongyan Zhi, Chuanshen Chen, Qing Du, Mingkui Tan
Browse the full AAAI paper archive.
Tianhang Xiang, Yirui Li, Lizhao Liu, Hongyan Zhi, Chuanshen Chen, Qing Du, Mingkui Tan
Browse the full AAAI paper archive.