Skip to content

DDVT: Dynamic Dual-Level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering.

Yue Zhang, Xiangyu Li, Wanshu Fan, Xin Yang, Dongsheng Zhou

VenueCCGI
Year2025
ProceedingsCGI (3)

Browse the full CGI paper archive.