DDVT: Dynamic Dual-Level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering.
Yue Zhang, Xiangyu Li, Wanshu Fan, Xin Yang, Dongsheng Zhou
Browse the full CGI paper archive.
Yue Zhang, Xiangyu Li, Wanshu Fan, Xin Yang, Dongsheng Zhou
Browse the full CGI paper archive.