Task-aware Cross-modal Feature Refinement Transformer with Large Language Models for Visual Grounding.
Wenbo Chen, Zhen Xu, Ruotao Xu, Si Wu, Hau-San Wong
Browse the full CVPR paper archive.
Wenbo Chen, Zhen Xu, Ruotao Xu, Si Wu, Hau-San Wong
Browse the full CVPR paper archive.