Vision Transformers are Parameter-Efficient Audio-Visual Learners.
Yan-Bo Lin, Yi-Lin Sung, Jie Lei, Mohit Bansal, Gedas Bertasius
Browse the full CVPR paper archive.
Yan-Bo Lin, Yi-Lin Sung, Jie Lei, Mohit Bansal, Gedas Bertasius
Browse the full CVPR paper archive.