Towards Efficient Audio-Visual Learners via Empowering Pre-trained Vision Transformers with Cross-Modal Adaptation.
Kai Wang, Yapeng Tian, Dimitrios Hatzinakos
Browse the full CVPR paper archive.
Kai Wang, Yapeng Tian, Dimitrios Hatzinakos
Browse the full CVPR paper archive.