VICTR: Visual Information Captured Text Representation for Text-to-Vision Multimodal Tasks.
Soyeon Caren Han, Siqu Long, Siwen Luo, Kunze Wang, Josiah Poon
Browse the full COLING paper archive.
Soyeon Caren Han, Siqu Long, Siwen Luo, Kunze Wang, Josiah Poon
Browse the full COLING paper archive.