Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Action.
Jiasen Lu, Christopher Clark, Sangho Lee, Zichen Zhang, Savya Khosla, Ryan Marten, Derek Hoiem, Aniruddha Kembhavi
Browse the full CVPR paper archive.
Jiasen Lu, Christopher Clark, Sangho Lee, Zichen Zhang, Savya Khosla, Ryan Marten, Derek Hoiem, Aniruddha Kembhavi
Browse the full CVPR paper archive.