VideoGLaMM : A Large Multimodal Model for Pixel-Level Visual Grounding in Videos.
Shehan Munasinghe, Hanan Gani, Wenqi Zhu, Jiale Cao, Eric P. Xing, Fahad Shahbaz Khan, Salman H. Khan
Browse the full CVPR paper archive.
Shehan Munasinghe, Hanan Gani, Wenqi Zhu, Jiale Cao, Eric P. Xing, Fahad Shahbaz Khan, Salman H. Khan
Browse the full CVPR paper archive.