Skip to content

VideoGLaMM : A Large Multimodal Model for Pixel-Level Visual Grounding in Videos.

Shehan Munasinghe, Hanan Gani, Wenqi Zhu, Jiale Cao, Eric P. Xing, Fahad Shahbaz Khan, Salman H. Khan

VenueA*CVPR
Year2025
ProceedingsCVPR

Browse the full CVPR paper archive.