TrafficVILA: Scaling Vision-Language Models to High-Resolution Video Understanding for Traffic Safety Analysis.
Zaid Pervaiz Bhat, Seunghwan Cha, Rohan Gulati, Monika Jhuria, Varun Praveen, Tomasz Kornuta, Yao Lu, Vidya N. Murali
Browse the full ICCV paper archive.