Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models.
Yuxiao Chen, Jue Wang, Zhikang Zhang, Jingru Yi, Xu Zhang, Yang Zou, Zhaowei Cai, Jianbo Yuan, Xinyu Li, Hao Yang, Davide Modolo
Browse the full WACV paper archive.