Sharper and Faster mean Better: Towards More Efficient Vision-Language Model for Hour-scale Long Video Understanding.
Daoze Zhang, Yuze Zhao, Jintao Huang, Yingda Chen
Browse the full ACL paper archive.
Daoze Zhang, Yuze Zhao, Jintao Huang, Yingda Chen
Browse the full ACL paper archive.