MAD: A Scalable Dataset for Language Grounding in Videos from Movie Audio Descriptions.
Mattia Soldan, Alejandro Pardo, Juan Len Alczar, Fabian Caba Heilbron, Chen Zhao, Silvio Giancola, Bernard Ghanem
Browse the full CVPR paper archive.
Mattia Soldan, Alejandro Pardo, Juan Len Alczar, Fabian Caba Heilbron, Chen Zhao, Silvio Giancola, Bernard Ghanem
Browse the full CVPR paper archive.