MAPS: Joint Multimodal Attention and POS Sequence Generation for Video Captioning.
Cong Zou, Xuchen Wang, Yaosi Hu, Zhenzhong Chen, Shan Liu
Browse the full VCIP paper archive.
Cong Zou, Xuchen Wang, Yaosi Hu, Zhenzhong Chen, Shan Liu
Browse the full VCIP paper archive.