Marten: Visual Question Answering with Mask Generation for Multi-modal Document Understanding.
Zining Wang, Tongkun Guan, Pei Fu, Chen Duan, Qianyi Jiang, Zhentao Guo, Shan Guo, Junfeng Luo, Wei Shen, Xiaokang Yang
Browse the full CVPR paper archive.