Skip to content

Marten: Visual Question Answering with Mask Generation for Multi-modal Document Understanding.

Zining Wang, Tongkun Guan, Pei Fu, Chen Duan, Qianyi Jiang, Zhentao Guo, Shan Guo, Junfeng Luo, Wei Shen, Xiaokang Yang

VenueA*CVPR
Year2025
ProceedingsCVPR

Browse the full CVPR paper archive.