Enhancing Multimodal Information Extraction from Visually Rich Documents with 2D Positional Embeddings.
Aresha Arshad, Momina Moetesum, Adnan Ul-Hasan, Faisal Shafait
Browse the full DICTA paper archive.
Aresha Arshad, Momina Moetesum, Adnan Ul-Hasan, Faisal Shafait
Browse the full DICTA paper archive.