SmolDocling: An Ultra-Compact Vision-Language Model for End-To-End Multi-Modal Document Conversion.
Ahmed S. Nassar, Matteo Omenetti, Maksym Lysak, Nikolaos Livathinos, Christoph Auer, Lucas Morin, Rafael Teixeira de Lima, Yusik Kim, A. Said Gurbuz, Michele Dolfi, Peter W. J. Staar
Browse the full ICCV paper archive.