Skip to content

SmolDocling: An Ultra-Compact Vision-Language Model for End-To-End Multi-Modal Document Conversion.

Ahmed S. Nassar, Matteo Omenetti, Maksym Lysak, Nikolaos Livathinos, Christoph Auer, Lucas Morin, Rafael Teixeira de Lima, Yusik Kim, A. Said Gurbuz, Michele Dolfi, Peter W. J. Staar

VenueA*ICCV
Year2025
ProceedingsICCV

Browse the full ICCV paper archive.