2025
SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion
ICCV 2025poster
We introduce SmolDocling, an ultra-compact vision-language model targeting end-to-end document conversion. Our model comprehensively processes entire pages by generating DocTags, a new universal markup format that captures all page elements in their full context with location. Unlike existing approa…