Werkzeug · Dokument-KI & OCR
Docling
von IBM Research (Deep Search)
Wandelt PDF, Office-Dateien und HTML in einen strukturierten Dokumentbaum („DoclingDocument“) statt in flachen Text – mit Seitenlayout, Lesereihenfolge und intakten Tabellen. Die Grundlage für RAG-Aufbauten, die einen Baum statt Textblöcke brauchen.
Einschätzung
Der Parser, der die Struktur zurückgibt
Wofür es gut ist
- Lange, strukturierte Dokumente (Berichte, Verträge, Handbücher) für RAG vorbereiten
- Tabellen und Lesereihenfolge aus PDFs retten, statt sie beim Chunking zu verlieren
- Agenten Zugriff auf Dokumentstruktur geben statt auf Textfragmente
Stärken
- Ein Ausgabeformat (`DoclingDocument`) über viele Eingabeformate hinweg
- Lesereihenfolge, Überschriften-Hierarchie und Tabellenstruktur bleiben erhalten
- MIT-Lizenz, lokal betreibbar, Anbindung an die gängigen RAG-Frameworks und an MCP
Schwächen
- Die Qualität des Baums entscheidet alles – schlecht gesetzte PDFs bleiben schwierig
- `docling-agent` ist laut Projekt „still immature and work-in-progress“
- Strukturnavigation kostet mehr Modellaufrufe und Latenz als eine Vektorsuche
Im Vergleich
Wofür dieses Werkzeug die bessere Wahl ist – und wann ein direkter Konkurrent.
Gegenüber Mistral OCR 4 ist Docling kein Erkennungs-Dienst, sondern eine lokal laufende Struktur-Rekonstruktion: kein API-Vertrag, dafür Verantwortung für den eigenen Betrieb. Gegenüber einer klassischen Chunking-Pipeline verschiebt sich der Aufwand von der Einbettung zur Vorverarbeitung – und vom Suchindex zum Navigieren zur Abfragezeit.
Direkt ausprobieren
github.com/docling-project/docling
ℹ️