← Alle Werkzeuge

Werkzeug · Dokument-KI & OCR

Docling

von IBM Research (Deep Search)

Wandelt PDF, Office-Dateien und HTML in einen strukturierten Dokumentbaum („DoclingDocument“) statt in flachen Text – mit Seitenlayout, Lesereihenfolge und intakten Tabellen. Die Grundlage für RAG-Aufbauten, die einen Baum statt Textblöcke brauchen.

Open SourcePythonCLIMCPSelf-HostedOpen Source

Einschätzung

Der Parser, der die Struktur zurückgibt

Naheliegend, wenn die Antworten in wenigen langen, gegliederten Dokumenten stecken und Chunking dort Überschriften von Absätzen und Tabellen von ihrer Erläuterung trennt. Für Millionen kurzer Dokumente mit unscharfen Suchanfragen bleibt klassische Ähnlichkeitssuche die günstigere Wahl – und der Agenten-Teil ist erklärtermaßen noch unfertig.

Docling löst das unspektakuläre Problem, an dem RAG-Aufbauten in der Praxis scheitern: Ein PDF ist keine Struktur, sondern eine Anweisung, Zeichen auf eine Seite zu setzen. Docling rekonstruiert daraus wieder ein Dokument – das Repository nennt „advanced PDF understanding incl. page layout, reading order, table structure, code, formulas, image classification“ – und gibt es als `DoclingDocument` aus, ein einheitliches Objekt über alle Eingabeformate hinweg. Unterstützt werden neben PDF unter anderem DOCX, PPTX, XLSX, HTML und EPUB; zuletzt kamen Video-, ODF-, XBRL-, E-Mail- und Klartext-Verarbeitung sowie Diagramm-Verständnis hinzu.

Für den Werkzeugkasten drumherum gibt es eine ganze Familie im selben Projekt: `docling-core` (Datentypen), `docling-serve` (Betrieb als API-Dienst), `docling-mcp` („Making docling agentic through MCP“), `docling-graph` (Dokument → abfragbarer Wissensgraph) und Anbindungen an LangChain, LlamaIndex, CrewAI und Haystack. Alles unter MIT-Lizenz.

Der jüngste Baustein ist `docling-agent` – ein Agent, der nicht sucht, sondern auf der Struktur arbeitet: Berichte aus einer Beschreibung erzeugen und nach JSON/Markdown/HTML ausgeben, gezielte Änderungen an bestehenden Docling-Dokumenten anwenden, typisierte Felder per Schema aus PDFs und Bildern extrahieren und vorhandene Dokumente mit Zusammenfassungen, Suchbegriffen, Entitäten und Klassifikationen anreichern. Das Projekt kennzeichnet den Reifegrad selbst: „This package is still immature and work-in-progress.“

⚠️ Zur Einordnung des Begriffs, unter dem uns das Projekt begegnet ist: „Chunkless RAG“ – also Abrufen durch Navigieren im Dokumentbaum statt durch Ähnlichkeitssuche über Textblöcke – steht weder im Docling-README noch im README des Agenten. Der Begriff zirkuliert im Umfeld (unter anderem beim Drittprojekt Docling Studio) und in einem IBM-Erklärvideo, ist aber keine Projektbezeichnung. Was Docling belegbar liefert, ist die Voraussetzung dafür: den Baum. Die Abruf-Strategie darauf baut man selbst.

Wofür es gut ist

  • Lange, strukturierte Dokumente (Berichte, Verträge, Handbücher) für RAG vorbereiten
  • Tabellen und Lesereihenfolge aus PDFs retten, statt sie beim Chunking zu verlieren
  • Agenten Zugriff auf Dokumentstruktur geben statt auf Textfragmente

Stärken

  • Ein Ausgabeformat (`DoclingDocument`) über viele Eingabeformate hinweg
  • Lesereihenfolge, Überschriften-Hierarchie und Tabellenstruktur bleiben erhalten
  • MIT-Lizenz, lokal betreibbar, Anbindung an die gängigen RAG-Frameworks und an MCP

Schwächen

  • Die Qualität des Baums entscheidet alles – schlecht gesetzte PDFs bleiben schwierig
  • `docling-agent` ist laut Projekt „still immature and work-in-progress“
  • Strukturnavigation kostet mehr Modellaufrufe und Latenz als eine Vektorsuche

Im Vergleich

Wofür dieses Werkzeug die bessere Wahl ist – und wann ein direkter Konkurrent.

  • Gegenüber Mistral OCR 4 ist Docling kein Erkennungs-Dienst, sondern eine lokal laufende Struktur-Rekonstruktion: kein API-Vertrag, dafür Verantwortung für den eigenen Betrieb.
  • Gegenüber einer klassischen Chunking-Pipeline verschiebt sich der Aufwand von der Einbettung zur Vorverarbeitung – und vom Suchindex zum Navigieren zur Abfragezeit.

Direkt ausprobieren

github.com/docling-project/docling

Zur offiziellen Seite ↗

ℹ️ Über den YouTube-Sweep am 10.08.2026 als Katalog-Lücke aufgefallen (IBM Technology, `video-korpus/vRZNJWw78BQ.md`). ⚠️ Sämtliche Angaben dieses Eintrags stammen aus den Projekt-Repositories (A); das Video ist Anbieter-Eigenwerbung – IBM erklärt darin ein IBM-Projekt, ohne die Herkunft zu benennen – und trägt hier keine Aussage. Nicht geprüft: Nutzungszahlen, Genauigkeit der Tabellenerkennung, Versionsstände.

Verwandte Werkzeuge