← Alle Werkzeuge

Werkzeug · Dokument-KI & OCR

PDF Inspector

von Firecrawl

Quelloffener Rust-Parser, der PDFs zuerst einsortiert und nur den echten Text herauszieht – ohne OCR, ohne GPU, unter 200 Millisekunden je Dokument, wahlweise komplett im Browser.

Open SourceOpen SourceCLIPythonNode.jsBrowser (WASM)

Einschätzung

Schnelle Vorsortierung statt teurer Rundum-Extraktion

Die naheliegende Wahl, wenn viele PDFs durch eine Pipeline müssen und die meisten davon ohnehin schon Text enthalten – die Klassifikation vorweg spart den teuren OCR-Pfad, und die WASM-Fassung hält vertrauliche Dateien im Browser. Wer Gescanntes, Handschrift oder Formeln verlässlich braucht, ist damit allein nicht bedient: PDF Inspector kann bewusst kein OCR und ist dann nur die Weiche vor einem echten Dokumentmodell.

PDF Inspector dreht die übliche Reihenfolge um: Statt jedes PDF durch ein Layout-Modell und OCR zu schicken, prüft es zuerst in etwa 10 bis 50 Millisekunden anhand von Font-Kodierungen, Text-Operatoren und Bildanteil, womit es zu tun hat – textbasiert, gescannt, bildbasiert oder gemischt, jeweils mit Konfidenzwert. Nur was wirklich gescannt ist, braucht danach den teuren Weg; textbasierte Dokumente werden nativ ausgelesen, in unter 200 Millisekunden und ganz ohne GPU.

Herausgegeben wird positionsbewusstes Markdown mit Schriftinformationen und Koordinaten: Überschriften, Listen, Tabellen (über Rechteck-Erkennung und Heuristik), Code-Blöcke und Links, dazu Mehrspalten-Layouts in korrekter Lesereihenfolge. Gedacht ist das als Ingest-Baustein für RAG-, Such- und Agenten-Pipelines. Es gibt Bindings für CLI (`pdf2md`, `detect-pdf`), Python, Node.js/Bun – und, für vertrauliche Dokumente der interessante Teil, eine WebAssembly-Fassung, die vollständig im Browser läuft, ohne dass die Datei je einen Server sieht.

Firecrawl hat den Parser am 14. April 2026 zusammen mit seiner PDF-Engine Fire-PDF unter MIT-Lizenz quelloffen gestellt; innerhalb des eigenen Produkts ist er die Klassifikations-Stufe. In Firecrawls eigenem Vergleich auf 200 PDFs des OpenDataLoader-Korpus erreicht PDF Inspector 0,875 Gesamtpunkte in 2,8 Sekunden Laufzeit – vor LiteParse (0,870 / 13,9 s), OpenDataLoader (0,843 / 9,8 s), PyMuPDF4LLM (0,735 / 15,5 s) und MarkItDown (0,583 / 6,7 s). Der deutlichste Abstand liegt bei Tabellen (0,814 gegenüber 0,693, 0,489, 0,401 und 0,000).

Wofür es gut ist

  • PDFs für RAG-/Agenten-Pipelines in sauberes, positionsbewusstes Markdown überführen
  • Vorab entscheiden, welche Seiten überhaupt OCR brauchen – und den Rest ohne GPU verarbeiten
  • Vertrauliche Dokumente vollständig im Browser verarbeiten, ohne Server-Roundtrip

Stärken

  • Klassifikation in 10–50 ms; textbasierte PDFs unter 200 ms komplett ohne GPU
  • Läuft vollständig im Browser (WebAssembly) – die Datei verlässt den Rechner nicht
  • Positionsbewusstes Markdown inklusive Tabellen und Mehrspalten-Lesereihenfolge
  • Quelloffen (MIT), reines Rust mit wenigen Abhängigkeiten; Bindings für CLI, Python, Node/Bun
  • Im Anbieter-Vergleich zugleich der beste und der mit Abstand schnellste Wert (2,8 s gegen 6,7–15,5 s)

Schwächen

  • Kein OCR: gescannte und bildbasierte Seiten werden erkannt, aber nicht gelesen – dafür braucht es ein nachgelagertes Modell
  • Die Benchmark-Tabelle ist Firecrawls eigene Messung auf einem selbst gewählten Korpus; unabhängige Replikation steht aus
  • Junges Projekt in aktiver Entwicklung (Stand 0.2.6) – Schnittstellen können sich noch ändern
  • Spezialwerkzeug für den Ingest-Schritt, kein Dokument-Assistent

Im Vergleich

Wofür dieses Werkzeug die bessere Wahl ist – und wann ein direkter Konkurrent.

  • Gegenüber Mistral OCR 4 ist der Zuschnitt komplementär statt konkurrierend: Mistral liest auch Scans und Handschrift, kostet pro Seite und läuft als Modell; PDF Inspector kann bewusst kein OCR, ist dafür quelloffen, kostenlos und schnell genug, um vorweg zu entscheiden, welche Seiten den teuren Weg überhaupt gehen müssen. In einer Pipeline stehen beide hintereinander, nicht gegeneinander.

Stimmen aus der Community

Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.

Direkt ausprobieren

github.com/firecrawl/pdf-inspector

Zur offiziellen Seite ↗

ℹ️ Über den YouTube-Sweep vom 03.08.2026 aufgekommen (C47 AI Anytime, Tier C, Destillat `video-korpus/YbkTl8yyYEM.md`). Sämtliche Kennzahlen am Repo (A), an Firecrawls Launch-Beitrag (A) und an der Projekt-Benchmarkseite (A) gegengeprüft, nicht am Video. ⚠️ Zwei Ungenauigkeiten des Videos dokumentiert: Es rahmt das Werkzeug als „newly launched“ – quelloffen ist es seit dem 14.04.2026 – und zeigt Version 0.1, während der Repo-Stand 0.2.6 ist. Die Benchmark-Tabelle ist Firecrawls Eigenmessung.

Verwandte Werkzeuge