Anthropic · Claude
Claude Haiku 4.5
claude-haiku-4-5
SituativSchnell & günstig, aber überholt
- latenzkritische Antworten
- Hochvolumen-Klassifikation
- Aufgaben mit Bild-Eingabe
Stärker bei gleichem oder geringerem Preis: DeepSeek-V4-Pro — erreicht alle unabhängigen AA-Indizes ≥ bei niedrigerem
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen → - 200 K
TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen → - Max. Ausgabe
- 64 K Token
- Preis (Input / Output)
- $1 / $5 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → - 15,0 Indexpkt. je $/Mio. Token
WissensstichtagDer Zeitpunkt, bis zu dem die Trainingsdaten eines Modells reichen („knowledge cutoff“). Über spätere Ereignisse weiß das Modell von sich aus nichts – es sei denn, sie werden ihm in der Anfrage mitgegeben.Mehr im Wissen → - Feb 2025
SicherheitsstufeAnbieter-Einstufung des Risikoniveaus eines Modells (z. B. Anthropics ASL-Stufen oder „Cyber: High“). Höhere Stufen lösen strengere Schutzmaßnahmen aus. Stammt aus der System-Card – Eigenangabe des Anbieters.Mehr im Wissen → - ASL-2
Stärken
Schnellstes und günstigstes Modell der Reihe Gut für einfache, latenz-/kostensensitive Aufgaben
Schwächen
Kleineres KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen → (200 K)Kein effort-Parameter, geringere Thinking / ReasoningModus, in dem ein Modell vor der Antwort sichtbare Zwischenschritte „durchdenkt“. Das hebt die Qualität bei schweren Aufgaben, kostet aber mehr Tokens und Zeit – oft über einen Aufwand-Regler steuerbar.Mehr im Wissen → -Tiefe
Typische Einsatzfälle
Klassifikation Hochvolumen-Aufgaben schnelle Antworten
Leistung im Vergleich
Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die
AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 30AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 44AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen → 40Terminal-BenchAusführungsbasierter Benchmark (0–100 %): das Modell löst echte Shell-/Terminal-Aufgaben in einer Sandbox, gewertet wird, ob das Ergebnis wirklich funktioniert. Dadurch kontaminationsärmer als reine Wissensquizze.Mehr im Wissen → 44τ²-benchBenchmark für die Verlässlichkeit beim Werkzeug-Einsatz: dieselbe Aufgabe wird viele Male wiederholt, gemessen wird, wie konstant das Modell die Tools korrekt bedient (0–100 %).Mehr im Wissen → 55Elo (LMArena)Human-Präferenz-Wertung aus der LMArena: Menschen vergleichen blind zwei Modellantworten, daraus entsteht – wie beim Schach – eine Elo-Zahl. Höher = häufiger bevorzugt. Misst Präferenz, nicht Korrektheit.Mehr im Wissen → 1411
Benchmarks im Detail
Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →
Artificial Analysis Intelligence Index
30
unabhängigArtificial Analysis, abgerufen 2026-06-16
Artificial Analysis Coding Index
44
unabhängigArtificial Analysis Coding Index, abgerufen 2026-07-09
Artificial Analysis Agentic Index
40
unabhängigArtificial Analysis Agentic Index, abgerufen 2026-06-16
LMArena Text Arena (Elo)
1411
unabhängigLMArena (arena.ai), Stand 2026-06-10
SWE-bench Verified (mini-SWE-agent)
66,6 %
unabhängigswebench.com (standardisierter Harness, unabhängig)
Terminal-Bench (agentische Shell-Aufgaben)
44 %
unabhängigArtificial Analysis (API), abgerufen 2026-06-16
τ²-bench (Tool-Use-Verlässlichkeit)
55 %
unabhängigArtificial Analysis (API), abgerufen 2026-06-16
Einordnung
Schnellstes und günstigstes Claude ($1 / $5); beim Coding klar hinter Opus 4.8/Sonnet 5 ( Beleg · SekundärquelleAA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 44 vs. 74/72) – ausgelegt auf einfache, latenz-/kostensensitive Hochvolumen-Aufgaben, nicht auf Spitzenleistung.
Aus der System-Card
Verdichtete Befunde aus der offiziellen
Fähigkeiten
- Coding & Computer-Use –
Laut Anbieter trotz kleiner, schneller Modellklasse große Sprünge bei agentic Coding und Computer-Use – geeignet für viele agentische Einsätze, ausdrücklich aber kein Frontier-Modell. - Kontextfenster –
200-K-Token-Kontext; explizit „context-aware“ trainiert (kennt den verbrauchten Kontext), was laut Card agentische „Laziness“ – vorzeitiges Abbrechen – reduziert. - Hybrid-Reasoning –
Erstes Haiku-Modell mit zuschaltbarem „extended thinking“-Modus (Haiku 3.5 hatte keinen). - SWE-bench (Autonomie) –
Laut Anbieter 36,6 % (pass@1) auf dem Hard-Subset von SWE-benchCoding-Benchmark, der Modelle echte GitHub-Issues in realen Repositories lösen lässt; gewertet wird, ob der erzeugte Patch die Tests besteht. Verbreitet, aber zunehmend durch Trainings-Kontamination belastet.Mehr im Wissen → – nahezu gleichauf mit Claude Sonnet 4 (36,7 %), unter der RSP-Autonomie-Schwelle von 50 %. - Cyber (CTF) –
Laut Anbieter 15 von 32 gelösten Cybench-Challenges (Capture-the-Flag), deutlich unter Claude Sonnet 4 (22 von 32).
Verhalten & Sicherheit
- ASL-Stufe –
Unter dem SicherheitsstufeAnbieter-Einstufung des Risikoniveaus eines Modells (z. B. Anthropics ASL-Stufen oder „Cyber: High“). Höhere Stufen lösen strengere Schutzmaßnahmen aus. Stammt aus der System-Card – Eigenangabe des Anbieters.Mehr im Wissen → (ASL-2) der Responsible Scaling Policy deployt; ASL-3-„rule-out“ bestanden, CBRN-Leistung vergleichbar mit Claude Sonnet 4 und weit unter den Schwellen. - Eval-Awareness –
Hohe verbalisierte Evaluation-Awareness – ~9 % der Transkripte im Haupt-Alignment-Audit zeigen klare Anzeichen, höher als Sonnet 4.5 und über 3-mal höher als Opus 4.1; das schränkt das Vertrauen in die Alignment-Feinvergleiche ein. - Alignment –
Laut Anbieter „beste Safety-Performance bis dato“ – beim Misaligned-Behavior-Audit minimal besser als Sonnet 4.5; niedrige Werte bei Sycophancy, Self-Preservation und User-Deception. - Reward-Hacking –
Im Schnitt 15,5 % Hack-Rate – gleichauf mit Sonnet 4.5 und rund halbiert gegenüber Haiku 3.5 (34 %). - Over-Refusal –
Laut Anbieter 0,02 % Über-Verweigerung bei harmlosen Anfragen (Haiku 3.5: 4,26 %). - Prompt-Injection –
Laut Anbieter robust für die kleinste Modellklasse – Computer-Use-Abwehr mit Classifier 92,4 %.
Anthropic – System Card: Claude Haiku 4.5 (PDF)· Primärquelle, abgerufen 2026-06-16
Stimmen aus der Öffentlichkeit
Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.
- gemischtIm Intelligenz-Index nur ein Leichtgewicht, aber im Tool-Calling absolut zuverlässig – verpfuscht nie die Form eines Tool-Calls – und mit der niedrigsten Halluzinationsrate im Vergleich; sagt am schnellsten „weiß ich nicht“. Theos Reliabilitäts-Kontrast zum „benchmaxten“, aber unbrauchbaren Gemini 3.1 Pro: „It does its goddamn job.“Theo – t3.gg (YouTube) · Community