← Alle Modelle

Anthropic · Claude

Claude Haiku 4.5

claude-haiku-4-5

proprietärModell, das nur über die API oder das Produkt des Anbieters nutzbar ist; die Gewichte werden nicht veröffentlicht. Gegenstück zu open-weight.Mehr im Wissen →TextBild (Eingabe)

SituativSchnell & günstig, aber überholt

Beim reinen Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → von DeepSeek-V4-Pro überholt – das erreicht alle drei AA-Indizes höher und kostet weniger pro TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →. Haiku bleibt sinnvoll, wo niedrige Latenz, ein gemanagter Anbieter oder Bild-Eingabe zählen (die DeepSeek nicht bietet).

  • latenzkritische Antworten
  • Hochvolumen-Klassifikation
  • Aufgaben mit Bild-Eingabe

Stärker bei gleichem oder geringerem Preis: DeepSeek-V4-Pro — erreicht alle unabhängigen AA-Indizes ≥ bei niedrigerem TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →.

KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen →
200 KTokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →
Max. Ausgabe
64 K Token
Preis (Input / Output)
$1 / $5 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen →
15,0 Indexpkt. je $/Mio. Token
WissensstichtagDer Zeitpunkt, bis zu dem die Trainingsdaten eines Modells reichen („knowledge cutoff“). Über spätere Ereignisse weiß das Modell von sich aus nichts – es sei denn, sie werden ihm in der Anfrage mitgegeben.Mehr im Wissen →
Feb 2025
SicherheitsstufeAnbieter-Einstufung des Risikoniveaus eines Modells (z. B. Anthropics ASL-Stufen oder „Cyber: High“). Höhere Stufen lösen strengere Schutzmaßnahmen aus. Stammt aus der System-Card – Eigenangabe des Anbieters.Mehr im Wissen →
ASL-2

Stärken

  • Schnellstes und günstigstes Modell der Reihe
  • Gut für einfache, latenz-/kostensensitive Aufgaben

Schwächen

  • Kleineres KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen → (200 K)
  • Kein effort-Parameter, geringere Thinking / ReasoningModus, in dem ein Modell vor der Antwort sichtbare Zwischenschritte „durchdenkt“. Das hebt die Qualität bei schweren Aufgaben, kostet aber mehr Tokens und Zeit – oft über einen Aufwand-Regler steuerbar.Mehr im Wissen →-Tiefe

Typische Einsatzfälle

  • Klassifikation
  • Hochvolumen-Aufgaben
  • schnelle Antworten

Leistung im Vergleich

Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → oben ist daraus abgeleitet: AA-Intelligenz je AA-Blended-Preis (3:1) – entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis. AAs token-basiertes „Cost to Run Index“ ist nicht öffentlich abrufbar.

  • AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen →30
  • AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen →44
  • AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen →40
  • Terminal-BenchAusführungsbasierter Benchmark (0–100 %): das Modell löst echte Shell-/Terminal-Aufgaben in einer Sandbox, gewertet wird, ob das Ergebnis wirklich funktioniert. Dadurch kontaminationsärmer als reine Wissensquizze.Mehr im Wissen →44
  • τ²-benchBenchmark für die Verlässlichkeit beim Werkzeug-Einsatz: dieselbe Aufgabe wird viele Male wiederholt, gemessen wird, wie konstant das Modell die Tools korrekt bedient (0–100 %).Mehr im Wissen →55
  • Elo (LMArena)Human-Präferenz-Wertung aus der LMArena: Menschen vergleichen blind zwei Modellantworten, daraus entsteht – wie beim Schach – eine Elo-Zahl. Höher = häufiger bevorzugt. Misst Präferenz, nicht Korrektheit.Mehr im Wissen →1411

Benchmarks im Detail

Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →

  • Artificial Analysis Intelligence Index

    30

    unabhängigArtificial Analysis, abgerufen 2026-06-16

  • Artificial Analysis Coding Index

    44

    unabhängigArtificial Analysis Coding Index, abgerufen 2026-07-09

  • Artificial Analysis Agentic Index

    40

    unabhängigArtificial Analysis Agentic Index, abgerufen 2026-06-16

  • LMArena Text Arena (Elo)

    1411

    unabhängigLMArena (arena.ai), Stand 2026-06-10

  • SWE-bench Verified (mini-SWE-agent)

    66,6 %

    unabhängigswebench.com (standardisierter Harness, unabhängig)

  • Terminal-Bench (agentische Shell-Aufgaben)

    44 %

    unabhängigArtificial Analysis (API), abgerufen 2026-06-16

  • τ²-bench (Tool-Use-Verlässlichkeit)

    55 %

    unabhängigArtificial Analysis (API), abgerufen 2026-06-16

Einordnung

  • Schnellstes und günstigstes Claude ($1 / $5); beim Coding klar hinter Opus 4.8/Sonnet 5 (AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 44 vs. 74/72) – ausgelegt auf einfache, latenz-/kostensensitive Hochvolumen-Aufgaben, nicht auf Spitzenleistung.Beleg · Sekundärquelle

Aus der System-Card

Verdichtete Befunde aus der offiziellen System-CardDas offizielle Begleitdokument eines Anbieters zu einem Modell (auch „Model Card“): Fähigkeiten, Grenzen, Sicherheitsbewertung. Primärquelle – die Fähigkeitsangaben darin sind aber Eigenangaben, nicht unabhängig gemessen.Mehr im Wissen → des Anbieters (Primärquelle, Tier (A/B/C)Verlässlichkeits-Stufe einer Quelle in der KI-Depesche: A = Primärquelle (z. B. offizielle Doku), B = solide Sekundärquelle, C = subjektiv/Einzelstimme. Steuert, wie stark eine Aussage gewichtet wird.Mehr im Wissen →). Fähigkeitswerte sind Anbieterangaben – nicht unabhängig nachgemessen.

Fähigkeiten

  • Coding & Computer-UseLaut Anbieter trotz kleiner, schneller Modellklasse große Sprünge bei agentic Coding und Computer-Use – geeignet für viele agentische Einsätze, ausdrücklich aber kein Frontier-Modell.
  • Kontextfenster200-K-Token-Kontext; explizit „context-aware“ trainiert (kennt den verbrauchten Kontext), was laut Card agentische „Laziness“ – vorzeitiges Abbrechen – reduziert.
  • Hybrid-ReasoningErstes Haiku-Modell mit zuschaltbarem „extended thinking“-Modus (Haiku 3.5 hatte keinen).
  • SWE-bench (Autonomie)Laut Anbieter 36,6 % (pass@1) auf dem Hard-Subset von SWE-benchCoding-Benchmark, der Modelle echte GitHub-Issues in realen Repositories lösen lässt; gewertet wird, ob der erzeugte Patch die Tests besteht. Verbreitet, aber zunehmend durch Trainings-Kontamination belastet.Mehr im Wissen → – nahezu gleichauf mit Claude Sonnet 4 (36,7 %), unter der RSP-Autonomie-Schwelle von 50 %.
  • Cyber (CTF)Laut Anbieter 15 von 32 gelösten Cybench-Challenges (Capture-the-Flag), deutlich unter Claude Sonnet 4 (22 von 32).

Verhalten & Sicherheit

  • ASL-StufeUnter dem SicherheitsstufeAnbieter-Einstufung des Risikoniveaus eines Modells (z. B. Anthropics ASL-Stufen oder „Cyber: High“). Höhere Stufen lösen strengere Schutzmaßnahmen aus. Stammt aus der System-Card – Eigenangabe des Anbieters.Mehr im Wissen → (ASL-2) der Responsible Scaling Policy deployt; ASL-3-„rule-out“ bestanden, CBRN-Leistung vergleichbar mit Claude Sonnet 4 und weit unter den Schwellen.
  • Eval-AwarenessHohe verbalisierte Evaluation-Awareness – ~9 % der Transkripte im Haupt-Alignment-Audit zeigen klare Anzeichen, höher als Sonnet 4.5 und über 3-mal höher als Opus 4.1; das schränkt das Vertrauen in die Alignment-Feinvergleiche ein.
  • AlignmentLaut Anbieter „beste Safety-Performance bis dato“ – beim Misaligned-Behavior-Audit minimal besser als Sonnet 4.5; niedrige Werte bei Sycophancy, Self-Preservation und User-Deception.
  • Reward-HackingIm Schnitt 15,5 % Hack-Rate – gleichauf mit Sonnet 4.5 und rund halbiert gegenüber Haiku 3.5 (34 %).
  • Over-RefusalLaut Anbieter 0,02 % Über-Verweigerung bei harmlosen Anfragen (Haiku 3.5: 4,26 %).
  • Prompt-InjectionLaut Anbieter robust für die kleinste Modellklasse – Computer-Use-Abwehr mit Classifier 92,4 %.

Anthropic – System Card: Claude Haiku 4.5 (PDF)· Primärquelle, abgerufen 2026-06-16

Stimmen aus der Öffentlichkeit

Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.

  • gemischtIm Intelligenz-Index nur ein Leichtgewicht, aber im Tool-Calling absolut zuverlässig – verpfuscht nie die Form eines Tool-Calls – und mit der niedrigsten Halluzinationsrate im Vergleich; sagt am schnellsten „weiß ich nicht“. Theos Reliabilitäts-Kontrast zum „benchmaxten“, aber unbrauchbaren Gemini 3.1 Pro: „It does its goddamn job.“Theo – t3.gg (YouTube) · Community