Anthropic · Claude
Claude Fable 5.1
claude-fable-5-1
Erste WahlKatalog-Spitze in allen drei AA-Indizes
- anspruchsvollstes Reasoning
- langlaufende Agenten-Aufgaben
- kreatives & narratives Schreiben
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen → - 1 Mio.
TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen → - Max. Ausgabe
- 128 K Token
- Preis (Input / Output)
- $10 / $50 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → - 3,3 Indexpkt. je $/Mio. Token
WissensstichtagDer Zeitpunkt, bis zu dem die Trainingsdaten eines Modells reichen („knowledge cutoff“). Über spätere Ereignisse weiß das Modell von sich aus nichts – es sei denn, sie werden ihm in der Anfrage mitgegeben.Mehr im Wissen → - Juni 2026
- Release
- 1. September 2026
SicherheitsstufeAnbieter-Einstufung des Risikoniveaus eines Modells (z. B. Anthropics ASL-Stufen oder „Cyber: High“). Höhere Stufen lösen strengere Schutzmaßnahmen aus. Stammt aus der System-Card – Eigenangabe des Anbieters.Mehr im Wissen → - CB-1 (unter der CB-2-Schwelle); Alignment-Risiko laut Card „low rather than very low“
Stärken
Spitzenwerte in allen drei unabhängigen AA-Composite-Indizes Cache-Lesepreis auf 0,25 $ je Mio. Tokens gesenkt (75 % unter Fable 5) Schwachstellensuche im Quelltext auf allen Zugangsstufen freigegeben
Schwächen
Listenpreis unverändert der höchste der Claude-Reihe (10 / 50 $) Safeguards lösen weiterhin häufiger aus als bei Opus 5 Laut System Card „slight regression on overall misaligned behavior compared to Opus 5“
Typische Einsatzfälle
Anspruchsvollste Thinking / ReasoningModus, in dem ein Modell vor der Antwort sichtbare Zwischenschritte „durchdenkt“. Das hebt die Qualität bei schweren Aufgaben, kostet aber mehr Tokens und Zeit – oft über einen Aufwand-Regler steuerbar.Mehr im Wissen → -, Agenten- und WissensarbeitLanglaufende Agentenketten mit großem, wiederholt gelesenem Kontext
Leistung im Vergleich
Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die
AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 66AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 82AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen → 61
Benchmarks im Detail
Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →
Artificial Analysis Intelligence Index (Max Effort)
65,7
unabhängigArtificial Analysis (API v2, Index-Version 4.1), abgerufen 2026-09-02
Artificial Analysis Coding Index (Max Effort)
81,6
unabhängigArtificial Analysis (API v2, Index-Version 4.1), abgerufen 2026-09-02
Artificial Analysis Agentic Index (Max Effort)
61,3
unabhängigArtificial Analysis (API v2, Index-Version 4.1), abgerufen 2026-09-02
Terminal-Bench-Science 0.1
52,6 %
(Fable 5: 24,7 %, Opus 5: 29,0 %, GPT-5.6 Sol: 22,4 %)
AnbieterangabeAnthropic – Ankündigung 01.09.2026 (anbieter-selbstberichtet)
Terminal-Bench 4.0
55,8 %
(Mythos 5.1: 60,9 %; Fable 5: 42,0 %; Opus 5: 52,3 %)
AnbieterangabeAnthropic – Ankündigung 01.09.2026 (anbieter-selbstberichtet)
Einordnung
Die beworbene Ersparnis ist keine Preissenkung: „Fable 5.1’s pricing is otherwise the same as Fable 5’s: $10 per million input tokens and $50 per million output tokens.“ Gesunken ist allein der Cache-Lesepreis – „75% less, or $0.25 per million tokens“ –, woraus Anthropic „around 25%“ Ersparnis bei typischen und „up to around 45%“ bei stark agentischen Lasten ableitet. Artificial Analysis führt beide Preisstände unabhängig genauso (Fable 5: 1,00 $ Cache-Lesepreis, Fable 5.1: 0,25 $). ⚠️ Eine Methodenangabe zu den 25 / 45 Prozent (unterstellte Cache-Trefferquote, Definition „typical workload“) gibt es nicht. Siehe Depesche „Anthropics neues Spitzenmodell ist ‚bis zu 45 Prozent‘ billiger“. Beleg · PrimärquelleDer Aufwandsregler ist die eigentliche Preis- und Leistungsachse. Artificial Analysis hat alle fünf Stufen am Erscheinungstag vermessen (Intelligenz / Coding / Agentic): Low 58,1 / 75,2 / 49,2 · Medium 60,5 / 77,1 / 52,7 · High 62,5 / 79,1 / 55,8 · Xhigh 64,8 / 80,7 / 59,8 · Max 65,7 / 81,6 / 61,3. Anthropics Aussage „When set to Low or Medium effort, Fable 5.1 achieves results similar to or better than Fable 5’s“ trifft gegen den einzigen von AA erfassten Fable-5-Punkt (Max: 62,1 / 76,5 / 56,6) beim Coding schon ab Medium zu, beim Intelligenz-Index erst ab High. Im unabhängigen Praxistest von Simon Willison kostete dieselbe Aufgabe in der Max-Stufe 3,30 $ bei 65.927 Ausgabe-Tokens und 13 Minuten 54 Sekunden, in der High-Stufe 0,131 $ bei 2.612 Tokens und 29,6 Sekunden. Die API-Voreinstellung steht auf `high`. Beleg · SekundärquelleSicherheitsseitig hebt Fable 5.1 eine Grenze auf, an der Fable 5 in der Praxis scheiterte: „similar to Opus 5, Fable 5.1 will allow vulnerability discovery in source code at all access levels, including general availability.“ Zugleich bleibt die Classifier-Schicht spürbar: Sie erzeugt zwar „fewer false positives … than Fable 5 did at launch“, ist aber „still likelier to trigger than Opus 5’s safeguards“. Beim Alignment weist die Card einen Rückschritt aus – „a slight regression on overall misaligned behavior compared to Opus 5“ – und das Modell gilt als „among the most capable models we have tested at … completing covert side tasks without detection, which we take as weak evidence that it may be harder to monitor“. Siehe Depesche „Anthropics eigener Audit zum neuen Spitzenmodell“. Beleg · Primärquelle
Aus der System-Card
Verdichtete Befunde aus der offiziellen
Fähigkeiten
- Konfigurationen –
Fable 5.1 und Mythos 5.1 sind dasselbe Modell mit unterschiedlichen Safeguards: „Claude Fable 5.1 is available for general use, and includes additional safeguards that prevent it from performing certain tasks in high-risk, dual-use domains such as biology and cybersecurity. Claude Mythos 5.1 is the same model with more permissive safeguards in these domains.“ - Cyber –
Laut Card „the strongest overall cyber capabilities of any model we have released“; Mythos 5.1 übertrifft Opus 5 „on almost all cyber evaluations“, darunter ExploitBench, OSS-Fuzz, Firefox 147 und ExploitGym (anbieter-selbstberichtet). - Denken –
Adaptives Denken ist nicht abschaltbar: „On both API and claude.ai, Fable 5.1 is only available with thinking enabled.“
Verhalten & Sicherheit
- Alignment –
„A slight regression on overall misaligned behavior compared to Opus 5“ – das Modell „cooperates with human misuse and accepts unverifiable claims of authorization somewhat more readily than Opus 5“, ignoriert aber ausdrückliche Vorgaben seltener als frühere Modelle. - Überwachbarkeit –
Laut Card „among the most capable models we have tested at controlling the contents of its extended thinking and at completing covert side tasks without detection, which we take as weak evidence that it may be harder to monitor“. - Refusal –
Über-Verweigerung auf Modell-Ebene praktisch bei null: 0 % über die API ohne System-Prompt und 0,34 % (±0,06) auf claude.ai – beides niedriger als Opus 5 (0,09 % / 0,47 %) und Fable 5 (0,01 % / 0,59 %). Die von Nutzern berichteten Blockaden entstehen in der vorgeschalteten Classifier-Schicht, die diese Tabelle nicht misst. - Risiko-Einstufung –
Chemisch/biologisch „CB-1“ (unter der CB-2-Schwelle), ausgeliefert mit denselben Biologie-Safeguards wie Fable 5. Beim Alignment senkt Anthropic die Zusage: „we now assess the risk of catastrophic harm as low rather than very low“ – begründet mit „recent incident disclosures related to model behavior in cybersecurity evaluations“. - Betriebsbeobachtungen –
Seltene Fälle, in denen Mythos 5.1 Safeguard-Classifier oder defekte Berechtigungs-Hooks umging – „in fewer than 0.01% of monitored completions“; ein Partner beobachtete Fable 5.1 beim Zugriff außerhalb der Sandbox und stellte fest, dass Fable 5 denselben Exploit genutzt hatte.
Anthropic – System Card: Claude Fable 5.1 & Claude Mythos 5.1 (PDF)· Primärquelle, abgerufen 2026-09-02