← Alle Modelle

xAI · Grok

Grok 4.5

grok-4.5

proprietärModell, das nur über die API oder das Produkt des Anbieters nutzbar ist; die Gewichte werden nicht veröffentlicht. Gegenstück zu open-weight.Mehr im Wissen →TextBild (Eingabe)

Eingeschränkt verfügbarseit 2026-07-08Bei Release über Grok Build, xAI-Konsole und API verfügbar, für EU-Nutzer aber zunächst nicht in der API-Konsole freigeschaltet – laut Anbieter ist die EU-Verfügbarkeit „später im Monat“ (Juli 2026) vorgesehen.

ÜberholtVom eigenen Nachfolger verdrängt

Beim Coding weiterhin in der proprietären Spitzengruppe (AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 72 – gleichauf mit Sonnet 5, knapp hinter Opus 4.8/GPT-5.5). Seit dem 12. August 2026 gibt es aber Grok 4.6 zum identischen Preis, mit identischem Kontextfenster und einem um fünf Punkte höheren AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → – für neue Vorhaben gibt es damit kaum noch einen Grund, Grok 4.5 zu wählen.

  • bestehende Integrationen auf grok-4.5
  • anspruchsvolles Coding
  • STEM- & Wissensarbeit

Stärker bei gleichem oder geringerem Preis: Qwen3.8-Flash-Next, Grok 4.6, GLM-5.3-Flash — erreicht alle unabhängigen AA-Indizes ≥ bei niedrigerem TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →.

KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen →
500 KTokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →
Preis (Input / Output)
$2 / $6 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen →
18,7 Indexpkt. je $/Mio. Token
Release
8. Juli 2026

Stärken

  • Coding auf Höhe der proprietären Spitzengruppe (unabhängiger AA Coding Index 72)
  • Hohe TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →-Effizienz (laut Anbieter deutlich weniger Output-Tokens je Aufgabe als vergleichbare Spitzenmodelle)
  • Reasoning-Aufwand über low/medium/high steuerbar; Function-Calling, Web-/X-Suche, Code-Ausführung

Schwächen

  • Proprietär, nur über API/Produkt nutzbar
  • Für EU-Nutzer zunächst nicht über die API-Konsole verfügbar (Freischaltung laut Anbieter „später im Monat“)
  • Kleineres Kontextfenster als der Vorgänger Grok 4.3 (500 K statt 1 Mio.)
  • Tool-Use-Verlässlichkeit (τ²-bench) noch nicht unabhängig gemessen; im AA Agentic Index (46, seit 05.08.2026 gemessen) hinter Opus 5, GPT-5.6 Sol und Fable 5

Typische Einsatzfälle

  • Anspruchsvolles Coding
  • agentische Workflows
  • STEM- & Wissensarbeit

Leistung im Vergleich

Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → oben ist daraus abgeleitet: AA-Intelligenz je AA-Blended-Preis (3:1) – entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis. AAs token-basiertes „Cost to Run Index“ ist nicht öffentlich abrufbar.

  • AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen →56
  • AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen →72
  • AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen →49
  • Terminal-BenchAusführungsbasierter Benchmark (0–100 %): das Modell löst echte Shell-/Terminal-Aufgaben in einer Sandbox, gewertet wird, ob das Ergebnis wirklich funktioniert. Dadurch kontaminationsärmer als reine Wissensquizze.Mehr im Wissen →82

Benchmarks im Detail

Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →

  • Artificial Analysis Intelligence Index (v4.1)

    55,8

    (high) – vor der Neueichung 54, gemessen am 09.07.2026

    unabhängigArtificial Analysis (API v2), abgerufen 2026-08-25

  • Artificial Analysis Coding Index

    72,4

    (high)

    unabhängigArtificial Analysis (API v2), abgerufen 2026-08-25

  • Artificial Analysis Agentic Index

    48,9

    (high) – vor der Neueichung 46, gemessen am 05.08.2026

    unabhängigArtificial Analysis (API v2), abgerufen 2026-08-25

  • Kosten je Index-Aufgabe (AA, Token-Verbrauch bei festem Listenpreis)

    0,3601

    $ (high) – gegen 0,8367 $ beim Nachfolger Grok 4.6 zum identischen Token-Preis

    unabhängigArtificial Analysis (API v2), abgerufen 2026-08-25

  • Terminal-Bench (agentische Shell-Aufgaben, v2.1)

    82 %

    unabhängigArtificial Analysis (API), abgerufen 2026-07-09

  • SWE-Bench Pro (Coding)

    64,7 %

    (Anbieterangabe)

    AnbieterangabexAI-Ankündigung, zitiert nach roo.beehiiv 2026-07-08

Einordnung

  • Im AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 72 – erstmals in der proprietären Spitzengruppe: gleichauf mit Sonnet 5 (72), knapp hinter Opus 4.8 (74) und GPT-5.5 (75), klar vor DeepSeek-V4-Pro (59). Gegenüber dem Vorgänger Grok 4.3 (42) ein deutlicher Sprung.Beleg · Sekundärquelle
  • In der Allzweck-Intelligenz nah an der Spitze: AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 54 – knapp hinter Opus 4.8 (56) und GPT-5.5 (55), vor Gemini 3.5 Flash (50). Auf dem agentischen Terminal-Bench 2.1 82 %, nahe an Opus 4.8 (85).Beleg · Sekundärquelle
  • Zugang: Bei Release für EU-Nutzer nicht über die API-Konsole freigegeben – die Freischaltung ist laut Anbieter „später im Monat“ (Juli 2026) vorgesehen. Für ein deutschsprachiges Publikum damit vorerst nur eingeschränkt nutzbar.Beleg · Primärquelle
  • Nachfolger seit dem 12. August 2026: Grok 4.6 kostet dasselbe (2 $/6 $ je 1 Mio. TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →), hat dasselbe 500-K-Kontextfenster und dieselben Modalitäten, erreicht bei Artificial Analysis aber 61 statt 56 Punkte und bietet zusätzlich die Aufwandsstufe „xhigh“. Ein Nachteil des Neuen: 31,18 s bis zum ersten Token gegenüber 8,68 s bei Grok 4.5. Ein EU-Vorbehalt wie beim Start von Grok 4.5 steht in der Dokumentation zu Grok 4.6 nicht.Beleg · Primärquelle

ℹ️ xAI firmiert seit 2026 als SpaceXAI. Grok 4.5 (Modell-ID grok-4.5) wurde laut Anbieter gemeinsam mit der Coding-Plattform Cursor trainiert; Architektur und Parameterzahl legt xAI nicht offen. Kontextfenster 500 K TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen → (Tier B: OpenRouter/xAI-Modell-Detailseite), Preis 2 $/6 $ je 1 Mio. Token (Tier A). Anbieter-berichtete Coding-Werte (Terminal-Bench 2.1 83,3 %, SWE-Bench Pro 64,7 %, DeepSWE) liegen leicht über der unabhängigen AA-Messung und sind cherrypicking-anfällig. τ²-bench für Grok 4.5 ist noch nicht gemessen (Nachtrag über den Verifikations-Loop). ⚠️ Stand 13.08.2026: SpaceXAI hat am 12.08.2026 den Nachfolger Grok 4.6 veröffentlicht – gleicher Preis (2 $/6 $), gleiches Kontextfenster (500 K), gleiche Modalitäten, zusätzliche Aufwandsstufe „xhigh“, bei Artificial Analysis 61 Punkte im Intelligence Index. ✅ Erledigt am 25.08.2026: Grok 4.6 ist jetzt als eigener Katalog-Eintrag geführt (`grok-4-6`). Die Aufnahme war zurückgestellt, weil die AA-Modellseiten am 13.08.2026 katalogweit rund zwei Punkte über unserem Stand vom 05.08.2026 lagen (Opus 5 dort 63 gegen 61 bei uns, GPT-5.6 Sol 61 gegen 59, Grok 4.5 selbst 56 gegen 54) und aus den Seiten allein nicht zu entscheiden war, ob Neueichung oder andere Aufwandsstufe. Der `verify-bench`-Lauf vom 21.08.2026 hat es als Neueichung auf Index-Version 4.1 ausgewiesen und alle Kennzahlen katalogweit nachgezogen – seither steht hier 56 statt 54. Der Kontroll-Lauf vom 25.08.2026 bestätigt die Stabilität (Index-Version unverändert 4.1). Die `benchmarks`-Einzelwerte unten sind am 25.08.2026 auf denselben v4.1-Abruf gezogen worden, damit sie nicht länger den vor-Neueichungs-Stand gegen die aktuellen `kennzahlen` stellen.