← Alle Modelle

xAI · Grok

Grok 4.6

grok-4.6

proprietärModell, das nur über die API oder das Produkt des Anbieters nutzbar ist; die Gewichte werden nicht veröffentlicht. Gegenstück zu open-weight.Mehr im Wissen →TextBild (Eingabe)

Erste WahlSpitzengruppe zum günstigsten Preis – bezahlt mit Denkzeit

Erreicht im AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 61 und damit denselben Wert wie GPT-5.6 Sol, bei einem Listenpreis von 2 $/6 $ statt 4 $/20 $ je 1 Mio. TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →. Im AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen → 59 – gleichauf mit Claude Opus 5 und der höchste Wert unseres Katalogs. Der Haken steht in derselben Messung: Gegenüber dem Vorgänger Grok 4.5 verdoppeln sich die Kosten je Aufgabe (0,36 → 0,84 $) und die Zeit bis zum ersten Token vervierfacht sich – der Zugewinn ist erkauft, nicht geschenkt. Für Latenz-kritische Anwendungen bleibt die Stufe „low“ oder der Vorgänger die bessere Wahl.

  • anspruchsvolles Coding
  • agentische Workflows
  • kostenbewusste Spitzenleistung
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen →
500 KTokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →
Preis (Input / Output)
$2 / $6 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen →
20,3 Indexpkt. je $/Mio. Token
Release
12. August 2026

Stärken

  • Bestes Preis-Leistungs-Verhältnis der Spitzengruppe: 0,84 $ je Index-Aufgabe gegen 0,96 $ (GPT-5.6 Sol), 2,34 $ (Opus 5) und 3,14 $ (Fable 5) – bei gleichem oder nur zwei Punkte niedrigerem Indexwert
  • AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen → 59 – gleichauf mit Claude Opus 5 an der Spitze unseres Katalogs, ein Sprung von zehn Punkten gegenüber Grok 4.5 (49)
  • Deutlich schneller beim ersten Token als die direkte Vergleichsklasse (43,66 s gegen 158,27 s bei GPT-5.6 Sol)
  • Reasoning-Aufwand über vier Stufen steuerbar (low/medium/high/xhigh); „low“ liefert 52 Indexpunkte für 0,22 $ je Aufgabe

Schwächen

  • Token-Effizienz gegenüber dem Vorgänger halbiert: 0,84 statt 0,36 US-Dollar je Index-Aufgabe bei identischem Listenpreis – der Zugewinn wird über längeres Nachdenken erkauft
  • Zeit bis zum ersten Token gegenüber Grok 4.5 mehr als vervierfacht (10,01 → 43,66 s) bei praktisch unveränderter Ausgabegeschwindigkeit
  • Die höchste Aufwandsstufe „xhigh“ liegt in allen drei AA-Indizes unter „high“ (60,0/75,9/56,6 gegen 60,9/76,8/58,7) und kostet dabei 24 % mehr je Aufgabe – mehr Aufwand ist hier messbar nicht besser
  • Proprietär, nur über API/Produkt nutzbar; Terminal-Bench 2.1 und τ²-bench für dieses Modell noch nicht unabhängig gemessen
  • Kontextfenster 500 K – halb so groß wie bei Grok 4.3 (1 Mio.) und beim direkten Wettbewerb Claude Opus 5 (1 Mio.)

Typische Einsatzfälle

  • Anspruchsvolles Coding
  • agentische Workflows
  • STEM- & Wissensarbeit
  • kostensensible Spitzenleistung

Leistung im Vergleich

Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → oben ist daraus abgeleitet: AA-Intelligenz je AA-Blended-Preis (3:1) – entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis. AAs token-basiertes „Cost to Run Index“ ist nicht öffentlich abrufbar.

  • AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen →61
  • AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen →77
  • AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen →59

Benchmarks im Detail

Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →

  • Artificial Analysis Intelligence Index (v4.1)

    60,9

    (high) – nach Aufwandsstufen 60,9 (high) / 60,0 (xhigh) / 59,0 (medium) / 51,7 (low)

    unabhängigArtificial Analysis (API v2), abgerufen 2026-08-25

  • Artificial Analysis Coding Index

    76,8

    (high) – 75,9 (xhigh) / 74,4 (medium) / 66,3 (low)

    unabhängigArtificial Analysis (API v2), abgerufen 2026-08-25

  • Artificial Analysis Agentic Index

    58,7

    (high) – 56,6 (xhigh) / 56,3 (medium) / 47,8 (low)

    unabhängigArtificial Analysis (API v2), abgerufen 2026-08-25

  • Kosten je Index-Aufgabe (AA, Token-Verbrauch bei festem Listenpreis)

    0,8367

    $ (high) – 1,0412 (xhigh) / 0,6679 (medium) / 0,2207 (low)

    unabhängigArtificial Analysis (API v2), abgerufen 2026-08-25

  • DeepSWE (Coding, Anbieter-Vergleichstabelle)

    65,9 %

    – gegen 73,0 % bei GPT-5.6 Sol Max (Anbieterangabe)

    AnbieterangabexAI-Ankündigung, referiert im News-Sweep 2026-08-13

Einordnung

  • Der Kern des Modells in einer Zeile: derselbe Indexwert wie GPT-5.6 Sol, zum halben Eingabe- und einem Drittel des Ausgabepreises. Beide stehen bei 60,9 Punkten im AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen →; Grok 4.6 kostet 2 $/6 $ je 1 Mio. TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →, GPT-5.6 Sol 4 $/20 $. Aussagekräftiger als der Listenpreis ist AAs eigene Kostenrechnung für den Index-Durchlauf, weil sie den Token-Verbrauch einpreist: 0,8367 $ je Aufgabe für Grok 4.6 gegen 0,9604 $ (GPT-5.6 Sol), 2,3369 $ (Claude Opus 5) und 3,1396 $ (Claude Fable 5). Grok 4.6 ist damit das günstigste Modell der 60-Punkte-Klasse – bei einem Rückstand von zwei Punkten auf Opus 5 (63,1).Beleg · Sekundärquelle
  • ⚠️ Der Zugewinn ist erkauft, und die Rechnung steht in derselben Quelle. Grok 4.6 kostet je Token exakt dasselbe wie Grok 4.5 (2 $/6 $) – die Kosten je Index-Aufgabe steigen trotzdem von 0,3601 auf 0,8367 US-Dollar, also um 132 Prozent. Da der Preis je Token konstant ist, misst diese Differenz nichts anderes als den Token-Verbrauch: Das Modell denkt für denselben Auftrag mehr als doppelt so lang. Dieselbe Ursache zeigt sich beim Tempo – die Zeit bis zum ersten Token vervierfacht sich (10,01 → 43,66 s) und die Antwortzeit von Anfang bis Ende verdreifacht sich (17,83 → 51,73 s), während die reine Ausgabegeschwindigkeit praktisch unverändert bleibt (63,86 → 61,92 Token/s). Es ist also nicht langsamer geworden, es denkt länger. Wer Grok 4.5 wegen seiner Token-Effizienz gewählt hat, verliert mit dem Wechsel genau das.Beleg · Sekundärquelle
  • Die höchste Aufwandsstufe ist nicht die beste – ein Befund gegen die Intuition. xAI bietet vier Stufen an (low, medium, high als Voreinstellung, xhigh). Gemessen liegt „xhigh“ in allen drei Indizes unter „high“: 60,0 gegen 60,9 (Intelligenz), 75,9 gegen 76,8 (Coding), 56,6 gegen 58,7 (Agentic) – und kostet dabei 1,0412 statt 0,8367 US-Dollar je Aufgabe, also 24 Prozent mehr. Wer die oberste Stufe wählt, zahlt hier messbar für ein schlechteres Ergebnis. Die Staffel darunter verhält sich dagegen wie erwartet und ist der eigentliche Hebel: „low“ liefert 51,7 Punkte für 0,2207 $ je Aufgabe – ein Fünftel der Kosten von „xhigh“ bei sechs Punkten Abstand zu „high“.Beleg · Sekundärquelle
  • Zugang und Spezifikationen an der Primärquelle: Modell-ID `grok-4.6`, Kontextfenster 500.000 Token, „Text and image input; text output“, Aufwandsstufen „Low, medium, high (default), or xhigh“, Wissensstichtag 1. Februar 2026. Ein EU-Vorbehalt wie beim Start von Grok 4.5 steht in der Dokumentation nicht. Die Preistabelle staffelt nach Prompt-Länge: bis 200 K Prompt-Token 2 $/6 $, ab 200 K 4 $/12 $ je 1 Mio. Token, zwischengespeicherte Eingabe 0,50 $ bzw. 1,00 $.Beleg · Primärquelle

Stimmen aus der Öffentlichkeit

Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.

  • kritischPraxis-Gegenstimme zum Indexgewinn, und sie beschreibt genau den Mechanismus, den die Messung ausweist: „for my use cases, 4.6 is a downgrade over 4.5 because they made it smarter, but they made it smarter by making it reason for longer. I don’t want that because I liked Grok 4.5 being relatively token efficient and fast. It was a really good combo. Now that it’s less token efficient, it’s less fast, which kills one of the biggest benefits I had using it.“ ✅ An der unabhängigen Messung gegengeprüft und in beiden Teilen bestätigt: „smarter“ = 55,8 → 60,9 Indexpunkte, „less token efficient“ = 0,36 → 0,84 US-Dollar je Aufgabe bei unverändertem Token-Preis, „less fast“ = 10,01 → 43,66 s bis zum ersten Token bei praktisch gleicher Ausgabegeschwindigkeit. Die Bewertung („downgrade“) bleibt seine; die Tatsachenbasis stimmt.Nerd Snipe (YouTube) – „Grok 4.6 is a Downgrade AND Upgrade“ (per oEmbed verifiziert, gegen das Original-Transkript gelesen) · Community, 2026-08-24

ℹ️ xAI firmiert seit 2026 als SpaceXAI. Aufgenommen am 25.08.2026 – die Aufnahme war seit dem 13.08.2026 bewusst zurückgestellt, weil die Artificial-Analysis-Modellseiten damals katalogweit rund zwei Punkte über unserem Stand vom 05.08.2026 lagen und nicht zu entscheiden war, ob es sich um eine Neueichung des Index oder um eine andere ausgewiesene Aufwandsstufe handelt; Grok 4.6 neben unsere älteren Werte zu stellen, hätte einen Vorsprung erfunden. Der `verify-bench`-Lauf vom 21.08.2026 hat die Frage geklärt (Index-Version 4.1, katalogweite Neueichung, alle Kennzahlen nachgezogen); der Kontroll-Lauf vom 25.08.2026 bestätigt die Stabilität (25 Modelle im Toleranzband, Index-Version unverändert 4.1). Alle hier geführten Kennzahlen stammen aus einem Abruf derselben Schnittstelle am 25.08.2026 und sind untereinander wie mit dem übrigen Katalog vergleichbar. Als Katalogwert geführt wird die Stufe high, weil sie laut Anbieter-Dokumentation die Voreinstellung ist; die drei anderen Stufen stehen vollständig in den `benchmarks`. Terminal-Bench 2.1 und τ²-bench liefert die freie AA-Route nicht (Pro-Feld) – Nachtrag über den nächsten Verifikations-Loop. Architektur und Parameterzahl legt xAI nicht offen. Anbieter-berichtete Coding-Werte (DeepSWE 65,9 %) liegen unter denen des Wettbewerbs und sind als Anbieterangabe markiert; bemerkenswert ist, dass xAI in der eigenen Vergleichstabelle zwei von drei Coding-Vergleichen verliert – ungewöhnlich wenig Cherrypicking, aber weiterhin Anbieterzahlen.