xAI · Grok
Grok 4.6
grok-4.6
Erste WahlSpitzengruppe zum günstigsten Preis – bezahlt mit Denkzeit
- anspruchsvolles Coding
- agentische Workflows
- kostenbewusste Spitzenleistung
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen → - 500 K
TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen → - Preis (Input / Output)
- $2 / $6 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → - 20,3 Indexpkt. je $/Mio. Token
- Release
- 12. August 2026
Stärken
Bestes Preis-Leistungs-Verhältnis der Spitzengruppe: 0,84 $ je Index-Aufgabe gegen 0,96 $ (GPT-5.6 Sol), 2,34 $ (Opus 5) und 3,14 $ (Fable 5) – bei gleichem oder nur zwei Punkte niedrigerem Indexwert AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen → 59 – gleichauf mit Claude Opus 5 an der Spitze unseres Katalogs, ein Sprung von zehn Punkten gegenüber Grok 4.5 (49)Deutlich schneller beim ersten Token als die direkte Vergleichsklasse (43,66 s gegen 158,27 s bei GPT-5.6 Sol) Reasoning-Aufwand über vier Stufen steuerbar (low/medium/high/xhigh); „low“ liefert 52 Indexpunkte für 0,22 $ je Aufgabe
Schwächen
Token-Effizienz gegenüber dem Vorgänger halbiert: 0,84 statt 0,36 US-Dollar je Index-Aufgabe bei identischem Listenpreis – der Zugewinn wird über längeres Nachdenken erkauft Zeit bis zum ersten Token gegenüber Grok 4.5 mehr als vervierfacht (10,01 → 43,66 s) bei praktisch unveränderter Ausgabegeschwindigkeit Die höchste Aufwandsstufe „xhigh“ liegt in allen drei AA-Indizes unter „high“ (60,0/75,9/56,6 gegen 60,9/76,8/58,7) und kostet dabei 24 % mehr je Aufgabe – mehr Aufwand ist hier messbar nicht besser Proprietär, nur über API/Produkt nutzbar; Terminal-Bench 2.1 und τ²-bench für dieses Modell noch nicht unabhängig gemessen Kontextfenster 500 K – halb so groß wie bei Grok 4.3 (1 Mio.) und beim direkten Wettbewerb Claude Opus 5 (1 Mio.)
Typische Einsatzfälle
Anspruchsvolles Coding agentische Workflows STEM- & Wissensarbeit kostensensible Spitzenleistung
Leistung im Vergleich
Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die
AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 61AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 77AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen → 59
Benchmarks im Detail
Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →
Artificial Analysis Intelligence Index (v4.1)
60,9
(high) – nach Aufwandsstufen 60,9 (high) / 60,0 (xhigh) / 59,0 (medium) / 51,7 (low)
unabhängigArtificial Analysis (API v2), abgerufen 2026-08-25
Artificial Analysis Coding Index
76,8
(high) – 75,9 (xhigh) / 74,4 (medium) / 66,3 (low)
unabhängigArtificial Analysis (API v2), abgerufen 2026-08-25
Artificial Analysis Agentic Index
58,7
(high) – 56,6 (xhigh) / 56,3 (medium) / 47,8 (low)
unabhängigArtificial Analysis (API v2), abgerufen 2026-08-25
Kosten je Index-Aufgabe (AA, Token-Verbrauch bei festem Listenpreis)
0,8367
$ (high) – 1,0412 (xhigh) / 0,6679 (medium) / 0,2207 (low)
unabhängigArtificial Analysis (API v2), abgerufen 2026-08-25
DeepSWE (Coding, Anbieter-Vergleichstabelle)
65,9 %
– gegen 73,0 % bei GPT-5.6 Sol Max (Anbieterangabe)
AnbieterangabexAI-Ankündigung, referiert im News-Sweep 2026-08-13
Einordnung
Der Kern des Modells in einer Zeile: derselbe Indexwert wie GPT-5.6 Sol, zum halben Eingabe- und einem Drittel des Ausgabepreises. Beide stehen bei 60,9 Punkten im Beleg · SekundärquelleAA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → ; Grok 4.6 kostet 2 $/6 $ je 1 Mio.TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen → , GPT-5.6 Sol 4 $/20 $. Aussagekräftiger als der Listenpreis ist AAs eigene Kostenrechnung für den Index-Durchlauf, weil sie den Token-Verbrauch einpreist: 0,8367 $ je Aufgabe für Grok 4.6 gegen 0,9604 $ (GPT-5.6 Sol), 2,3369 $ (Claude Opus 5) und 3,1396 $ (Claude Fable 5). Grok 4.6 ist damit das günstigste Modell der 60-Punkte-Klasse – bei einem Rückstand von zwei Punkten auf Opus 5 (63,1).⚠️ Der Zugewinn ist erkauft, und die Rechnung steht in derselben Quelle. Grok 4.6 kostet je Token exakt dasselbe wie Grok 4.5 (2 $/6 $) – die Kosten je Index-Aufgabe steigen trotzdem von 0,3601 auf 0,8367 US-Dollar, also um 132 Prozent. Da der Preis je Token konstant ist, misst diese Differenz nichts anderes als den Token-Verbrauch: Das Modell denkt für denselben Auftrag mehr als doppelt so lang. Dieselbe Ursache zeigt sich beim Tempo – die Zeit bis zum ersten Token vervierfacht sich (10,01 → 43,66 s) und die Antwortzeit von Anfang bis Ende verdreifacht sich (17,83 → 51,73 s), während die reine Ausgabegeschwindigkeit praktisch unverändert bleibt (63,86 → 61,92 Token/s). Es ist also nicht langsamer geworden, es denkt länger. Wer Grok 4.5 wegen seiner Token-Effizienz gewählt hat, verliert mit dem Wechsel genau das. Beleg · SekundärquelleDie höchste Aufwandsstufe ist nicht die beste – ein Befund gegen die Intuition. xAI bietet vier Stufen an (low, medium, high als Voreinstellung, xhigh). Gemessen liegt „xhigh“ in allen drei Indizes unter „high“: 60,0 gegen 60,9 (Intelligenz), 75,9 gegen 76,8 (Coding), 56,6 gegen 58,7 (Agentic) – und kostet dabei 1,0412 statt 0,8367 US-Dollar je Aufgabe, also 24 Prozent mehr. Wer die oberste Stufe wählt, zahlt hier messbar für ein schlechteres Ergebnis. Die Staffel darunter verhält sich dagegen wie erwartet und ist der eigentliche Hebel: „low“ liefert 51,7 Punkte für 0,2207 $ je Aufgabe – ein Fünftel der Kosten von „xhigh“ bei sechs Punkten Abstand zu „high“. Beleg · SekundärquelleZugang und Spezifikationen an der Primärquelle: Modell-ID `grok-4.6`, Kontextfenster 500.000 Token, „Text and image input; text output“, Aufwandsstufen „Low, medium, high (default), or xhigh“, Wissensstichtag 1. Februar 2026. Ein EU-Vorbehalt wie beim Start von Grok 4.5 steht in der Dokumentation nicht. Die Preistabelle staffelt nach Prompt-Länge: bis 200 K Prompt-Token 2 $/6 $, ab 200 K 4 $/12 $ je 1 Mio. Token, zwischengespeicherte Eingabe 0,50 $ bzw. 1,00 $. Beleg · Primärquelle
Stimmen aus der Öffentlichkeit
Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.
- kritischPraxis-Gegenstimme zum Indexgewinn, und sie beschreibt genau den Mechanismus, den die Messung ausweist: „for my use cases, 4.6 is a downgrade over 4.5 because they made it smarter, but they made it smarter by making it reason for longer. I don’t want that because I liked Grok 4.5 being relatively token efficient and fast. It was a really good combo. Now that it’s less token efficient, it’s less fast, which kills one of the biggest benefits I had using it.“ ✅ An der unabhängigen Messung gegengeprüft und in beiden Teilen bestätigt: „smarter“ = 55,8 → 60,9 Indexpunkte, „less token efficient“ = 0,36 → 0,84 US-Dollar je Aufgabe bei unverändertem Token-Preis, „less fast“ = 10,01 → 43,66 s bis zum ersten Token bei praktisch gleicher Ausgabegeschwindigkeit. Die Bewertung („downgrade“) bleibt seine; die Tatsachenbasis stimmt.Nerd Snipe (YouTube) – „Grok 4.6 is a Downgrade AND Upgrade“ (per oEmbed verifiziert, gegen das Original-Transkript gelesen) · Community, 2026-08-24
ℹ️