← Alle Modelle

xAI · Grok

Grok 4.3

proprietärModell, das nur über die API oder das Produkt des Anbieters nutzbar ist; die Gewichte werden nicht veröffentlicht. Gegenstück zu open-weight.Mehr im Wissen →Text

SituativVon DeepSeek-V4 überholt

DeepSeek-V4-Pro erreicht alle drei AA-Indizes höher und kostet weniger pro TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen → – nach der Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → damit die bessere Wahl. Grok 4.3 bleibt situativ interessant für ein gemanagtes Produkt mit X-Anbindung und großem 1-Mio.-Kontext.

  • Allzweck-Chat im xAI-Ökosystem
  • lange Kontexte

Stärker bei gleichem oder geringerem Preis: DeepSeek-V4-Pro — erreicht alle unabhängigen AA-Indizes ≥ bei niedrigerem TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →.

KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen →
1 Mio.TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →
Preis (Input / Output)
$1.25 / $2.5 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen →
24,3 Indexpkt. je $/Mio. Token
WissensstichtagDer Zeitpunkt, bis zu dem die Trainingsdaten eines Modells reichen („knowledge cutoff“). Über spätere Ereignisse weiß das Modell von sich aus nichts – es sei denn, sie werden ihm in der Anfrage mitgegeben.Mehr im Wissen →
Nov 2024

Stärken

  • Großes 1-Mio.-Token-Kontextfenster
  • Auf Chat und Coding ausgelegt (Anbieterangabe)
  • Vergleichsweise günstiger Output-Preis

Schwächen

  • Proprietär, nur über API/Produkt nutzbar
  • Vergleichsweise alter WissensstichtagDer Zeitpunkt, bis zu dem die Trainingsdaten eines Modells reichen („knowledge cutoff“). Über spätere Ereignisse weiß das Modell von sich aus nichts – es sei denn, sie werden ihm in der Anfrage mitgegeben.Mehr im Wissen → (Nov 2024)

Typische Einsatzfälle

  • Allzweck-Chat
  • Coding

Leistung im Vergleich

Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → oben ist daraus abgeleitet: AA-Intelligenz je AA-Blended-Preis (3:1) – entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis. AAs token-basiertes „Cost to Run Index“ ist nicht öffentlich abrufbar.

  • AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen →38
  • AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen →42
  • AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen →66
  • Terminal-BenchAusführungsbasierter Benchmark (0–100 %): das Modell löst echte Shell-/Terminal-Aufgaben in einer Sandbox, gewertet wird, ob das Ergebnis wirklich funktioniert. Dadurch kontaminationsärmer als reine Wissensquizze.Mehr im Wissen →40
  • τ²-benchBenchmark für die Verlässlichkeit beim Werkzeug-Einsatz: dieselbe Aufgabe wird viele Male wiederholt, gemessen wird, wie konstant das Modell die Tools korrekt bedient (0–100 %).Mehr im Wissen →98
  • Elo (LMArena)Human-Präferenz-Wertung aus der LMArena: Menschen vergleichen blind zwei Modellantworten, daraus entsteht – wie beim Schach – eine Elo-Zahl. Höher = häufiger bevorzugt. Misst Präferenz, nicht Korrektheit.Mehr im Wissen →1443

Benchmarks im Detail

Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →

  • Artificial Analysis Intelligence Index

    38

    (high)

    unabhängigArtificial Analysis, abgerufen 2026-06-16

  • Artificial Analysis Coding Index

    42

    (high)

    unabhängigArtificial Analysis Coding Index, abgerufen 2026-07-09

  • Artificial Analysis Agentic Index

    66

    (high)

    unabhängigArtificial Analysis Agentic Index, abgerufen 2026-06-16

  • LMArena Text Arena (Elo)

    1443

    unabhängigLMArena (arena.ai), Stand 2026-06-10

  • Terminal-Bench (agentische Shell-Aufgaben)

    40 %

    unabhängigArtificial Analysis (API), abgerufen 2026-06-16

  • τ²-bench (Tool-Use-Verlässlichkeit)

    98 %

    unabhängigArtificial Analysis (API), abgerufen 2026-06-16

Einordnung

  • Im AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 42 – am unteren Rand der Cloud-Modelle: klar hinter dem Nachfolger Grok 4.5 (72), DeepSeek-V4-Pro (59) und Gemini 3.5 Flash (70), nur vor Haiku 4.5 (44). Großes 1-Mio.-Token-KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen → bei vergleichsweise günstigem Output-Preis ($2,50).Beleg · Sekundärquelle

Stimmen aus der Öffentlichkeit

Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.

  • positivGrok-TTS überzeugt klar: fünf sehr ausdrucksstarke Stimmen mit Inline-Emotion-Tags, über 20 Sprachen, fehlerfreie Aussprache von Zahlen und Eigennamen, Echtzeit-Streaming – und 10–15× günstiger als ElevenLabs.1littlecoder (YouTube) · Community
  • kritischDer kurze Benchmark-Lead von Grok 4 zum Start war schnell weg; das Modell gilt für niemanden als alltagstauglicher Default und wird kaum genutzt.Theo – t3.gg (YouTube) · Community

ℹ️ Modalitäten laut Doku Text-fokussiert. Weitere Varianten (Thinking / ReasoningModus, in dem ein Modell vor der Antwort sichtbare Zwischenschritte „durchdenkt“. Das hebt die Qualität bei schweren Aufgaben, kostet aber mehr Tokens und Zeit – oft über einen Aufwand-Regler steuerbar.Mehr im Wissen →/Multi-Agent) gelistet. Exakte API-Modell-ID nicht übernommen, da nicht eindeutig belegt. Vom Nachfolger Grok 4.5 (8. Juli 2026, eigener Katalog-Eintrag) beim Coding klar abgelöst (AA Coding 42 vs. 72).