← Alle Modelle

Meta · Llama

Llama 4 Maverick

open-weightModell, dessen trainierte Gewichte öffentlich herunterladbar sind, sodass man es selbst (lokal oder auf eigener Hardware) betreiben kann. Nicht zwingend vollständig quelloffen – die Lizenz bestimmt die erlaubte Nutzung.Mehr im Wissen →TextBild

SituativKontext-Spezialist

Mit bis zu 10 Mio. TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen → das größte KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen → im Katalog – aber der niedrigste Human-Präferenz-Elo (LMArena)Human-Präferenz-Wertung aus der LMArena: Menschen vergleichen blind zwei Modellantworten, daraus entsteht – wie beim Schach – eine Elo-Zahl. Höher = häufiger bevorzugt. Misst Präferenz, nicht Korrektheit.Mehr im Wissen → (1327). Lohnt vor allem für extrem lange Kontexte und Self-Hosting, weniger für Spitzen-Antwortqualität.

  • sehr lange Kontexte
  • Self-Hosting
  • multimodale Anwendungen
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen →
10 Mio.TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →
Preis (Input / Output)
k. A. je 1 Mio. Token

Stärken

  • Offene Gewichte zum Download (lokal/self-hosted möglich)
  • Sehr großes Kontextfenster (bis 10 Mio. Token, Anbieterangabe)
  • Nativ multimodal: Text und Bild

Schwächen

  • Keine zentralen Token-Preise – Kosten je nach Hoster/eigener Infrastruktur
  • Betrieb erfordert eigene oder gehostete InferenzDer laufende Betrieb eines fertig trainierten Modells – das Erzeugen von Antworten auf Anfragen. Anders als das einmalige Training fällt Inferenz bei jeder Nutzung an.Mehr im Wissen →

Typische Einsatzfälle

  • Self-Hosting
  • lange Kontexte
  • multimodale Anwendungen

Leistung im Vergleich

Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar.

  • AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen →14
  • AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen →16
  • Terminal-BenchAusführungsbasierter Benchmark (0–100 %): das Modell löst echte Shell-/Terminal-Aufgaben in einer Sandbox, gewertet wird, ob das Ergebnis wirklich funktioniert. Dadurch kontaminationsärmer als reine Wissensquizze.Mehr im Wissen →8
  • τ²-benchBenchmark für die Verlässlichkeit beim Werkzeug-Einsatz: dieselbe Aufgabe wird viele Male wiederholt, gemessen wird, wie konstant das Modell die Tools korrekt bedient (0–100 %).Mehr im Wissen →18
  • Elo (LMArena)Human-Präferenz-Wertung aus der LMArena: Menschen vergleichen blind zwei Modellantworten, daraus entsteht – wie beim Schach – eine Elo-Zahl. Höher = häufiger bevorzugt. Misst Präferenz, nicht Korrektheit.Mehr im Wissen →1327

Benchmarks im Detail

Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →

  • Artificial Analysis Intelligence Index

    14

    unabhängigArtificial Analysis (API), abgerufen 2026-06-16

  • Artificial Analysis Coding Index

    16

    unabhängigArtificial Analysis (API), abgerufen 2026-06-16

  • LMArena Text Arena (Elo)

    1327

    unabhängigLMArena (arena.ai), Stand 2026-06-10

  • Terminal-Bench (agentische Shell-Aufgaben)

    8 %

    unabhängigArtificial Analysis (API), abgerufen 2026-06-16

  • τ²-bench (Tool-Use-Verlässlichkeit)

    18 %

    unabhängigArtificial Analysis (API), abgerufen 2026-06-16

Einordnung

  • Mit Abstand größtes Kontextfenster im Katalog: bis 10 Mio. Token (Anbieterangabe) und open-weightModell, dessen trainierte Gewichte öffentlich herunterladbar sind, sodass man es selbst (lokal oder auf eigener Hardware) betreiben kann. Nicht zwingend vollständig quelloffen – die Lizenz bestimmt die erlaubte Nutzung.Mehr im Wissen → – die übrigen Flaggschiffe liegen bei 0,2–1 Mio.
  • Im unabhängigen LMArena-Elo aber nur 1327 – am Ende des Katalog-Felds; auch im AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → (14) das Schlusslicht. Das große Kontextfenster geht nicht mit Spitzen-Qualität einher. Kein zentraler $/Token-Preis.

Aus der System-Card

Verdichtete Befunde aus der offiziellen System-CardDas offizielle Begleitdokument eines Anbieters zu einem Modell (auch „Model Card“): Fähigkeiten, Grenzen, Sicherheitsbewertung. Primärquelle – die Fähigkeitsangaben darin sind aber Eigenangaben, nicht unabhängig gemessen.Mehr im Wissen → des Anbieters (Primärquelle, Tier (A/B/C)Verlässlichkeits-Stufe einer Quelle in der KI-Depesche: A = Primärquelle (z. B. offizielle Doku), B = solide Sekundärquelle, C = subjektiv/Einzelstimme. Steuert, wie stark eine Aussage gewichtet wird.Mehr im Wissen →). Fähigkeitswerte sind Anbieterangaben – nicht unabhängig nachgemessen. Card-Stand 2025-04-05.

Fähigkeiten

  • Reasoning & WissenLaut Card erreicht der instruction-tuned Maverick 80,5 % auf MMLU-Pro und 69,8 % auf GPQA Diamond (0-shot) – klar über Llama 3.1 405B.
  • CodingLaut Card meldet Maverick auf LiveCodeBench (10/2024–02/2025) 43,4 % pass@1, deutlich vor Llama 3.1 405B (27,7 %).
  • MultimodalMaverick ist nativ multimodalEin Modell ist multimodal, wenn es mehr als nur Text verarbeitet – etwa Bilder, Audio oder Video als Eingabe versteht (manche erzeugen sie auch als Ausgabe).Mehr im Wissen → (early fusion) und liest laut Card bis zu 5 Bilder; Image-Reasoning: MMMU 73,4 %, MathVista 73,7 %, DocVQA 94,4 %.

Verhalten & Sicherheit

  • Safety-AnsatzMeta beschreibt eine dreistufige Strategie: hilfreiche/sichere Modelle ausliefern, Entwickler gegen Missbrauch schützen und der Community Schutz vor Modell-Missbrauch geben.
  • Refusals & TonDie Card betont, Falsch-Ablehnungen harmloser Prompts gesenkt und den Ton entschärft zu haben – gezielt weniger „preachy“/moralisierend, dafür natürlicher und per System-Prompt steuerbar.
  • System-SchutzLaut Card sind die Modelle mit System-Guardrails wie Llama Guard, Prompt Guard und Code Shield zu betreiben, nicht isoliert.
  • Cyber & CBRNEDie Card berichtet dedizierte Cyber- und CBRNE-Evaluierungen samt Red-Teaming und schließt, dass Llama 4 kein Risiko birgt, das katastrophale Cyber-Folgen plausibel ermöglicht.
  • Lizenz & NutzungMaverick steht unter der „Llama 4 Community License“ mit Acceptable Use Policy samt Metas bekannter MAU-Schwellen-Klausel; nicht unterstützte Sprachen/Fähigkeiten gelten als out-of-scope.

Die Model-Card (April 2025) behandelt Scout und Maverick gemeinsam; die genannten Benchmark-Zahlen sind die anbieter-selbstberichteten Maverick-Spalten (17 B aktiv, 128 Experten, ~400 B total, Cutoff Aug 2024).

Meta – Llama 4 Model Card (GitHub)· Primärquelle, abgerufen 2026-06-16

Stimmen aus der Öffentlichkeit

Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.

  • kritischGilt in der Open-Weights-Community als gescheitert: das angekündigte Behemoth-Modell wurde nie veröffentlicht – und in den Open-Weights-Charts dominieren inzwischen chinesische Modelle, Llama taucht vorne nicht mehr auf.Theo – t3.gg (YouTube) · Community
  • kritischHat laut c’t-Einschätzung nie richtig Fahrt aufgenommen – kaum jemand nutze die Llama-Modelle noch; lokal greife man eher zu Gemma 4, Qwen oder DeepSeek.c’t 3003 (YouTube) · Community
  • kritischWurde gezielt auf LM Arena optimiert, was hohe Benchmark-Positionen ergab, in der praktischen Nutzung aber nicht überzeugte.Cognitive Revolution (YouTube) · Community

ℹ️ Open-weight unter Metas Llama-Community-Lizenz (Bedingungen auf llama.com prüfen). Keine zentralen $/Token-Preise; Schwestermodell Llama 4 Scout ebenfalls mit großem Kontext.