Mistral AI · Mistral
Mistral Large 3
mistral-large-3-2512
Solide WahlOpen-Weight für EU/Souverän
- Self-Hosting
- EU-/souveräne Deployments
- kostengünstige Allzweck-Aufgaben
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen → - 256 K
TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen → - Preis (Input / Output)
- $0.5 / $1.5 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → - 21,3 Indexpkt. je $/Mio. Token
- Release
- 2. Dezember 2025
Stärken
Offene Gewichte unter Apache 2.0 (lokal/self-hosted möglich) 256-K-Token-Kontext, multimodal (Text- und Bildeingabe) MoE-Architektur: 41 Mrd. aktive von 675 Mrd. Parametern (effizient relativ zur Größe)
Schwächen
Betrieb erfordert eigene oder gehostete Inferenz (großes 675-Mrd.-Gewichtspaket) Laut Anbieter ein nicht-Reasoning-Modell – kein dediziertes Thinking / ReasoningModus, in dem ein Modell vor der Antwort sichtbare Zwischenschritte „durchdenkt“. Das hebt die Qualität bei schweren Aufgaben, kostet aber mehr Tokens und Zeit – oft über einen Aufwand-Regler steuerbar.Mehr im Wissen → wie bei Spitzen-Reasonern
Typische Einsatzfälle
Self-HostingEin (meist open-weight) Modell auf eigener Hardware oder in der eigenen Cloud betreiben, statt die API eines Anbieters zu nutzen. Bringt Datenhoheit und Kostenkontrolle, erfordert aber eigene Infrastruktur.Mehr im Wissen → EU-/souveräne Deployments multimodalEin Modell ist multimodal, wenn es mehr als nur Text verarbeitet – etwa Bilder, Audio oder Video als Eingabe versteht (manche erzeugen sie auch als Ausgabe).Mehr im Wissen → Allzweck-Aufgaben
Leistung im Vergleich
Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die
AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 16AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 20τ²-benchBenchmark für die Verlässlichkeit beim Werkzeug-Einsatz: dieselbe Aufgabe wird viele Male wiederholt, gemessen wird, wie konstant das Modell die Tools korrekt bedient (0–100 %).Mehr im Wissen → 25Elo (LMArena)Human-Präferenz-Wertung aus der LMArena: Menschen vergleichen blind zwei Modellantworten, daraus entsteht – wie beim Schach – eine Elo-Zahl. Höher = häufiger bevorzugt. Misst Präferenz, nicht Korrektheit.Mehr im Wissen → 1416
Benchmarks im Detail
Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →
Artificial Analysis Intelligence Index
16
(AA-Schätzung)
unabhängigArtificial Analysis (API), abgerufen 2026-06-16 – Schätzwert, vollständige Eval ausstehend
Artificial Analysis Coding Index
20
unabhängigArtificial Analysis (API), abgerufen 2026-07-09
LMArena Text Arena (Elo)
1416
unabhängigLMArena (arena.ai), Stand 2026-06-10
τ²-bench (Tool-Use-Verlässlichkeit)
25 %
unabhängigArtificial Analysis (API), abgerufen 2026-06-16
Einordnung
Günstigstes der Flaggschiffe ($0,5 / $1,5 je 1 Mio. Token) und open-weightModell, dessen trainierte Gewichte öffentlich herunterladbar sind, sodass man es selbst (lokal oder auf eigener Hardware) betreiben kann. Nicht zwingend vollständig quelloffen – die Lizenz bestimmt die erlaubte Nutzung.Mehr im Wissen → unter Apache 2.0 – anders als dieproprietärModell, das nur über die API oder das Produkt des Anbieters nutzbar ist; die Gewichte werden nicht veröffentlicht. Gegenstück zu open-weight.Mehr im Wissen → Spitzenmodelle lokal/self-hosted betreibbar.Unabhängige Werte: AA Intelligence Index 16 / Coding 20 (als AA-Schätzung, da mehrere Teil-Benchmarks noch fehlen) plus Beleg · SekundärquelleElo (LMArena)Human-Präferenz-Wertung aus der LMArena: Menschen vergleichen blind zwei Modellantworten, daraus entsteht – wie beim Schach – eine Elo-Zahl. Höher = häufiger bevorzugt. Misst Präferenz, nicht Korrektheit.Mehr im Wissen → 1416 (Human-Preference) – im Mittelfeld, vor Llama 4 (1327), hinter den Cloud-Flaggschiffen.
ℹ️