← Alle Modelle

Mistral AI · Mistral

Mistral Large 3

mistral-large-3-2512

open-weightModell, dessen trainierte Gewichte öffentlich herunterladbar sind, sodass man es selbst (lokal oder auf eigener Hardware) betreiben kann. Nicht zwingend vollständig quelloffen – die Lizenz bestimmt die erlaubte Nutzung.Mehr im Wissen →TextBild (Eingabe)

Solide WahlOpen-Weight für EU/Souverän

Günstigstes Flaggschiff ($0,50 / $1,50) und Apache-2.0-offen – damit self-hosted und für souveräne EU-Deployments geeignet. Im AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 16 (AA-Schätzung, vollständige unabhängige Eval ausstehend), AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 20 – solide statt Spitze.

  • Self-Hosting
  • EU-/souveräne Deployments
  • kostengünstige Allzweck-Aufgaben
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen →
256 KTokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →
Preis (Input / Output)
$0.5 / $1.5 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen →
21,3 Indexpkt. je $/Mio. Token
Release
2. Dezember 2025

Stärken

  • Offene Gewichte unter Apache 2.0 (lokal/self-hosted möglich)
  • 256-K-Token-Kontext, multimodal (Text- und Bildeingabe)
  • MoE-Architektur: 41 Mrd. aktive von 675 Mrd. Parametern (effizient relativ zur Größe)

Schwächen

  • Betrieb erfordert eigene oder gehostete Inferenz (großes 675-Mrd.-Gewichtspaket)
  • Laut Anbieter ein nicht-Reasoning-Modell – kein dediziertes Thinking / ReasoningModus, in dem ein Modell vor der Antwort sichtbare Zwischenschritte „durchdenkt“. Das hebt die Qualität bei schweren Aufgaben, kostet aber mehr Tokens und Zeit – oft über einen Aufwand-Regler steuerbar.Mehr im Wissen → wie bei Spitzen-Reasonern

Typische Einsatzfälle

  • Self-HostingEin (meist open-weight) Modell auf eigener Hardware oder in der eigenen Cloud betreiben, statt die API eines Anbieters zu nutzen. Bringt Datenhoheit und Kostenkontrolle, erfordert aber eigene Infrastruktur.Mehr im Wissen →
  • EU-/souveräne Deployments
  • multimodalEin Modell ist multimodal, wenn es mehr als nur Text verarbeitet – etwa Bilder, Audio oder Video als Eingabe versteht (manche erzeugen sie auch als Ausgabe).Mehr im Wissen → Allzweck-Aufgaben

Leistung im Vergleich

Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → oben ist daraus abgeleitet: AA-Intelligenz je AA-Blended-Preis (3:1) – entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis. AAs token-basiertes „Cost to Run Index“ ist nicht öffentlich abrufbar.

  • AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen →16
  • AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen →20
  • τ²-benchBenchmark für die Verlässlichkeit beim Werkzeug-Einsatz: dieselbe Aufgabe wird viele Male wiederholt, gemessen wird, wie konstant das Modell die Tools korrekt bedient (0–100 %).Mehr im Wissen →25
  • Elo (LMArena)Human-Präferenz-Wertung aus der LMArena: Menschen vergleichen blind zwei Modellantworten, daraus entsteht – wie beim Schach – eine Elo-Zahl. Höher = häufiger bevorzugt. Misst Präferenz, nicht Korrektheit.Mehr im Wissen →1416

Benchmarks im Detail

Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →

  • Artificial Analysis Intelligence Index

    16

    (AA-Schätzung)

    unabhängigArtificial Analysis (API), abgerufen 2026-06-16 – Schätzwert, vollständige Eval ausstehend

  • Artificial Analysis Coding Index

    20

    unabhängigArtificial Analysis (API), abgerufen 2026-07-09

  • LMArena Text Arena (Elo)

    1416

    unabhängigLMArena (arena.ai), Stand 2026-06-10

  • τ²-bench (Tool-Use-Verlässlichkeit)

    25 %

    unabhängigArtificial Analysis (API), abgerufen 2026-06-16

Einordnung

  • Günstigstes der Flaggschiffe ($0,5 / $1,5 je 1 Mio. Token) und open-weightModell, dessen trainierte Gewichte öffentlich herunterladbar sind, sodass man es selbst (lokal oder auf eigener Hardware) betreiben kann. Nicht zwingend vollständig quelloffen – die Lizenz bestimmt die erlaubte Nutzung.Mehr im Wissen → unter Apache 2.0 – anders als die proprietärModell, das nur über die API oder das Produkt des Anbieters nutzbar ist; die Gewichte werden nicht veröffentlicht. Gegenstück zu open-weight.Mehr im Wissen → Spitzenmodelle lokal/self-hosted betreibbar.
  • Unabhängige Werte: AA Intelligence Index 16 / Coding 20 (als AA-Schätzung, da mehrere Teil-Benchmarks noch fehlen) plus Elo (LMArena)Human-Präferenz-Wertung aus der LMArena: Menschen vergleichen blind zwei Modellantworten, daraus entsteht – wie beim Schach – eine Elo-Zahl. Höher = häufiger bevorzugt. Misst Präferenz, nicht Korrektheit.Mehr im Wissen → 1416 (Human-Preference) – im Mittelfeld, vor Llama 4 (1327), hinter den Cloud-Flaggschiffen.Beleg · Sekundärquelle

ℹ️ MoE (Mixture of Experts)Architektur, bei der je Anfrage nur ein Teil des Modells („Experten“) aktiv wird. So hat das Modell sehr viele Gesamt-Parameter, rechnet aber nur mit wenigen aktiven – das spart Rechenzeit.Mehr im Wissen → (41 Mrd. aktiv / 675 Mrd. total). Apache 2.0 (offene Gewichte). Mistral nennt #2 in der Kategorie OSS-non-reasoning auf LMArena (Anbieterangabe, nicht unabhängig nachgemessen). Schwestermodelle der Mistral-3-Reihe ebenfalls open-weight: Medium 3.5 ($1,50 / $7,50, 256 K) und Small 4 ($0,10 / $0,30).