← Alle Modelle

Google · Gemini

Gemini 3.5 Flash

gemini-3.5-flash

proprietärModell, das nur über die API oder das Produkt des Anbieters nutzbar ist; die Gewichte werden nicht veröffentlicht. Gegenstück zu open-weight.Mehr im Wissen →TextBildVideoAudioPDF

Erste WahlPreis-Leistungs-Tipp

Der Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen →: Intelligence-Index 50 (über Sonnet 4.6 und dem teureren Gemini 3.1 Pro) und Agentic 70 – zum Bruchteil des Flaggschiff-Preises. Auch beim Coding stark (70) – die empfehlenswerte Default-Wahl für Tempo und Volumen.

  • latenzkritische Aufgaben
  • Hochvolumen
  • Suche/Grounding
  • multimodale Eingaben
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen →
1 Mio.TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →
Max. Ausgabe
65.536 K Token
Preis (Input / Output)
$1.5 / $9 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen →
14,8 Indexpkt. je $/Mio. Token
WissensstichtagDer Zeitpunkt, bis zu dem die Trainingsdaten eines Modells reichen („knowledge cutoff“). Über spätere Ereignisse weiß das Modell von sich aus nichts – es sei denn, sie werden ihm in der Anfrage mitgegeben.Mehr im Wissen →
Jan 2025

Stärken

  • Schnell und breit multimodal bei 1-Mio.-Token-Kontext
  • Günstiger als die Pro-Variante
  • Auf Tempo, Suche und Grounding ausgelegt (Anbieterangabe)

Schwächen

  • Proprietär, nur über die Cloud-API nutzbar
  • Audio-Eingabe wird gesondert (teurer) bepreist

Typische Einsatzfälle

  • latenzkritische Aufgaben
  • Hochvolumen
  • Suche/Grounding

Leistung im Vergleich

Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → oben ist daraus abgeleitet: AA-Intelligenz je AA-Blended-Preis (3:1) – entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis. AAs token-basiertes „Cost to Run Index“ ist nicht öffentlich abrufbar.

  • AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen →50
  • AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen →70
  • AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen →70
  • Terminal-BenchAusführungsbasierter Benchmark (0–100 %): das Modell löst echte Shell-/Terminal-Aufgaben in einer Sandbox, gewertet wird, ob das Ergebnis wirklich funktioniert. Dadurch kontaminationsärmer als reine Wissensquizze.Mehr im Wissen →79
  • τ²-benchBenchmark für die Verlässlichkeit beim Werkzeug-Einsatz: dieselbe Aufgabe wird viele Male wiederholt, gemessen wird, wie konstant das Modell die Tools korrekt bedient (0–100 %).Mehr im Wissen →95
  • Elo (LMArena)Human-Präferenz-Wertung aus der LMArena: Menschen vergleichen blind zwei Modellantworten, daraus entsteht – wie beim Schach – eine Elo-Zahl. Höher = häufiger bevorzugt. Misst Präferenz, nicht Korrektheit.Mehr im Wissen →1477

Benchmarks im Detail

Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →

  • Artificial Analysis Intelligence Index

    50

    unabhängigArtificial Analysis, abgerufen 2026-06-16

  • Artificial Analysis Coding Index

    70

    unabhängigArtificial Analysis Coding Index, abgerufen 2026-07-09

  • Artificial Analysis Agentic Index

    70

    unabhängigArtificial Analysis Agentic Index, abgerufen 2026-06-16

  • LMArena Text Arena (Elo)

    1477

    unabhängigLMArena (arena.ai), Stand 2026-06-10

  • DeepSWE (Long-Horizon Coding)

    28 %

    (medium)

    unabhängigdeepswe.lol (kontaminationsfrei, mini-swe-agent), 2026-06-16

  • Terminal-Bench (agentische Shell-Aufgaben)

    79 %

    unabhängigArtificial Analysis (API), abgerufen 2026-06-16

  • τ²-bench (Tool-Use-Verlässlichkeit)

    95 %

    unabhängigArtificial Analysis (API), abgerufen 2026-06-16

Einordnung

  • Überraschend stark in der Allzweck-Intelligenz: AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 50 – vor Sonnet 4.6 (47) und sogar dem teureren Gemini 3.1 Pro (46), bei deutlich niedrigerem Preis ($1,50 / $9).Beleg · Sekundärquelle
  • Beim Coding (AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 70) überraschend stark – über DeepSeek-V4-Pro (59) und praktisch gleichauf mit dem teureren Gemini 3.1 Pro (69), klar vor Grok 4.3 (42); breit multimodal – starkes Preis-Leistungs-Verhältnis für latenzkritische Aufgaben.Beleg · Sekundärquelle
  • Nachfolger da: Google gab am 21. Juli 2026 Gemini 3.6 Flash als neues Standard-Modell frei ($1,50 / $7,50 – Output günstiger als hier, laut Google ~17 % weniger Output-Token) sowie das noch billigere 3.5 Flash-Lite ($0,30 / $2,50). Die genannten Effizienz-/Benchmark-Sprünge sind Google-eigene Zahlen; unabhängige AA-Werte für 3.6 Flash liegen noch nicht vor – Kennzahlen hier bleiben bis zum Abgleich auf 3.5 Flash.Beleg · Primärquelle
  • Basis eines Robotik-Ablegers: Das am 30. Juli 2026 vorgestellte Gemini Robotics ER 2 setzt laut Model Card auf Gemini 3.5 Flash auf – als Planungsmodell für Roboter mit 128k Kontext, 64k Ausgabe und zusätzlichen Datensätzen zum verkörperten Schließen. Es ist über dieselbe Gemini-API zugänglich; die zugehörigen Motorik-Modelle (VLA) bleiben Partnern vorbehalten. Für sicherheitskritische Anwendungen ist es laut Card ausdrücklich nicht bestimmt.Beleg · Primärquelle

Aus der System-Card

Verdichtete Befunde aus der offiziellen System-CardDas offizielle Begleitdokument eines Anbieters zu einem Modell (auch „Model Card“): Fähigkeiten, Grenzen, Sicherheitsbewertung. Primärquelle – die Fähigkeitsangaben darin sind aber Eigenangaben, nicht unabhängig gemessen.Mehr im Wissen → des Anbieters (Primärquelle, Tier (A/B/C)Verlässlichkeits-Stufe einer Quelle in der KI-Depesche: A = Primärquelle (z. B. offizielle Doku), B = solide Sekundärquelle, C = subjektiv/Einzelstimme. Steuert, wie stark eine Aussage gewichtet wird.Mehr im Wissen →). Fähigkeitswerte sind Anbieterangaben – nicht unabhängig nachgemessen. Card-Stand 2026-05-19.

Fähigkeiten

  • CodingLaut Card erreicht Gemini 3.5 Flash auf Terminal-BenchAusführungsbasierter Benchmark (0–100 %): das Modell löst echte Shell-/Terminal-Aufgaben in einer Sandbox, gewertet wird, ob das Ergebnis wirklich funktioniert. Dadurch kontaminationsärmer als reine Wissensquizze.Mehr im Wissen → 2.1 76,2 % – deutlich über Gemini 3 Flash (58,0 %) und meist über Gemini 3.1 Pro.
  • AgentischLaut Card führt es bei agentischen Aufgaben mit 83,6 % auf MCP (Model Context Protocol)Offener Standard, über den ein Modell einheitlich externe Werkzeuge und Datenquellen anbindet. Macht Tool-Anbindungen austauschbar statt anbieterspezifisch.Mehr im Wissen → Atlas und 56,5 % auf Toolathlon und übertrifft dort sowohl Gemini 3.1 Pro als auch Claude Opus 4.7.
  • MultimodalLaut Card liegt es multimodal bei 84,2 % (CharXiv Reasoning) und 83,6 % (MMMU-Pro), jeweils ohne Tools und über allen Vergleichsmodellen der Tabelle.
  • Flash schlägt 3.1 ProLaut Card übertrifft das schnelle, günstige Flash-Modell den größeren Vorgänger Gemini 3.1 Pro in mehreren Disziplinen (MCP Atlas 83,6 % vs. 78,2 %, Finance Agent v2 57,9 % vs. 43,0 %).

Verhalten & Sicherheit

  • FSF/CCLsLaut Card erreicht Gemini 3.5 Flash keines der im Frontier Safety Framework definierten Critical Capability Levels; die Bewertung stützt sich auf Gemini 3.1 Pro als fähigstes Modell der Reihe.
  • CyberWeil frühere Gemini-3-Modelle die Cyber-Alert-Schwelle erreichten, wurde zusätzlich getestet – Gemini 3.5 Flash bleibt unter dem Cyber-CCL.
  • Refusals & TonLaut Card bleiben unbegründete Ablehnungen niedrig (+0,8 %, „non-egregious“), und der objektive Ton bei Ablehnungen verbessert sich um +8,9 % gegenüber Gemini 3 Flash.
  • Safety insgesamtLaut Card schlägt es den Vorgänger über Sicherheit und Ton hinweg; kleine Rückgänge bei Text-to-Text-Safety (−3,9 %) und Multilingual Safety (−2,6 %) waren manuell überwiegend False Positives.
  • Red TeamingLaut Card erfüllt es die Child-Safety-Schwellen, und das Red-Teaming fand im Vergleich zu Gemini 3.1 Pro keine gravierenden Bedenken.

Reine Update-Card: für Architektur, Trainingsdaten, Limitierungen und Safety-Policies verweist sie auf die Gemini-3-Flash- bzw. Gemini-3.1-Pro-Card; die Benchmark-Werte sind anbieter-selbstberichtet (Stand Mai 2026).

Google DeepMind – Gemini 3.5 Flash Model Card (PDF)· Primärquelle, abgerufen 2026-06-16

Stimmen aus der Öffentlichkeit

Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.

  • kritischVersagt im Coding-Test (ein Spiel-Rebuild scheiterte als einziges Modell) und verbrennt Token: trotz verdreifachtem Preis real eines der teuersten Modelle und in der Token-Effizienz weit hinter GPT-5.5 medium – kein ernsthaftes Coding-Werkzeug.Theo – t3.gg (YouTube) · Community
  • gemischtBeim Frontend-Design beeindruckend und günstig: liefert in einem Durchgang („one-shot“) ansehnliche UIs – aber die eigentlichen Inhalte/Texte („page copy“) werden dabei oft halluziniert. Gut fürs Layout, unzuverlässig für echte Information; daher als Designer eingesetzt, Claude fürs Planen.Cole Medin (YouTube) · Community

ℹ️ Input-Preis $1,50 für Text/Bild/Video; Audio-Eingabe abweichend bepreist.