← Alle Modelle

OpenAI · GPT

GPT-5.6 Luna

proprietärModell, das nur über die API oder das Produkt des Anbieters nutzbar ist; die Gewichte werden nicht veröffentlicht. Gegenstück zu open-weight.Mehr im Wissen →TextBild (Eingabe)

Solide WahlSchnell & günstig

Schnellste und günstigste 5.6-Stufe, seit 9. Juli 2026 allgemein verfügbar – und seit dem 30. Juli 2026 um 80 Prozent verbilligt: $0,20 / $1,20 statt $1 / $6 je Million Ein-/Ausgabe-Token. Unabhängig gemessen (AA, max) solide für den Preis: AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 51, AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 71 – unter GPT-5.5 (55 / 75), aber nun zu einem Fünfundzwanzigstel des Sol-Eingabepreises und mit rund 231 Tokens/s die schnellste der drei. Die Wahl für Hochvolumen- und latenzkritische Aufgaben.

  • Hochvolumen- & latenzkritische Aufgaben
  • günstige Allzweck-Antworten
  • einfache Coding-/Agenten-Hilfen
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen →
1 Mio.TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →
Preis (Input / Output)
$0.2 / $1.2 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen →
113,3 Indexpkt. je $/Mio. Token
WissensstichtagDer Zeitpunkt, bis zu dem die Trainingsdaten eines Modells reichen („knowledge cutoff“). Über spätere Ereignisse weiß das Modell von sich aus nichts – es sei denn, sie werden ihm in der Anfrage mitgegeben.Mehr im Wissen →
nicht ausgewiesen
Release
26. Juni 2026
SicherheitsstufeAnbieter-Einstufung des Risikoniveaus eines Modells (z. B. Anthropics ASL-Stufen oder „Cyber: High“). Höhere Stufen lösen strengere Schutzmaßnahmen aus. Stammt aus der System-Card – Eigenangabe des Anbieters.Mehr im Wissen →
Bio/Chem & Cyber: High

Stärken

  • Für ihren Preis (seit 30.07.2026 $0,20 / $1,20) starke AA-Werte: Intelligenz 51, Coding 71
  • Schnellste Stufe der Familie – rund 231 Tokens/s (AA)
  • Multimodal: Text- und Bildeingabe

Schwächen

  • Geringste Fähigkeit der drei Stufen – im AA-Index unter GPT-5.5 (51 / 71 vs. 55 / 75)
  • τ²-bench (Tool-Use-Verlässlichkeit) bei AA noch nicht ausgewiesen
  • Exakte Specs (Kontextfenster, Output-Limit, Cutoff) offiziell unbestätigt

Typische Einsatzfälle

  • Hochvolumen- und latenzkritische Aufgaben
  • günstige Allzweck-Antworten
  • einfache Coding- und Agenten-Hilfen

Leistung im Vergleich

Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → oben ist daraus abgeleitet: AA-Intelligenz je AA-Blended-Preis (3:1) – entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis. AAs token-basiertes „Cost to Run Index“ ist nicht öffentlich abrufbar.

  • AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen →51
  • AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen →71
  • AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen →46
  • Terminal-BenchAusführungsbasierter Benchmark (0–100 %): das Modell löst echte Shell-/Terminal-Aufgaben in einer Sandbox, gewertet wird, ob das Ergebnis wirklich funktioniert. Dadurch kontaminationsärmer als reine Wissensquizze.Mehr im Wissen →81

Benchmarks im Detail

Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →

  • Artificial Analysis Intelligence Index

    51

    (max)

    unabhängigArtificial Analysis (API), abgerufen 2026-07-10

  • Artificial Analysis Coding Index

    71

    (max)

    unabhängigArtificial Analysis (API), abgerufen 2026-07-10

  • Artificial Analysis Agentic Index

    46

    (max)

    unabhängigArtificial Analysis (API), abgerufen 2026-08-05

  • Terminal-Bench v2.1 (agentische Shell-Aufgaben)

    81 %

    unabhängigArtificial Analysis (API), abgerufen 2026-07-10

Einordnung

  • Unabhängig gemessen (Artificial Analysis, max-Variante): Luna erreicht AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 51 und AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 71 – die günstigste 5.6-Stufe und die schnellste (≈231 Tokens/s). Unter Sol (59 / 77) und Terra (55 / 77), aber für Hochvolumen-Arbeit zum niedrigsten Preis der Familie.Beleg · Sekundärquelle
  • Standardmodell der Gratisstufe seit 06.08.2026: OpenAI hat angekündigt, dass Luna GPT-5.5 als Standard für die ChatGPT-Stufen Free und Go ablöst; in der Folgewoche kommen unbegrenzte Text-Chats und ein „Think“-Knopf hinzu, mit dem Nutzer für schwierige Fragen selbst mehr Denktiefe anfordern können. Getrennte Limits für Dateien, Bilder, Sprache und Bildgenerierung bleiben. Praktische Folge: Die größte Nutzergruppe arbeitet damit standardmäßig mit der schwächsten Stufe der Familie (AA-Intelligenz 51 / Coding 71 gegen Sol 59 / 77) – GPT-5.5 lag mit 55 / 75 darüber. ⚠️ Anbieter-selbstberichtet und unabhängig nicht reproduziert: Antworten mit sachlichen Fehlern seien bei Luna 62 Prozent seltener geworden; Messmethode und Fragenkorpus sind nicht offengelegt. OpenAIs eigener Beitrag ist für unseren Abruf gesperrt (HTTP 403), die Angaben stammen aus zwei unabhängigen Wiedergaben.Beleg · Sekundärquelle
  • Preissturz 30.07.2026: OpenAI hat Luna um 80 Prozent verbilligt – von $1 / $6 auf $0,20 / $1,20 je Million Ein-/Ausgabe-Token. Das Modell ist unverändert, die AA-Kennzahlen gelten weiter; verschoben hat sich allein die Kostenseite, und zwar erheblich: Luna ist damit die mit Abstand billigste Stufe der Familie (Terra −20 % auf $2 / $12, Sol unverändert bei $5 / $30). OpenAI begründet die Senkung mit Effizienzgewinnen, die GPT-5.6 Sol selbst erarbeitet habe – Produktions-Kernel in Triton und Gluon neu geschrieben (−20 % Servingkosten), Token-Erzeugung per spekulativem Dekodieren um über 15 Prozent verbessert. Diese Begründung ist anbieter-selbstberichtet und unabhängig nicht nachgemessen; die Preise selbst sind an zwei unabhängigen Wiedergaben geprüft.Beleg · Sekundärquelle

Aus der System-Card

Verdichtete Befunde aus der offiziellen System-CardDas offizielle Begleitdokument eines Anbieters zu einem Modell (auch „Model Card“): Fähigkeiten, Grenzen, Sicherheitsbewertung. Primärquelle – die Fähigkeitsangaben darin sind aber Eigenangaben, nicht unabhängig gemessen.Mehr im Wissen → des Anbieters (Primärquelle, Tier (A/B/C)Verlässlichkeits-Stufe einer Quelle in der KI-Depesche: A = Primärquelle (z. B. offizielle Doku), B = solide Sekundärquelle, C = subjektiv/Einzelstimme. Steuert, wie stark eine Aussage gewichtet wird.Mehr im Wissen →). Fähigkeitswerte sind Anbieterangaben – nicht unabhängig nachgemessen. Card-Stand 2026-06-25.

Fähigkeiten

  • Drei StufenLuna ist die schnellste und kosteneffizienteste der drei 5.6-Stufen (Sol/Terra/Luna) – laut OpenAI starke Fähigkeit zum niedrigsten Preis.

Verhalten & Sicherheit

  • PreparednessWie Sol und Terra als „High capability“ in Cybersicherheit und Biologie/Chemie eingestuft (angepasster Schutz-Stack); in AI-Self-Improvement unter der „High“-Schwelle. Laut Card schneiden kleinere Modelle der Familie bei Faktentreue tendenziell schwächer ab als größere.

Reines Safety-Dokument – Kontextfenster, Output-Limit, Modalitäten und Wissens-WissensstichtagDer Zeitpunkt, bis zu dem die Trainingsdaten eines Modells reichen („knowledge cutoff“). Über spätere Ereignisse weiß das Modell von sich aus nichts – es sei denn, sie werden ihm in der Anfrage mitgegeben.Mehr im Wissen → sind nicht ausgewiesen; während der Limited Preview gibt es keine offizielle API-Spec. Fähigkeits-Aussagen sind anbieter-selbstberichtet und unabhängig noch nicht nachgemessen.

OpenAI – GPT-5.6 Preview System Card (PDF)· Primärquelle, abgerufen 2026-06-27

Stimmen aus der Öffentlichkeit

Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.

  • positivIm eigenen Web-Dev-Coding-Leaderboard (5 Projekte × 5 Läufe, automatisierte unbekannte Tests) überrascht Luna medium mit 23,5/25 – bei denselben Durchschnittskosten wie GPT-5.4 mini, aber spürbar höher und schneller. Fazit: GPT-5.4 mini lasse sich „sicher durch Luna ersetzen“. Luna low (19/25) ist mit ~11 ct/Prompt das Günstigste im Board, patzt aber häufiger, sobald eine Aufgabe unklar ist – der Tester rät zu Luna medium statt low.AI Coding Daily – I Tested GPT-5.6 Luna and Terra with Low/Medium Efforts (YouTube) · Community
  • positivNach der 80-Prozent-Preissenkung hat derselbe Tester Luna erneut durch sein Leaderboard geschickt – und dabei die bis dahin nicht getestete Stufe `max` nachgereicht. Ergebnis: 9,5 von 10 und damit in seinem Board über GPT-5.6 Sol medium, bei zehn bis zwanzig Minuten je Prompt und doppelten Kosten gegenüber `high`. Im separaten Bug-Fix-Test rechnet er Luna max als 13-mal günstiger als Sol, 24-mal günstiger als Opus 5 und 31-mal günstiger als Fable 5, bei nur „hiccups here and there“ gegenüber den Flaggschiffen. Sein eigener Vorbehalt: zwei Web-Projekte (CSV-Härtung, Offline-Sync), fünf Läufe je Prompt, Unterschiede von unter einem Punkt hält er für Rauschen.AI Coding Daily – I Tested MAX Effort of GPT-5.6-Luna and Deepseek-v4-Flash (YouTube, 02.08.2026) · Community
  • neutralMethodischer Nebenbefund aus denselben Läufen, der jede Fremdmessung betrifft: Beim Vergleichsmodell DeepSeek V4 Flash maß der Tester über die Aggregatoren OpenCode Zen und OpenRouter 4,1 von 10, über die Erstanbieter-API mit derselben Aufgabe und Effort-Stufe dagegen 6,7 – die aktualisierte Fassung war über die Aggregatoren offenbar gar nicht erreichbar. Für Luna heißt das dasselbe wie für jedes Modell: Ein Punktestand ohne Angabe von Zugangsweg und Effort-Stufe ist keine belastbare Größe.AI Coding Daily – I Re-Tested GPT-5.6-Luna and Deepseek-v4-Flash (New Benchmarks) (YouTube, 01.08.2026) · Community

ℹ️ Schnellste/günstigste Stufe der GPT-5.6-Familie, seit 9. Juli 2026 allgemein verfügbar. AA-Kennzahlen (Intelligence/Coding-Index, Terminal-Bench v2.1) am 2026-07-10 gegen die AA-API abgeglichen (max-Variante = AA-Default, das `verify-bench` prüft) und als `kennzahlen`/`benchmarks` gesetzt; `geprueft` gesetzt. τ²-bench bei AA für Luna noch nicht ausgewiesen. Preise am 2026-07-31 auf die Senkung vom 30.07.2026 gezogen: $0,20 / $1,20 statt $1 / $6 (−80 %); alter Stand war über AA bestätigt, der neue über zwei unabhängige Wiedergaben (OpenAI-Beitrag HTTP 403). Kontextfenster konservativ aus GPT-5.5 übernommen (offiziell unbestätigt). Erste unabhängige Stimme ergänzt (2026-07-11, Tier C: AI Coding Daily) – deren Kosten-je-Prompt-Angaben beziehen sich auf den alten Preis. Offen: LMArena-Elo, τ²-bench; AA-Preisfeld beim nächsten `verify-bench` gegenprüfen.