OpenAI · GPT
GPT-5.6 Luna
Solide WahlSchnell & günstig
- Hochvolumen- & latenzkritische Aufgaben
- günstige Allzweck-Antworten
- einfache Coding-/Agenten-Hilfen
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen → - 1 Mio.
TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen → - Preis (Input / Output)
- $0.2 / $1.2 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → - 113,3 Indexpkt. je $/Mio. Token
WissensstichtagDer Zeitpunkt, bis zu dem die Trainingsdaten eines Modells reichen („knowledge cutoff“). Über spätere Ereignisse weiß das Modell von sich aus nichts – es sei denn, sie werden ihm in der Anfrage mitgegeben.Mehr im Wissen → - nicht ausgewiesen
- Release
- 26. Juni 2026
SicherheitsstufeAnbieter-Einstufung des Risikoniveaus eines Modells (z. B. Anthropics ASL-Stufen oder „Cyber: High“). Höhere Stufen lösen strengere Schutzmaßnahmen aus. Stammt aus der System-Card – Eigenangabe des Anbieters.Mehr im Wissen → - Bio/Chem & Cyber: High
Stärken
Für ihren Preis (seit 30.07.2026 $0,20 / $1,20) starke AA-Werte: Intelligenz 51, Coding 71 Schnellste Stufe der Familie – rund 231 Tokens/s (AA) Multimodal: Text- und Bildeingabe
Schwächen
Geringste Fähigkeit der drei Stufen – im AA-Index unter GPT-5.5 (51 / 71 vs. 55 / 75) τ²-bench (Tool-Use-Verlässlichkeit) bei AA noch nicht ausgewiesen Exakte Specs (Kontextfenster, Output-Limit, Cutoff) offiziell unbestätigt
Typische Einsatzfälle
Hochvolumen- und latenzkritische Aufgaben günstige Allzweck-Antworten einfache Coding- und Agenten-Hilfen
Leistung im Vergleich
Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die
AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 51AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 71AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen → 46Terminal-BenchAusführungsbasierter Benchmark (0–100 %): das Modell löst echte Shell-/Terminal-Aufgaben in einer Sandbox, gewertet wird, ob das Ergebnis wirklich funktioniert. Dadurch kontaminationsärmer als reine Wissensquizze.Mehr im Wissen → 81
Benchmarks im Detail
Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →
Artificial Analysis Intelligence Index
51
(max)
unabhängigArtificial Analysis (API), abgerufen 2026-07-10
Artificial Analysis Coding Index
71
(max)
unabhängigArtificial Analysis (API), abgerufen 2026-07-10
Artificial Analysis Agentic Index
46
(max)
unabhängigArtificial Analysis (API), abgerufen 2026-08-05
Terminal-Bench v2.1 (agentische Shell-Aufgaben)
81 %
unabhängigArtificial Analysis (API), abgerufen 2026-07-10
Einordnung
Unabhängig gemessen (Artificial Analysis, max-Variante): Luna erreicht Beleg · SekundärquelleAA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 51 undAA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 71 – die günstigste 5.6-Stufe und die schnellste (≈231 Tokens/s). Unter Sol (59 / 77) und Terra (55 / 77), aber für Hochvolumen-Arbeit zum niedrigsten Preis der Familie.Standardmodell der Gratisstufe seit 06.08.2026: OpenAI hat angekündigt, dass Luna GPT-5.5 als Standard für die ChatGPT-Stufen Free und Go ablöst; in der Folgewoche kommen unbegrenzte Text-Chats und ein „Think“-Knopf hinzu, mit dem Nutzer für schwierige Fragen selbst mehr Denktiefe anfordern können. Getrennte Limits für Dateien, Bilder, Sprache und Bildgenerierung bleiben. Praktische Folge: Die größte Nutzergruppe arbeitet damit standardmäßig mit der schwächsten Stufe der Familie (AA-Intelligenz 51 / Coding 71 gegen Sol 59 / 77) – GPT-5.5 lag mit 55 / 75 darüber. ⚠️ Anbieter-selbstberichtet und unabhängig nicht reproduziert: Antworten mit sachlichen Fehlern seien bei Luna 62 Prozent seltener geworden; Messmethode und Fragenkorpus sind nicht offengelegt. OpenAIs eigener Beitrag ist für unseren Abruf gesperrt (HTTP 403), die Angaben stammen aus zwei unabhängigen Wiedergaben. Beleg · SekundärquellePreissturz 30.07.2026: OpenAI hat Luna um 80 Prozent verbilligt – von $1 / $6 auf $0,20 / $1,20 je Million Ein-/Ausgabe-Token. Das Modell ist unverändert, die AA-Kennzahlen gelten weiter; verschoben hat sich allein die Kostenseite, und zwar erheblich: Luna ist damit die mit Abstand billigste Stufe der Familie (Terra −20 % auf $2 / $12, Sol unverändert bei $5 / $30). OpenAI begründet die Senkung mit Effizienzgewinnen, die GPT-5.6 Sol selbst erarbeitet habe – Produktions-Kernel in Triton und Gluon neu geschrieben (−20 % Servingkosten), Token-Erzeugung per spekulativem Dekodieren um über 15 Prozent verbessert. Diese Begründung ist anbieter-selbstberichtet und unabhängig nicht nachgemessen; die Preise selbst sind an zwei unabhängigen Wiedergaben geprüft. Beleg · Sekundärquelle
Aus der System-Card
Verdichtete Befunde aus der offiziellen
Fähigkeiten
- Drei Stufen –
Luna ist die schnellste und kosteneffizienteste der drei 5.6-Stufen (Sol/Terra/Luna) – laut OpenAI starke Fähigkeit zum niedrigsten Preis.
Verhalten & Sicherheit
- Preparedness –
Wie Sol und Terra als „High capability“ in Cybersicherheit und Biologie/Chemie eingestuft (angepasster Schutz-Stack); in AI-Self-Improvement unter der „High“-Schwelle. Laut Card schneiden kleinere Modelle der Familie bei Faktentreue tendenziell schwächer ab als größere.
OpenAI – GPT-5.6 Preview System Card (PDF)· Primärquelle, abgerufen 2026-06-27
Stimmen aus der Öffentlichkeit
Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.
- positivIm eigenen Web-Dev-Coding-Leaderboard (5 Projekte × 5 Läufe, automatisierte unbekannte Tests) überrascht Luna medium mit 23,5/25 – bei denselben Durchschnittskosten wie GPT-5.4 mini, aber spürbar höher und schneller. Fazit: GPT-5.4 mini lasse sich „sicher durch Luna ersetzen“. Luna low (19/25) ist mit ~11 ct/Prompt das Günstigste im Board, patzt aber häufiger, sobald eine Aufgabe unklar ist – der Tester rät zu Luna medium statt low.AI Coding Daily – I Tested GPT-5.6 Luna and Terra with Low/Medium Efforts (YouTube) · Community
- positivNach der 80-Prozent-Preissenkung hat derselbe Tester Luna erneut durch sein Leaderboard geschickt – und dabei die bis dahin nicht getestete Stufe `max` nachgereicht. Ergebnis: 9,5 von 10 und damit in seinem Board über GPT-5.6 Sol medium, bei zehn bis zwanzig Minuten je Prompt und doppelten Kosten gegenüber `high`. Im separaten Bug-Fix-Test rechnet er Luna max als 13-mal günstiger als Sol, 24-mal günstiger als Opus 5 und 31-mal günstiger als Fable 5, bei nur „hiccups here and there“ gegenüber den Flaggschiffen. Sein eigener Vorbehalt: zwei Web-Projekte (CSV-Härtung, Offline-Sync), fünf Läufe je Prompt, Unterschiede von unter einem Punkt hält er für Rauschen.AI Coding Daily – I Tested MAX Effort of GPT-5.6-Luna and Deepseek-v4-Flash (YouTube, 02.08.2026) · Community
- neutralMethodischer Nebenbefund aus denselben Läufen, der jede Fremdmessung betrifft: Beim Vergleichsmodell DeepSeek V4 Flash maß der Tester über die Aggregatoren OpenCode Zen und OpenRouter 4,1 von 10, über die Erstanbieter-API mit derselben Aufgabe und Effort-Stufe dagegen 6,7 – die aktualisierte Fassung war über die Aggregatoren offenbar gar nicht erreichbar. Für Luna heißt das dasselbe wie für jedes Modell: Ein Punktestand ohne Angabe von Zugangsweg und Effort-Stufe ist keine belastbare Größe.AI Coding Daily – I Re-Tested GPT-5.6-Luna and Deepseek-v4-Flash (New Benchmarks) (YouTube, 01.08.2026) · Community
ℹ️