OpenAI · GPT
GPT-5.6 Terra
Solide WahlPreis-Leistungs-Tipp
- kostenbewusste Allzweck-Aufgaben
- agentische Workflows
- Coding fast auf Flaggschiff-Niveau zum halben Preis
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen → - 1 Mio.
TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen → - Preis (Input / Output)
- $2 / $12 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → - 12,2 Indexpkt. je $/Mio. Token
WissensstichtagDer Zeitpunkt, bis zu dem die Trainingsdaten eines Modells reichen („knowledge cutoff“). Über spätere Ereignisse weiß das Modell von sich aus nichts – es sei denn, sie werden ihm in der Anfrage mitgegeben.Mehr im Wissen → - nicht ausgewiesen
- Release
- 26. Juni 2026
SicherheitsstufeAnbieter-Einstufung des Risikoniveaus eines Modells (z. B. Anthropics ASL-Stufen oder „Cyber: High“). Höhere Stufen lösen strengere Schutzmaßnahmen aus. Stammt aus der System-Card – Eigenangabe des Anbieters.Mehr im Wissen → - Bio/Chem & Cyber: High
Stärken
Erreicht GPT-5.5 im AA-Index (Intelligenz 55, Coding 77 – leicht darüber) zu einem Bruchteil des Preises (seit 30.07.2026 $2 / $12) Starke Agentik: Terminal-Bench v2.1 88 %, τ²-bench 86 % (AA) Multimodal: Text- und Bildeingabe
Schwächen
Bei Allzweck-Intelligenz unter dem Flaggschiff Sol (55 vs. 59) Exakte Specs (Kontextfenster, Output-Limit, Cutoff) offiziell unbestätigt
Typische Einsatzfälle
Allzweck-Alltagsarbeit agentische Workflows kostenbewusstes Coding
Leistung im Vergleich
Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die
AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 55AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 77AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen → 47Terminal-BenchAusführungsbasierter Benchmark (0–100 %): das Modell löst echte Shell-/Terminal-Aufgaben in einer Sandbox, gewertet wird, ob das Ergebnis wirklich funktioniert. Dadurch kontaminationsärmer als reine Wissensquizze.Mehr im Wissen → 88τ²-benchBenchmark für die Verlässlichkeit beim Werkzeug-Einsatz: dieselbe Aufgabe wird viele Male wiederholt, gemessen wird, wie konstant das Modell die Tools korrekt bedient (0–100 %).Mehr im Wissen → 86
Benchmarks im Detail
Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →
Artificial Analysis Intelligence Index
55
(max)
unabhängigArtificial Analysis (API), abgerufen 2026-07-10
Artificial Analysis Coding Index
77
(max)
unabhängigArtificial Analysis (API), abgerufen 2026-07-10
Artificial Analysis Agentic Index
47
(max)
unabhängigArtificial Analysis (API), abgerufen 2026-08-05
Terminal-Bench v2.1 (agentische Shell-Aufgaben)
88 %
unabhängigArtificial Analysis (API), abgerufen 2026-07-10
τ²-bench (Tool-Use-Verlässlichkeit)
86 %
unabhängigArtificial Analysis (API), abgerufen 2026-07-10
Einordnung
Unabhängig gemessen (Artificial Analysis, max-Variante): Terra erreicht Beleg · SekundärquelleAA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 55 undAA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 77 – gleichauf mit GPT-5.5 bei Intelligenz (55) und leicht darüber beim Coding (75), zu einem Bruchteil des Preises. Die mittlere Stufe zwischen Sol (59 / 77) und Luna (51 / 71); beim Coding praktisch auf Sol-Niveau.Preissenkung 30.07.2026: OpenAI hat Terra um 20 Prozent verbilligt – von $2,50 / $15 auf $2 / $12 je Million Ein-/Ausgabe-Token. Das Modell selbst ist unverändert, die AA-Kennzahlen gelten weiter; nur das Preis-Leistungs-Verhältnis verbessert sich. Deutlich stärker fiel die Senkung bei der kleinen Schwester Luna aus (−80 Prozent), das Flaggschiff Sol blieb unverändert – die Spanne innerhalb der Familie wächst damit auf Faktor 25 beim Eingabe-Preis. Beleg · Sekundärquelle
Aus der System-Card
Verdichtete Befunde aus der offiziellen
Fähigkeiten
- Drei Stufen –
Terra ist die mittlere von drei 5.6-Stufen (Sol/Terra/Luna) – laut OpenAI eine leistungsfähige, kostengünstigere Option mit zu GPT-5.5 vergleichbarer Leistung. - Cybersicherheit –
Laut Card finden Sol und Terra Schwachstellen und Exploit-Bausteine, führten aber keine autonomen End-to-End-Angriffe gegen gehärtete Ziele durch – unter der „Critical“-Schwelle.
Verhalten & Sicherheit
- Preparedness –
Als „High capability“ in Cybersicherheit und Biologie/Chemie eingestuft (angepasster Schutz-Stack); in AI-Self-Improvement unter der „High“-Schwelle. - Refusal –
Unzulässige Ausgaben bleiben auf produktionsnahem Traffic sehr selten; der Start wird vom nach Anbieterangabe „bisher robustesten“ Sicherheits-Stack begleitet.
OpenAI – GPT-5.6 Preview System Card (PDF)· Primärquelle, abgerufen 2026-06-27
Stimmen aus der Öffentlichkeit
Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.
- gemischtIm eigenen Coding-Leaderboard (5 Web-Dev-Projekte × 5 Läufe, automatisierte unbekannte Tests; Laravel/PHP + React/TS) landet Terra medium bei 24/25 – praktisch auf dem Niveau von GPT-5.5 medium und Opus 4.8 medium und bei ähnlicher Laufzeit wie GPT-5.5, jedoch deutlich teurer pro Prompt als Luna. Fazit des Testers: für Alltagsaufgaben sei der große Aufpreis gegenüber Luna fraglich.AI Coding Daily – I Tested GPT-5.6 Luna and Terra with Low/Medium Efforts (YouTube) · Community
ℹ️