← Alle Modelle

OpenAI · GPT

GPT-5.6 Terra

proprietärModell, das nur über die API oder das Produkt des Anbieters nutzbar ist; die Gewichte werden nicht veröffentlicht. Gegenstück zu open-weight.Mehr im Wissen →TextBild (Eingabe)

Solide WahlPreis-Leistungs-Tipp

Ausgewogene Mittel-Stufe, seit 9. Juli 2026 allgemein verfügbar – und der Preis-Leistungs-Fund der Familie: unabhängig gemessen (AA, max) erreicht Terra GPT-5.5 (AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 55 = 55; AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 77 vs. 75) zu einem Bruchteil des Preises. Seit dem 30. Juli 2026 kostet Terra $2 / $12 statt $2,50 / $15 – 20 Prozent weniger. Nur beim Allzweck-Reasoning liegt das Flaggschiff Sol (59) vorn. Die runde Wahl für kostenbewusste Allzweck-, Coding- und Agenten-Arbeit.

  • kostenbewusste Allzweck-Aufgaben
  • agentische Workflows
  • Coding fast auf Flaggschiff-Niveau zum halben Preis
KontextfensterDie maximale Textmenge (in Tokens), die ein Modell pro Anfrage gleichzeitig „im Blick“ hat – Eingabe plus bisheriger Verlauf. Ist es voll, fällt Älteres aus dem Kontext.Mehr im Wissen →
1 Mio.TokenDie kleinste Verarbeitungseinheit eines Sprachmodells – ein Wortstück, kein ganzes Wort. Faustregel: rund 1.000 Tokens entsprechen grob 750 deutschen Wörtern. Preise und Kontextlängen werden in Tokens gerechnet.Mehr im Wissen →
Preis (Input / Output)
$2 / $12 je 1 Mio. Token
Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen →
12,2 Indexpkt. je $/Mio. Token
WissensstichtagDer Zeitpunkt, bis zu dem die Trainingsdaten eines Modells reichen („knowledge cutoff“). Über spätere Ereignisse weiß das Modell von sich aus nichts – es sei denn, sie werden ihm in der Anfrage mitgegeben.Mehr im Wissen →
nicht ausgewiesen
Release
26. Juni 2026
SicherheitsstufeAnbieter-Einstufung des Risikoniveaus eines Modells (z. B. Anthropics ASL-Stufen oder „Cyber: High“). Höhere Stufen lösen strengere Schutzmaßnahmen aus. Stammt aus der System-Card – Eigenangabe des Anbieters.Mehr im Wissen →
Bio/Chem & Cyber: High

Stärken

  • Erreicht GPT-5.5 im AA-Index (Intelligenz 55, Coding 77 – leicht darüber) zu einem Bruchteil des Preises (seit 30.07.2026 $2 / $12)
  • Starke Agentik: Terminal-Bench v2.1 88 %, τ²-bench 86 % (AA)
  • Multimodal: Text- und Bildeingabe

Schwächen

  • Bei Allzweck-Intelligenz unter dem Flaggschiff Sol (55 vs. 59)
  • Exakte Specs (Kontextfenster, Output-Limit, Cutoff) offiziell unbestätigt

Typische Einsatzfälle

  • Allzweck-Alltagsarbeit
  • agentische Workflows
  • kostenbewusstes Coding

Leistung im Vergleich

Unabhängige Indizes (Artificial Analysis, 0–100), zwei kontaminationsarme Einzel-Benchmarks (Terminal-Bench, agentische Shell-Aufgaben; τ²-bench, Tool-Use-Verlässlichkeit über viele Läufe) und Human-Präferenz-Elo (LMArena). Die dunkle Markierung zeigt den Bestwert im Katalog – so wird der Abstand zur Spitze sichtbar. Die Preis-LeistungHier: AA-Intelligenz geteilt durch den (3:1 gewichteten) Token-Preis – Indexpunkte je Dollar pro Mio. Tokens. Höher = mehr Leistung fürs Geld. Entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis.Mehr im Wissen → oben ist daraus abgeleitet: AA-Intelligenz je AA-Blended-Preis (3:1) – entspricht der „Intelligence vs. Price“-Sicht von Artificial Analysis. AAs token-basiertes „Cost to Run Index“ ist nicht öffentlich abrufbar.

  • AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen →55
  • AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen →77
  • AA-AgenticAgentic-Teilindex von Artificial Analysis (unabhängig, 0–100): misst, wie gut ein Modell mehrstufige, werkzeugnutzende Aufgaben eigenständig löst.Mehr im Wissen →47
  • Terminal-BenchAusführungsbasierter Benchmark (0–100 %): das Modell löst echte Shell-/Terminal-Aufgaben in einer Sandbox, gewertet wird, ob das Ergebnis wirklich funktioniert. Dadurch kontaminationsärmer als reine Wissensquizze.Mehr im Wissen →88
  • τ²-benchBenchmark für die Verlässlichkeit beim Werkzeug-Einsatz: dieselbe Aufgabe wird viele Male wiederholt, gemessen wird, wie konstant das Modell die Tools korrekt bedient (0–100 %).Mehr im Wissen →86

Benchmarks im Detail

Kennzahlen aus zitierten Messungen – unabhängige Quellen sind ausgewiesen, Anbieterangaben entsprechend markiert. Werte sind nicht über Skalen hinweg vergleichbar. Wie man Benchmark-Zahlen liest →

  • Artificial Analysis Intelligence Index

    55

    (max)

    unabhängigArtificial Analysis (API), abgerufen 2026-07-10

  • Artificial Analysis Coding Index

    77

    (max)

    unabhängigArtificial Analysis (API), abgerufen 2026-07-10

  • Artificial Analysis Agentic Index

    47

    (max)

    unabhängigArtificial Analysis (API), abgerufen 2026-08-05

  • Terminal-Bench v2.1 (agentische Shell-Aufgaben)

    88 %

    unabhängigArtificial Analysis (API), abgerufen 2026-07-10

  • τ²-bench (Tool-Use-Verlässlichkeit)

    86 %

    unabhängigArtificial Analysis (API), abgerufen 2026-07-10

Einordnung

  • Unabhängig gemessen (Artificial Analysis, max-Variante): Terra erreicht AA-IntelligenzZusammengesetzter Intelligenz-Index von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Reasoning-, Wissens- und Mathe-Benchmarks zu einer Zahl. Je höher, desto stärker das allgemeine Reasoning.Mehr im Wissen → 55 und AA-CodingCoding-Teilindex von Artificial Analysis (unabhängig, 0–100): bündelt mehrere Programmier-Benchmarks zu einem Wert für die Code-Fähigkeit eines Modells.Mehr im Wissen → 77 – gleichauf mit GPT-5.5 bei Intelligenz (55) und leicht darüber beim Coding (75), zu einem Bruchteil des Preises. Die mittlere Stufe zwischen Sol (59 / 77) und Luna (51 / 71); beim Coding praktisch auf Sol-Niveau.Beleg · Sekundärquelle
  • Preissenkung 30.07.2026: OpenAI hat Terra um 20 Prozent verbilligt – von $2,50 / $15 auf $2 / $12 je Million Ein-/Ausgabe-Token. Das Modell selbst ist unverändert, die AA-Kennzahlen gelten weiter; nur das Preis-Leistungs-Verhältnis verbessert sich. Deutlich stärker fiel die Senkung bei der kleinen Schwester Luna aus (−80 Prozent), das Flaggschiff Sol blieb unverändert – die Spanne innerhalb der Familie wächst damit auf Faktor 25 beim Eingabe-Preis.Beleg · Sekundärquelle

Aus der System-Card

Verdichtete Befunde aus der offiziellen System-CardDas offizielle Begleitdokument eines Anbieters zu einem Modell (auch „Model Card“): Fähigkeiten, Grenzen, Sicherheitsbewertung. Primärquelle – die Fähigkeitsangaben darin sind aber Eigenangaben, nicht unabhängig gemessen.Mehr im Wissen → des Anbieters (Primärquelle, Tier (A/B/C)Verlässlichkeits-Stufe einer Quelle in der KI-Depesche: A = Primärquelle (z. B. offizielle Doku), B = solide Sekundärquelle, C = subjektiv/Einzelstimme. Steuert, wie stark eine Aussage gewichtet wird.Mehr im Wissen →). Fähigkeitswerte sind Anbieterangaben – nicht unabhängig nachgemessen. Card-Stand 2026-06-25.

Fähigkeiten

  • Drei StufenTerra ist die mittlere von drei 5.6-Stufen (Sol/Terra/Luna) – laut OpenAI eine leistungsfähige, kostengünstigere Option mit zu GPT-5.5 vergleichbarer Leistung.
  • CybersicherheitLaut Card finden Sol und Terra Schwachstellen und Exploit-Bausteine, führten aber keine autonomen End-to-End-Angriffe gegen gehärtete Ziele durch – unter der „Critical“-Schwelle.

Verhalten & Sicherheit

  • PreparednessAls „High capability“ in Cybersicherheit und Biologie/Chemie eingestuft (angepasster Schutz-Stack); in AI-Self-Improvement unter der „High“-Schwelle.
  • RefusalUnzulässige Ausgaben bleiben auf produktionsnahem Traffic sehr selten; der Start wird vom nach Anbieterangabe „bisher robustesten“ Sicherheits-Stack begleitet.

Reines Safety-Dokument – Kontextfenster, Output-Limit, Modalitäten und Wissens-WissensstichtagDer Zeitpunkt, bis zu dem die Trainingsdaten eines Modells reichen („knowledge cutoff“). Über spätere Ereignisse weiß das Modell von sich aus nichts – es sei denn, sie werden ihm in der Anfrage mitgegeben.Mehr im Wissen → sind nicht ausgewiesen; während der Limited Preview gibt es keine offizielle API-Spec. Fähigkeits-Aussagen sind anbieter-selbstberichtet und unabhängig noch nicht nachgemessen.

OpenAI – GPT-5.6 Preview System Card (PDF)· Primärquelle, abgerufen 2026-06-27

Stimmen aus der Öffentlichkeit

Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.

  • gemischtIm eigenen Coding-Leaderboard (5 Web-Dev-Projekte × 5 Läufe, automatisierte unbekannte Tests; Laravel/PHP + React/TS) landet Terra medium bei 24/25 – praktisch auf dem Niveau von GPT-5.5 medium und Opus 4.8 medium und bei ähnlicher Laufzeit wie GPT-5.5, jedoch deutlich teurer pro Prompt als Luna. Fazit des Testers: für Alltagsaufgaben sei der große Aufpreis gegenüber Luna fraglich.AI Coding Daily – I Tested GPT-5.6 Luna and Terra with Low/Medium Efforts (YouTube) · Community

ℹ️ Mittlere Stufe der GPT-5.6-Familie, seit 9. Juli 2026 allgemein verfügbar. AA-Kennzahlen (Intelligence/Coding-Index, Terminal-Bench v2.1, τ²-bench) am 2026-07-10 gegen die AA-API abgeglichen (max-Variante = AA-Default, das `verify-bench` prüft) und als `kennzahlen`/`benchmarks` gesetzt; `geprueft` gesetzt. Preise am 2026-07-31 auf die Senkung vom 30.07.2026 gezogen: $2 / $12 statt $2,50 / $15 (−20 %); alter Stand war über AA bestätigt, der neue über zwei unabhängige Wiedergaben (OpenAI-Beitrag HTTP 403). Kontextfenster konservativ aus GPT-5.5 übernommen (offiziell unbestätigt). Erste unabhängige Stimme ergänzt (2026-07-11, Tier C: AI Coding Daily). Offen: LMArena-Elo; AA-Preisfeld beim nächsten `verify-bench` gegenprüfen.