Zielgruppe: Entwickler, Product Owner und IT-Leiter, die seit dem 8. Juli 2026 den vollständigen GPT-5.6-Zugang erhalten haben — Sol, Terra und Luna sind nicht mehr waitlist-gebunden, aber die Stufenwahl bleibt unklar. Fazit: «Vollständig offen» bedeutet nicht «alles auf Sol» — Terra deckt 70 % des Tages-Traffics ab, Luna senkt Routing-Kosten, Sol bleibt für Agent-Sprints reserviert; alle drei Stufen zuerst auf isoliertem Mac benchmarken. Struktur: GA-Überblick, drei GA-Fallen, Sol/Terra/Luna-Performance-Matrix, Spec-Vergleichstabelle, sechs Rollout-Schritte, zitierbare Kennzahlen und Kaufpfad.
Inhaltsverzeichnis
- Was «vollständig offen» im Juli 2026 konkret bedeutet
- Drei GA-Fallen nach dem Stufen-Unlock
- Sol, Terra, Luna: Performance-Highlights im Überblick
- Entscheidungsmatrix: Welche Stufe für welchen Workload?
- Technische Spezifikationen und Preisanker
- Sechs Schritte: GA-Rollout sicher konfigurieren
- Zitierbare Kennzahlen
- Fazit und Kaufpfad
GPT-5.6 vollständig offen: GA-Status ab 8. Juli 2026
Am 8. Juli 2026 hat OpenAI die letzte Waitlist-Stufe aufgehoben: Sol, Terra und Luna stehen nun allen zahlenden API-Kunden, ChatGPT-Plus/Pro-Abonnenten und Codex-CLI-Nutzern zur Verfügung. Die Benennung folgt einem Himmelskörper-Schema — Sol (Sonne) als Flagship, Terra (Erde) als ausgewogene Alltagsstufe, Luna (Mond) als Speed- und Kostenstufe.
Der GA-Sprung bringt drei praktische Neuerungen: 1,5M-Token-Kontext für Sol und Terra (mit Alignment-Fix aus dem Juni-Release), Ultra-Sub-Agent-Modus exklusiv für Sol und ein neues Smart-Routing-API-Flag, das Luna automatisch für einfache Anfragen vorscreenen kann. ChatGPT-Pro-Nutzer sehen im Modell-Dropdown alle drei Stufen; API-Kunden wählen per Model-ID (gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna).
Sol · Flagship-Reasoning und Agent-Sprints
Exklusives max reasoning, Ultra-Sub-Agents und Terminal-Bench-Score 91,9 %. Cerebras-Deployments liefern bis 750 tok/s. Für 50+-Turn-Planung, Security-Audits und Deep-Debugging — höchste Kosten pro Token.
Terra · Standard für Coding und Review
GPT-5.5-Klasse bei ca. 50 % der Sol-Kosten. SWE-bench Verified 54,9 %, 1,5M Kontext, Memory 2.0. OpenAI empfiehlt Terra als Default für 70 % des Produktions-Traffics nach GA.
Luna · Speed, Routing und Batch
Schnellste Stufe: p50-Latenz 180 ms bei Standard-Prompts. Ideal für Intent-Klassifikation, Lint-Vorschläge und Agent-Vorscreening. Ersetzt Sol-Reasoning nicht — senkt aber USD/Task um bis zu 80 %.
Drei GA-Fallen, wenn Teams nach «vollständig offen» alles auf Sol umstellen
- GA-Hype → Sol-only-Default: Sol-Output kostet 30 USD/M Token. Ultra-Sub-Agents stapeln Abrechnungen über parallele Agent-Spawns. Wer nach GA sofort den gesamten Stack auf Sol migriert, kann Monatskosten 5–8× über Terra treiben — ohne messbaren Qualitätsgewinn bei Lint und Routing.
- ChatGPT-Dropdown mit API-Routing verwechseln: ChatGPT-Pro zeigt alle drei Stufen, aber die API hat separate Rate-Limits pro Stufe. Luna hat 500 RPM, Terra 300 RPM, Sol 120 RPM in Woche eins nach GA. Produktions-Router ohne Limit-Mapping erzeugen 429-Stürme.
- GA-Tests auf dem Daily Driver: Sol Ultra mit Computer-Use und Browser-Hooks erfordert Sandbox-Umgebungen. Wer GA-Features sofort auf Firmen-Laptops mit Git-Credentials aktiviert, exponiert API-Keys — ein dedizierter Remote-Mac-Knoten ist Pflicht, nicht optional.
Sol, Terra, Luna: Performance-Highlights nach GA-Freigabe
Die drei Stufen bilden kein lineares Upgrade, sondern ein geschichtetes System. Nach dem GA-Unlock am 8. Juli zeigen interne und öffentliche Benchmarks folgende Kernunterschiede:
| Highlight | Sol | Terra | Luna |
|---|---|---|---|
| SWE-bench Verified (Juli 2026) | 58,1 % | 54,9 % | Routing-tauglich |
| Max. Kontext | 1,5M Token | 1,5M Token | ~128K Token |
| Ultra-Sub-Agents | Ja (bis 6 parallel) | Nein | Nein |
| Output-Geschwindigkeit (p50) | 320 tok/s (Standard) | 280 tok/s | 420 tok/s |
| Memory 2.0 (Session-Persistenz) | 48 h (Beta) | 48 h (Beta) | Nein |
| Empfohlener Traffic-Anteil | ~10 % | ~70 % | ~20 % |
Sofortiger Voll-Rollout auf Sol
Spitzenqualität bei Agent-Sprints, aber unvorhersehbare USD/erfolgreicher-Task durch Ultra-Sub-Agents. GA-Woche-eins-Rate-Limits (120 RPM) bremsen parallele CI-Pipelines ohne Fallback-Router.
Terra primär + Luna-Vorscreen + Sol-Sprints (empfohlen)
70 % Terra täglich, 20 % Luna-Routing, 10 % Sol für harte Probleme. Dedizierten M4 mieten, identischen Harness über alle drei Stufen fahren, Verhältnisse aus USD/Pass-Rate-Logs tunen — siehe den Stufen-Routing-Leitfaden.
Entscheidungsmatrix: Welche GPT-5.6-Stufe nach GA für Ihren Workload?
| Workload | Empfohlene Stufe | Kernnutzen nach GA | Vermeiden |
|---|---|---|---|
| 50+-Turn-Agent-Planung | Sol + Ultra | Sub-Agent-Parallelität, max reasoning | Terra / Luna |
| Tägliches Coding und PR-Review | Terra | ≈ GPT-5.5-Qualität, halbe Sol-Kosten | Alles Sol |
| 1,5M-Token-Repo-Analyse | Terra oder Sol | Long Window + Alignment-Fix | Luna |
| Intent-Routing / Batch-Klassifikation | Luna | Niedrigste USD/Request, 420 tok/s | Sol |
| Enterprise-Kostenoptimierung | Terra + Luna-Hybrid | 40 % Einsparung vs. Sol-only | Sol für Routine-Tasks |
| Compliance / Offline-Segmente | Lokaler MLX-Fallback | Zero Egress auf M4 | Beliebige Cloud-Stufe |
Technische Spezifikationen: API-Preise und Limits nach GA
| Spezifikation | Sol | Terra | Luna |
|---|---|---|---|
| API-Preis Input/Output (USD/M Token) | 5 / 30 | 2,50 / 15 | 1 / 6 |
| GA-Woche-eins Rate-Limit (RPM) | 120 | 300 | 500 |
| ChatGPT-Pro verfügbar | Ja | Ja (Default) | Ja |
| Codex-CLI Integration | Ja + Ultra | Ja | Routing-only |
Sechs Schritte: GPT-5.6-GA-Rollout sicher konfigurieren
- Stufenzugang und Rate-Limits prüfen: Ob Ihre Organisation alle drei Model-IDs sieht. Sol Ultra kann separaten Antrag erfordern. Siehe den OpenAI-Juli-Rundown.
- Drei Benchmark-Task-Typen fixieren: lange Agent-Läufe (Sol), tägliches PR-Review (Terra), Batch-Routing (Luna) — abgestimmt mit dem Launch-Fenster-Leitfaden.
- Isolierten Mac-Knoten bereitstellen: Per SSH in M4, Cursor, Codex CLI und Ollama/MLX-Fallback gemäß Remote-Dev-Anleitung installieren.
- Paralleles A/B über alle drei Stufen: Gleiche 10 Produktions-Prompts auf Sol, Terra und Luna. p95-Latenz, Pass-Rate und USD/erfolgreicher Task loggen.
- Smart Routing konfigurieren: Luna für einfache Tasks; bei niedriger Konfidenz Eskalation zu Terra. Nur die «Sprint»-Queue nutzt Sol Ultra — Smart-Routing-Flag in der API aktivieren.
- GA-Rollout-Memo veröffentlichen: Stufenverhältnisse (70/20/10), Budget-Caps, Rate-Limit-Fallback und Re-Test-Datum ins Team-Wiki — nicht im Bauchgefühl eines Engineers.
Zitierbare Kennzahlen: GPT-5.6 GA Juli 2026
Fazit: GA bedeutet Stufen-Routing — nicht Sol-only
Mit GPT-5.6 am 8. Juli 2026 vollständig offen sind Sol, Terra und Luna für alle zahlenden Nutzer verfügbar. Die Performance-Highlights sind klar: Sol für Agent-Sprints und max reasoning, Terra als kosteneffizienter Alltags-Default, Luna für Speed und Vorscreening. Doch «vollständig offen» rechtfertigt keinen pauschalen Sol-Umschalt — das 70/20/10-Verhältnis (Terra/Luna/Sol) schützt API-Budgets besser als GA-Hype.
Paralleles A/B auf isoliertem Mac-Testbed — mit USD/erfolgreicher-Task-Logs — liefert die Entscheidungsbasis, die OpenAIs Release-Kadenz allein nicht bietet. Lokaler MLX-Fallback auf M4 hält CI während GA-Woche-eins-Rate-Limits am Laufen.
Kaufpfad in fünf Schritten: ① GA-Matrix und Stufenverhältnis 70/20/10 setzen → ② Preise & Knoten, M4 mit 16 GB+ RAM wählen → ③ Mac jetzt mieten, per SSH am selben Tag → ④ Drei-Stufen-A/B plus MLX-Fallback nur auf Miet-Mac → ⑤ Monat vier Utilization gegen 106,9 USD/Monat und API-Rechnung abgleichen. FAQ: Mac-mini-Miete-FAQ; mehr unter Technik-Insights und der Startseite.
GPT-5.6 GA: Sol, Terra, Luna auf isoliertem M4 benchmarken — bevor Sie Produktion umstellen
16-GB-/24-GB-Stufen, SSH und VNC ab Tag eins. Parallele Sol-, Terra-, Luna- und MLX-Fallback-Tests — Produktions-Routing erst ändern, wenn USD/Task-Logs ROI beweisen.