Zielgruppe: Solo-Entwickler, Cursor/Codex-Nutzer und Engineering-Leads, die GPT-5.6-Zugang erhalten haben — Sol, Terra und Luna erscheinen gemeinsam, aber die Routing-Strategie ist unklar. Fazit: Im Juli sollte «Terra primär + Luna-Routing + Sol für harte Probleme» gelten, kein pauschaler Sol-Umschalt. Alle drei Stufen auf isoliertem Mac benchmarken, bevor Produktion geändert wird. Struktur: Stufenüberblick, drei Routing-Fallen, Sol/Terra/Luna-Entscheidungsmatrix, Hardware-Spec-Tabelle, sechs Rollout-Schritte, zitierbare Preisanker und Kaufpfad.
Inhaltsverzeichnis
GPT-5.6-Stufen: Sol Flagship, Terra ausgewogen, Luna schnell
OpenAI stellte GPT-5.6 Ende Juni 2026 vor und öffnete API- sowie Codex-Zugang in der ersten Juli-Woche. Die neue Benennung koppelt Generationsnummer mit Fähigkeitsstufe: Sol (Sonne) für Flagship-Arbeit, Terra (Erde) für tägliche Balance, Luna (Mond) für Geschwindigkeit und Kosten.
Sol · Flagship-Reasoning und Agent-Sprints
Exklusives max reasoning und Ultra-Sub-Agent-Modus. Für 50+-Turn-Planung, Deep-Debugging und Security-Audits. Cerebras-Deployments erreichen im Juli 750 tok/s — bei höchsten Kosten pro Token.
Terra · Standard für Coding und Review
Leistung entspricht GPT-5.5 bei ca. 50 % der Kosten. Unterstützt 1,5M-Token-Kontext mit Alignment-Fix. Etwa 70 % des Tages-Traffics hierhin routen.
Luna · Routing, Klassifikation, Batch
Schnellste und günstigste Stufe. Ideal für Intent-Routing, Lint-Vorschläge, Batch-Zusammenfassungen und Agent-Vorscreening. Ersetzt Sols Multi-Step-Reasoning nicht — senkt aber USD/Task deutlich.
Drei Routing-Fallen bei Sol-, Terra- oder Luna-Auswahl
- Alles auf Sol routen verbrennt Budget: Sol-Output kostet 30 USD/M Token. Ultra-Modus spawnt Sub-Agents mit gestapelter Abrechnung. Lint und Routing über Sol kann Monatskosten 5–8× über Terra treiben.
- Terra wie Sol behandeln: Terra fehlen Ultra-Sub-Agents und max reasoning. Komplexe Multi-Repo-Refactors über Terra erzeugen Retries, die mehr kosten als direkter Sol-Start. Siehe den Agent-Workflow-Vorbereitungs-Leitfaden.
- Luna für Long Context: Luna hat begrenzte Fenstertiefe. Ganzes-Repo-Reviews über 500K Token gehören auf Terra oder Sol. Luna klassifiziert und chunkt — trägt nicht die volle Analyse.
Sol / Terra / Luna Entscheidungsmatrix: Welche Stufe für Juli-Workloads?
Workload zur Stufe matchen. Beide Extreme vermeiden: «Teuerste = beste» und «Günstigste = ausreichend».
| Workload | Empfohlene Stufe | Kernnutzen | Vermeiden |
|---|---|---|---|
| 50+-Turn-Agent-Planung | Sol + Ultra | Sub-Agent-Parallelität, max reasoning | Terra / Luna |
| Tägliches Coding und PR-Review | Terra | ≈ GPT-5.5-Qualität, halbe Kosten | Alles Sol |
| 1,5M-Token-Repo-Analyse | Terra oder Sol | Long Window + Alignment-Fix | Luna |
| Intent-Routing / Batch-Klassifikation | Luna | Niedrigste USD/Request | Sol |
| Latenz-sensitives Copilot | Luna → Terra-Eskalation | Schnelle Luna zuerst; bei Bedarf hochstufen | Nur Sol |
| Compliance / Offline-Segmente | Lokaler MLX-Fallback | Zero Egress | Beliebige Cloud-Stufe |
Produktionsweites Sol
Spitzenqualität, aber Ultra-Sub-Agents und max reasoning machen USD/erfolgreicher-Task unvorhersehbar. Bei DeepSeek-Preissenkungen im Juli fehlen A/B-Daten für Budgetverhandlungen.
Terra primär + Luna-Routing + Sol-Sprints (empfohlen)
70 % Terra täglich, 20 % Luna-Vorscreen, 10 % Sol-Hard-Problems. Dedizierten M4 mieten, identischen Harness über alle drei Stufen fahren, Verhältnisse aus USD/Pass-Rate-Logs tunen.
Technische Spezifikationen: Sol / Terra / Luna Preise und Limits
| Spezifikation | Sol | Terra | Luna |
|---|---|---|---|
| API-Preis Input/Output (USD/M Token) | 5 / 30 | 2,50 / 15 | 1 / 6 |
| Max. Kontext | 1,5M Token | 1,5M Token | Begrenzt (~128K) |
| Ultra-Sub-Agents | Ja | Nein | Nein |
| Terminal-Bench 2.1 (Juli 2026) | 91,9 % (Sol Ultra) | ≈ GPT-5.5-Niveau | Routing-tauglich |
| Empfohlener Traffic-Anteil | ~10 % | ~70 % | ~20 % |
Sechs Schritte: GPT-5.6-Stufen-Routing im Juli konfigurieren
- API-Stufenzugang prüfen: Ob Ihre Organisation in der ersten Juli-Welle ist. Sol Ultra kann separaten Antrag erfordern. Siehe den OpenAI-Juli-Rundown.
- Drei Benchmark-Task-Typen fixieren: lange Agent-Läufe (Sol), tägliches PR-Review (Terra), Batch-Routing (Luna) — abgestimmt mit dem Launch-Fenster-Leitfaden.
- Isolierten Mac-Knoten bereitstellen: Per SSH in M4, Cursor, Codex CLI und Ollama/MLX-Fallback gemäß Remote-Dev-Anleitung installieren.
- Paralleles A/B über Stufen: Gleiche 10 Produktions-Prompts auf Sol, Terra und Luna. p95-Latenz, Pass-Rate und USD/erfolgreicher Task loggen.
- Smart Routing konfigurieren: Luna für einfache Tasks; bei niedriger Konfidenz Eskalation zu Terra. Nur die «Sprint»-Queue nutzt Sol Ultra.
- Routing-Memo veröffentlichen: Stufenverhältnisse, Budget-Caps und Re-Test-Datum ins Team-Wiki — nicht im Bauchgefühl eines Engineers.
Zitierbare Kennzahlen: GPT-5.6 Sol / Terra / Luna
Fazit: Stufen-Routing schlägt Sol-only-Default
Mit GPT-5.6 live im Juli sind Sol, Terra und Luna keine einfache Ersatzkette. Sie bilden ein geschichtetes Routing-System: Terra für Tagesarbeit, Luna für Vorscreening, Sol nur wenn max reasoning und Ultra-Sub-Agents die Kosten rechtfertigen.
Paralleles A/B auf isoliertem Mac-Testbed — mit USD/erfolgreicher-Task-Logs — schützt Juli-API-Budgets besser als OpenAIs Release-Kadenz nachzujagen. Lokaler MLX-Fallback hält CI während Rate-Limit-Wochen am Laufen. Hybrid-Math im M4-Lokal-LLM-Leitfaden.
Kaufpfad in fünf Schritten: ① Terra/Luna/Sol-Traffic-Verhältnisse aus Matrix setzen → ② Preise & Knoten, M4-Stufe mit 16 GB+ RAM wählen → ③ Mac jetzt mieten, per SSH am selben Tag → ④ Drei-Stufen-A/B plus MLX-Fallback nur auf Miet-Mac → ⑤ Monat vier Utilization gegen 106,9 USD/Monat und API-Rechnung abgleichen. FAQ: Mac-mini-Miete-FAQ; mehr unter Technik-Insights und der Startseite.
Vor Sol/Terra/Luna-Vollrollout: alle drei Stufen auf isoliertem M4 benchmarken
16-GB-/24-GB-Stufen, SSH und VNC ab Tag eins. Parallele Sol-, Terra-, Luna- und MLX-Fallback-Tests — Produktions-Routing erst ändern, wenn USD/Task-Logs ROI beweisen.