Zielgruppe: Plattform- und Agent-Teams, die nach der GA von DeepSeek-V4-Pro (13. August 2026) OpenAI-SDKs, Codex-Schleifen oder Claude-Code-Clients auf deepseek-v4-pro umbiegen wollen. Fazit: Native Responses-API-Unterstützung senkt die Integrationskosten, ersetzt aber weder vollständige OpenAI-Parameter noch eine isolierte macOS-Laufzeit. Struktur: drei Fallen, zwei Spezifikationstabellen, Entscheidungsmatrix, sechs Schritte, zitierbare Kennzahlen, Kaufpfad.
Inhaltsverzeichnis
DeepSeek-V4-Pro GA: Responses API nativ — und die Betriebsgrenze
Mit der GA vom 13. August 2026 steht DeepSeek-V4-Pro-0813 unter der evergreen ID deepseek-v4-pro auf APP, Web und API. Der Aufruf bleibt base_url = https://api.deepseek.com. Neu ist die native Unterstützung des OpenAI-Responses-Formats (Codex-tauglich), zusätzlich zu ChatCompletions und Anthropic Messages. Kontext: 1 Million Tokens, maximale Ausgabe 384.000 Tokens. Preise laut Doku: Cache-Hit ca. 0,003625 USD / Mio. Input, Cache-Miss 0,435 USD / Mio. Input, Output 0,87 USD / Mio. Tokens. Das ist ein Ökosystem-Spiel, kein Hardware-Ersatz. Agenten, Xcode und Cursor brauchen weiterhin einen festen Apple-Silicon-Knoten — siehe GPT-5.6-Stufenvergleich.
Was nativ funktioniert
client.responses.create mit model: deepseek-v4-pro, input/instructions, Streaming, max_output_tokens, Function- und Web-Search-Tools, tool_choice.
Was nicht drop-in ist
store, background, previous_response_id, Prompt-Objekte, Truncation-Policies und Service-Tiers fehlen. Die API bleibt zustandslos; Sessions gehören auf Ihren Mac.
Drei Fallen, wenn Sie „OpenAI-kompatibel“ als SLA lesen
- Wire-Format mit Feature-Parität verwechseln: Responses-Shape (Input plus Instructions statt Messages-Array) ist nicht gleich OpenAI-Vollumfang.
reasoning.summaryundtext.verbositywerden akzeptiert, erzeugen aber keine Summaries bzw. keine Wirkung. Thinking-Modus ignorierttemperature/top_p. - Server-State mit Agent-Runtime vermengen:
storeist nicht unterstützt; Antworten tragen immerstore: false. Lange Codex-Schleifen brauchen Client-seitigen State auf isolierter Hardware — nicht DeepSeek-seitige Persistence. - Datenschutz und Audit ignorieren: Keys, Repos und Kundenkontexte gehören nicht in eine geteilte Cloud-Session. Firewall, SSH-Keys und Logs liegen auf einem dedizierten Mac mini — siehe SSH/VNC-Anleitung.
Versteckte Kosten: Retries nach 400 bei Kontextüberlauf (kein Truncation), ignorierte Tool-Typen und manuelles Nachbauen von Conversation-State. Jede Stunde Adapter-Debug übersteigt oft den Monat einer Remote-Mac-Miete.
Technische Spezifikationen: drei Formate und Responses-Lücken (Stand 13. August 2026)
Deutsche Entscheider brauchen belastbare Specs. Tabelle 1 trennt Wire-Formate; Tabelle 2 listet Responses-Parameter.
| Dimension | ChatCompletions | Anthropic Messages | Responses API |
|---|---|---|---|
| Endpunkt | POST /chat/completions | POST /v1/messages (Anthropic-Base) | POST /responses |
| SDK-Pfad | OpenAI SDK, base_url wechseln | Claude-Code / anthropic-Shape | Codex / responses.create |
| Modell-ID | deepseek-v4-pro (V4-Pro-0813) | ||
| Kontext / Max-Out | 1 Mio. Tokens / 384k Tokens | ||
| Responses-Parameter | Status | Betriebsfolge |
|---|---|---|
| input, instructions, stream, tools (function/web_search) | unterstützt / partiell | Smoke-Test vor Cutover |
| store, background, previous_response_id, prompt, truncation | nicht unterstützt | State auf Remote Mac halten |
| reasoning.effort / summary | effort ja; summary leer | UI nicht auf Summary bauen |
Entscheidungsmatrix: Drop-in, Adapter oder Remote Mac
| Szenario | Empfehlung | Begründung |
|---|---|---|
| Chat-Bot, kein Server-State | Drop-in Responses | input/instructions reichen |
| Codex/Cursor mit Tool-Loop | Adapter + Remote Mac | State, Keys, lange Sessions lokal |
| Claude-Code-Bestand | Messages-Pfad testen | nicht zwingend Responses |
| Xcode, Simulator, CI | MacPng M4 mieten | API ersetzt kein macOS |
Nur API-Switch
Günstig bei reinem Text. Bricht, sobald Store, Background oder macOS-Runner nötig sind.
API + MacPng-Knoten (empfohlen)
V4 Pro für Tokens; dedizierter M4 für Execution, SSH/VNC, Logs und parallele Evals gegen GPT-5.6.
Sechs Schritte: von der GA zur belastbaren Produktionsumgebung
- Kompatibilitätsmatrix schreiben: Jeden genutzten OpenAI-Responses-Parameter als unterstützt / partiell / fehlend markieren (offizielle Compatibility-Tabelle).
- Golden-Path-Test: Ein
responses.createmit Function-Tool und Stream gegendeepseek-v4-pro; Fehlercodes undreasoning_contentprotokollieren. - State-Schicht festlegen: Conversation-IDs und Tool-Ergebnisse im Client speichern — nicht auf
storehoffen. - Knoten wählen: Unter Preise & Knoten Region (Japan/USA) und RAM für parallele Agent-Läufe festlegen.
- Heute mieten und absichern: Über Mac jetzt mieten bestellen; per SSH/VNC Keys, Firewall, Logs. Secrets nie in der DeepSeek-Web-UI.
- Routing festschreiben: V4 Pro = Tokens; Remote Mac = Runtime. Nach 14 Tagen Latency, 400-Rate und Tool-Misses reviewen. Ergänzend: Kimi K3 vs. DeepSeek.
Zitierbare Kennzahlen (Stand 13. August 2026)
deepseek-v4-pro; APP, Web und API gleichzeitig.
store/background/previous_response_id nicht unterstützt (zustandslos).
Fazit: Responses-Kompatibilität nutzen — Runtime trotzdem mieten
Die GA von DeepSeek V4 Pro mit nativer OpenAI-Responses-API senkt die Umbaukosten für Codex-ähnliche Agenten deutlich. Sie liefert kein vollständiges OpenAI-Feature-Set und keine persistente Session. Wer nur Chat-Turne umbiegt, testet Drop-in. Wer Tool-Loops, macOS-CI und Audit braucht, kombiniert V4 Pro mit einem isolierten Mac mini M4.
Kaufpfad: ① Parameter-Matrix → ② Golden-Path-Test → ③ State auf den Client → ④ Knoten wählen → ⑤ Mac jetzt mieten und SSH am selben Tag. Weitere Insights: Technik-Insights · Startseite.
V4 Pro für Tokens — isolierter M4 für Agent-Runtime
Japan-/USA-Knoten, 16-GB-/24-GB-Stufen, SSH und VNC ab Tag eins. Responses-Adapter, Codex-Loops und Xcode auf Ihrem MacPng-Knoten — unabhängig von API-Lücken bei store und background.