2026 Mac mini M5 vs M4: lokale KI-Performance, Memory-Bandwidth und reale Speed-Tests

Zielgruppe: Teams, die LLMs lokal auf Apple Silicon betreiben (MLX, llama.cpp, Ollama) und entscheiden müssen, ob M5-Bandbreite den Kauf oder das Warten rechtfertigt. Fazit: Für die meisten 7B–32B-Workloads entscheidet Unified Memory und stabile tok/s-Messung mehr als der Chip-Name; ohne bestellbare M5-SKU ist Remote-M4 die prüfbare Baseline. Struktur: drei Bottlenecks, Spec-/Speed-Tabellen, Entscheidungsmatrix, sechs Schritte, zitierbare Anker und Kaufpfad.

Inhaltsverzeichnis

Drei Bottlenecks, die «M5 ist schneller» oft verdecken

Deutsche Reviews verlangen messbare tok/s, Peak-Bandbreite und Stabilität über 30 Minuten — nicht Keynote-Folien. Stand August 2026 bleibt Mac mini M4 der einzige retail-kaufbare und sofort mietbare Apple-Silicon-Knoten für lokale Inference. Mehr zum Preis-Leistungs-Fokus: M4 vs M5 lokale Inferenz.

1. Memory-Bandbreite ≠ freier RAM

Bandwidth bestimmt, wie schnell Gewichte und KV-Cache nachgeladen werden. Fehlt Unified Memory für Kontext und Batch, helfen höhere GB/s nicht — das Modell swapped oder bricht ab.

2. Peak-tok/s ≠ reproduzierbare Last

Kurzbenchmarks mit leerem Kontext überzeichnen. Real zählen Prompt-Länge, Quantisierung (Q4/Q5/Q8), parallele Sessions und Thermal-Throttling nach 10–20 Minuten.

3. Sicherheit und Isolation

Kundenrepos, API-Keys und Modell-Caches gehören nicht neben Mail und Browser. Dedizierter Knoten mit SSH-Keys, Firewall und Session-Logs senkt Audit-Risiko — siehe SSH/VNC-Anleitung.

Regel: Erst denselben Prompt auf M4 messen (tok/s, RAM-Peak, Temperatur), dann M5-Leaks gegen diese Baseline legen — nie umgekehrt.

Spec-Vergleich: Memory-Bandwidth, RAM und NPU (August 2026)

Tabelle 1 fasst prüfbare und erwartete Parameter zusammen. Werte für M5 sind Leak-/Erwartungskorridor und ersetzen keine Apple-Produktseite. Tabelle 2 darunter mappt Workloads auf den relevanten Bottleneck.

Kennzahl Mac mini M4 (messbar) Mac mini M5 (erwartet) Relevanz lokale KI
Memory-Bandwidth ca. 120 GB/s (Basis) Leak-Korridor oft +15–40 % tok/s bei großen Gewichten
Unified Memory (typisch) 16 / 24 / 32 GB kauf-/mietbar Unklar bis SKU; High-RAM oft Queue Kontext + Batch + OS
Neural Engine / NPU Stark für On-Device-ML Erwartet höher; Stack-abhängig Nur wenn Runtime NPU nutzt
Bestellbarkeit / Zugang Retail + Cloud SSH/VNC Tag 1 Keine offizielle Mini-SKU M4 ist der einzige Sofort-Pfad
Stabilität unter Dauerlast Dedizierter Knoten: reproduzierbar Unbekannt bis Field-Tests 30-Min-tok/s wichtiger als Peak
Workload Primärer Bottleneck M4 heute Auf M5 warten?
7B–13B Q4 Chat / Agent RAM + Runtime 16–24 GB ausreichend Nein — Bandwidth-Gewinn marginal
32B Q4 / langer Kontext RAM-Kapazität 24–32 GB prüfen Nur wenn SKU + mehr RAM sicher
Parallele Evals / CI + LLM Isolation + Thermik Dedizierter Mini empfohlen Nein — Isolation vor Generation
«Max tok/s um jeden Preis» Bandwidth + Kühlung Baseline messen Ja, nach SKU und Field-Bench

Reale Speed-Tests und Entscheidungsmatrix

Definieren Sie einen Golden Prompt (feste Tokens, Temperatur 0, gleiche Quantisierung). Messen Sie Prefill und Decode getrennt. Typische M4-Orientierungswerte unter MLX/llama.cpp: 7B-Q4 oft zweistellige bis niedrige dreistellige tok/s Decode; 32B-Q4 deutlich niedriger und RAM-kritisch. M5-Leaks ohne identische Runtime sind keine Entscheidungsgrundlage.

Nur Specs / Leaks

«+30 % Bandwidth» ohne tok/s, ohne 30-Min-Kurve, ohne RAM-Peak. Beschaffung wird spekulativ; CI und Agent-Loops stehen still.

Messung + Miete (empfohlen)

Gleicher Prompt auf Remote-M4, Zahlen dokumentieren, Deadline halten. M5 erst nach SKU und eigenem Nachtest kaufen oder upgraden.

Situation Empfehlung Begründung
Deadline ≤ 60 Tage, 7B–13B M4 mieten / nutzen Sofort SSH; Bandwidth-Delta irrelevant
RAM-Peak > 80 % auf 16 GB 24 GB M4, nicht «warten auf M5» Kapazität vor GB/s
M5-SKU + Lieferwoche bekannt Field-Bench vs. M4-Baseline Kauf nur bei ≥15 % tok/s oder mehr RAM
Secrets / Kundenmodell lokal Dedizierter Knoten jetzt Audit vor Chip-Generation

Sechs Schritte: von Peak-Marketing zu einer Chip-Entscheidung

  1. Workload fixieren. Modellgröße, Quantisierung, max. Kontext, parallele Sessions. Ohne diese vier Felder ist «M5 vs M4» nicht entscheidbar.
  2. Golden Prompt und Metrik wählen. Prefill-Zeit, Decode-tok/s, RAM-Peak, GPU/ANE-Anteil falls sichtbar. Eine Zahl reicht für Reviews nicht.
  3. M4-Baseline auf isoliertem Knoten. Unter Preise & Knoten 16 oder 24 GB wählen, per Mac jetzt mieten starten, SSH laut SSH/VNC-Anleitung.
  4. 30-Minuten-Dauerlauf. tok/s nach Minute 1, 10 und 30 notieren. Throttling >15 % → Kühlung/Last teilen, nicht Generation wechseln.
  5. M5 nur mit SKU und Lieferwoche bewerten. Medien-«Herbst» zählt nicht. Details: reale Lieferzeit M5.
  6. Kauf oder Verlängerung. Liegt der gemessene Nutzen unter Ihrer Schwelle (z. B. 15 % tok/s), verlängern Sie die Miete. Keine versunkenen Hardwarekosten.

Zitierbare Anker für Reviews und Planung

  • Bandwidth-Anker M4: Basis-Mac-mini-M4 liegt typisch bei ca. 120 GB/s Memory-Bandwidth — die relevante Größe für Gewichts-Streaming bei lokaler Inference.
  • Messprotokoll: Gleicher Prompt, gleiche Quantisierung, Prefill und Decode getrennt, plus tok/s bei Minute 1 / 10 / 30 gegen Thermal-Throttling.
  • RAM vor GB/s: Steigt der RAM-Peak über ca. 80 % der Kapazität, priorisieren Sie 24/32 GB M4 statt Spekulation auf M5-Bandbreite.
  • Cloud-Baseline MacPng: physischer Mac mini M4 ab ca. 106,9 USD/Monat, 16 GB oder 24 GB, SSH/VNC am selben Tag — dedizierter Knoten für reproduzierbare Speed-Tests.
  • Sicherheitsanker: Modell-Caches und Kundenprompts bleiben hinter Ihren Keys und Ihrer Firewall; Daily Driver bleibt frei von Inference-Last.

Fazit: Bandwidth messen — Pipeline nicht stoppen

Mac mini M5 kann Memory-Bandwidth und NPU verbessern; für lokale KI 2026 entscheiden aber Unified Memory, reproduzierbare tok/s und Isolation. Ohne bestellbare M5-SKU und ohne eigene Baseline ist «Warten auf Speed» teurer Leerlauf. Die risikoärmste Antwort: heute M4 mieten, Golden Prompt dokumentieren, und den Selbstkauf erst nach Listen-SKU und Field-Bench neu bewerten. Ergänzend: Remote-Mac-mini-M4-Leitfaden.

Kaufpfad: (1) Workload und Golden Prompt festlegen → (2) Knoten & RAM wählen → (3) Mac jetzt mieten und SSH am selben Tag → (4) 30-Min-Speed-Test mit der SSH/VNC-Anleitung → (5) M5 erst nach SKU gegen Ihre Zahlen prüfen. Mehr unter Technik-Insights und der Startseite.

Wählen Sie Ihren Mac-Knoten und Zugriff

Lokale KI-Baseline heute: M4 mieten, Bandwidth messen, dann entscheiden

Dediziertes Apple Silicon für MLX, llama.cpp und Ollama. SSH und VNC ab Tag eins. Ist M5 bestellbar und messbar schneller, verlängern oder upgraden Sie — ohne Pipeline-Stopp.

Jetzt Remote Mac mieten Knoten & Tarife ansehen SSH/VNC-Anleitung öffnen
Mac-Knoten und Zugriff wählen M4 mieten & KI-Speed testen
Mac mieten