Для кого: разработчики и ML-энтузиасты, которые запускают MLX, llama.cpp или Ollama на Apple Silicon и решают — ждать M5 или взять Mac mini M4 со скидкой уже сейчас. Вывод: M5 даст прирост Neural Engine, но unified memory, а не TOPS, определяет, какие модели помещаются в RAM; по долларам за полезный токен M4 на распродаже побеждает M5 для большинства локальных LLM-стеков в 2026. Ниже: три ловушки AI-железа, матрица M4 vs M5, шесть шагов развёртывания, цитируемые бенчмарки и руководство по покупке.
Содержание
Три ловушки при выборе AI-вычислений на Mac mini
- Погоня за TOPS вместо RAM: Neural Engine M4 — 38 TOPS, у M5 по слухам 45–50 TOPS. Это пиковые INT8-операции, а не число параметров модели. 7B Q4 требует ~4–5 ГБ, 13B Q4 — ~8 ГБ; KV-cache и ОС съедают остаток. M5 с 16 ГБ проигрывает M4 с 24 ГБ при смене модели.
- Бенчмарк облака на ноутбуке: llama.cpp восемь часов на MacBook Air троттлит GPU и искажает tokens/sec. Локальные LLM — на стационарном mini с охлаждением или выделенном удалённом узле по SSH на ночные batch-задачи.
- Ожидание 2× от M5: консенсус утечек — +15–20% GPU и шире Neural Engine, не удвоение. Реальный прирост MLX на 7B–13B — 10–25%. Это редко оправдывает премию $150–200, когда M4 стоит ~$499.
Контекст кремния: гид M4 vs M5 по архитектуре, M4 со скидкой vs ожидание M5 и active-memory MLX на удалённом Mac.
Матрица AI-вычислений M4 vs M5
Используйте таблицу до предзаказа M5 или переплаты за Pro-прошлое поколение.
| Фактор | Mac mini M4 | Mac mini M5 (оценка) | Вердикт для LLM |
|---|---|---|---|
| Neural Engine | 38 TOPS | 45–50 TOPS | M5 +18–30% пиков — не линейно tokens/sec |
| GPU (MLX) | 10 ядер, 120 ГБ/с | 10+ ядер, ~130–140 ГБ/с | M5 умеренно для 13B+ quant |
| Unified memory | 16 / 24 / 32 ГБ | 16 / 24 / 32 ГБ | RAM > поколение |
| 7B Q4 (MLX) | ~45–55 tok/s (24 ГБ) | ~50–65 tok/s (оценка) | Оба годятся; M4 достаточен |
| 13B Q4 (MLX) | ~25–35 tok/s (24 ГБ) | ~30–40 tok/s (оценка) | M5 помогает; M4 24 ГБ — лучше $/tok |
| Цена (2026) | $499–549 распродажа | $599–649 старт (оценка) | M4 — король цена/качество |
M5: выше пики, выше входная цена
Оправдан при ежедневных 13B+ моделях, ночных embedding-batch или связке inference с ProRes. Neural Engine важнее для Core ML и diffusion, чем для каждой llama.cpp-сессии.
M4: лучшие доллары за локальный токен (рекомендуем)
M4 со скидкой даёт 80–90% throughput M5 при 70–85% стоимости запуска — до учёта вероятного базового SSD 512 ГБ у M5. Арендуйте или купите M4, проверьте размер модели, апгрейд только когда логи покажут узкое место в TOPS, а не RAM.
Где каждый чип выигрывает для локальных LLM
7B–8B чат-модели (Llama, Mistral, Qwen)
Оба чипа тянут Q4_K_M интерактивно. M4 24 ГБ — рациональный default; премию M5 берите только при параллельных agent + Xcode.
13B–14B рабочие модели
Минимум 24 ГБ unified memory. Дополнительная пропускная способность M5 снижает latency на длинном контексте; M4 жизнеспособен, если бюджет идёт в RAM, а не в поколение.
30B+ или multi-model routing
Базовый M4 и M5 не заменят 32 ГБ+ или cloud fallback. M5 не исправит недостаток RAM в SKU — этого не будет.
Always-on inference-сервер
Headless Mac mini на gigabit обходит ноутбук, который засыпает. Аренда M4 на MacPng даёт стабильное охлаждение, статический IP и SSH для batch без привязки к рабочему месту.
Шесть шагов развёртывания локального стека на Mac mini
- Размер модели до поколения чипа: зафиксируйте максимальный quant (7B, 13B, split 70B). Потолок 13B Q4 → бюджет 24 ГБ RAM, M4 или M5 — вторично.
- MLX или llama.cpp на выделенном хосте: не загрязняйте daily Mac. Узел MacPng M4 по SSH; веса на быстром SSD, не на сетевом share.
- Бенчмарк tokens/sec на вашей длине промпта: 100 итераций при медианном контексте (2K vs 8K). Geekbench и TOPS врут; лог-файл — нет.
- Агрессивная квантизация: Q4_K_M или Q5_K_M даёт 30–40% headroom RAM при минимальной потере качества — часто лучше, чем ждать M5.
- Автоматизация по SSH: cron или launchd для ночных embedding; VNC только для GUI quant — см. руководство SSH/VNC MacPng.
- TCO при 220 часах: если узел inference + сборки > ~220 ч/мес два цикла подряд — сравните покупку M4 со скидкой с арендой; иначе оставьте rented box и пропустите launch-цену M5.
-ngl до offload слоёв, пока давление памяти < 85% в Activity Monitor.
Цитируемые пороги для покупателей AI 2026
Итог: M5 быстрее; M4 — умная покупка для локальных LLM
История AI-вычислений на Mac mini в 2026 проще заголовков launch. M5 принесёт сильнее Neural Engine и чуть шире memory bandwidth — важно при жизни в 13B+ и ночных embedding. Для большинства, кто тестирует agent, гоняет 7B–13B quant и связывает inference с Xcode, M4 уже проходит планку.
Unified memory важнее TOPS. M4 24 ГБ на распродаже обходит M5 16 ГБ по каждой метрике размера модели. Дисциплинированный путь: аренда или покупка M4, лог tokens/sec и RAM два недели, затем решение — стоит ли +15–25% inference и $150+ ожидания M5.
Руководство по покупке MacPng: ① выберите максимальный quant из матрицы → ② M4 24 ГБ на тарифах → ③ аренда с SSH в тот же день → ④ шесть шагов бенчмарка MLX на ваших промптах → ⑤ покупка M4 со скидкой только при утилизации > 220 ч два месяца. Не платите за AI-headroom M5, который не измерили.
Бенчмарк MLX и llama.cpp на выделенном M4 до выхода M5
Стабильный SSH для ночных inference-batch, 24 ГБ unified memory для 13B и VNC для GUI — без угадывания, стоит ли M5 премиум.