対象:2026年、MLX・Ollama で 7B〜32B を Apple Silicon に載せたい開発者の方です。結論:M5 推論は約 20% 向上、本体は 30% 超プレミアム——7B〜14B なら M4 が token コスト最低です。構成:痛点・判断表・六手順・引用指標・購入ガイドです。
ローカル LLM 選定で陥りやすい三大痛点
- 算力の過大評価:MLX 2026 Q2 ベンチで Llama 3.1 8B Q4 は M5 が M4 より約 20% 高速——倍速叙事は現実離れ。購入ガイド参照。
- 統一メモリがボトルネック:16GB では 13B が限界、24GB で 14B が快適。M5 も 16GB 起步なら 同容量 M4 と差は小さい。
- 自購 vs レンタル:M5 初版 30〜40% プレミアム予想。PoC なら 三ヶ月 M4 レンタルは月次減価の約 1/6。
2026年 M4 vs M5 ローカル LLM 判断表
| シナリオ | M4 16GB | M4 24GB | M5(予測) | 推奨 |
|---|---|---|---|---|
| 7B 日常対話 / RAG | 快適 | 過剰 | 限定的改善 | M4 16GB レンタル |
| 13B〜14B 量子化推論 | Swap 多発 | 安定 | 約 20% 高速 | M4 24GB レンタル |
| 32B 4-bit 推論 | 不可 | ギリギリ | やや改善 | M5 Pro 待ち or クラウド |
| LoRA 微調整 7B | 可能 | 推奨 | 学習 15% 高速 | M4 24GB |
| 7×24 Agent 無人運用 | リスク高 | 実用的 | 効率やや向上 | リモート M4 隔離ノード |
「M5 待ち」
32B 常駐・予算余裕向け。空白期 3〜6 ヶ月と 30% プレミアムが PoC ROI を圧迫。
「M4 レンタル先行」(推奨)
週単位 M4 で MLX/Ollama を通し、自購か継続を判断。構成ガイド比で試行コストは頭金の 1/10。
六手順:モデル選定から安定推論まで
- モデル確定:7B Q4 日常、13B は 24GB、32B は M5 Pro 級。MLX ワークフローで検証。
- フレーム選定:Apple は MLX、クロスプラットは Ollama。M4/M5 差は CUDA 世代差より小。
- M4 ノード開通:16GB=7B、24GB=14B。SSH/VNCで当日推論。
- 計測:tokens/s・Swap を記録。Swap 10% 超なら 24GB へ。
- ガードレール:モデルパス限定、長時間タスクは隔離ノード。
- 四週 ROI:レンタル vs 減価+電気代で買い切り判断。
引用できる判断指標(四つ)
スループット:M4 24GB 約 42〜48 tokens/s、M5 約 50〜58——差 20%、プレミアム 30% 超は正当化困難。
メモリ上限:16GB=10B Q4、24GB=14B Q4。帯域 M4 120GB/s、M5 150GB/s。
レンタルコスト:週課金は月次減価の 1/5〜1/8。M4 電力 15〜25W、7×24 月 $5〜8。
判断順:モデル選定 → フレーム → M4 計測 → Swap → ガード → 四週 ROI → 購入検討。
まとめ:コスパがローカル LLM の生命線
ボトルネックは 統一メモリ容量と帯域、ピーク TOPS ではありません。7B〜14B は M4 24GB で 80% シナリオをカバー——M5 の 20% 高速化は 30% プレミアムを相殺しにくいです。LoRA 微調整も同様です。
まず M4 を四週間レンタルして計測が token 最低コストの道筋です。Agent 長時間タスクはリモート隔離で手元 Mac を守ります。
購入の流れ:① 16GB/24GB 選定 → ② 料金確認 → ③ レンタルで SSH 開通 → ④ 四週計測 → ⑤ 継続判断。M4 構成ガイド参照。
Mac ノードとアクセス方法を選ぶ
M4 リモート Mac で MLX/Ollama を週単位試行
16GB/24GB 選択、SSH/VNC 対応。推論と Agent を隔離、手元 Mac ゼロリスク。