Apple M1 Max(64GB) で動くローカルLLM一覧(2026年9月)
まず試すなら: Qwen3.6 35B-A3B(8bit(Q8_0)・必要36GB・約53 tok/s較正)。Qwen3.5 35B-A3Bの改良版
足りないのは: gpt-oss-120bを動かすにはユニファイドメモリがあと約14GB必要(必要62GB / 実効48GB)。
載るモデル(ユニファイドメモリに全量が入る)
各モデルについて、載る中で最も高精度な量子化を表示。速度は推定(「較正」は同機種の公開ベンチで係数を合わせたもの)。
| モデル | 量子化 | 必要 | 判定 | 推定速度 |
|---|---|---|---|---|
| Qwen3-Next 80B-A3B | 4bit(Q4_K_M) | 47GB | 快適 | 約90 tok/s較正 |
| gpt-oss-20b | 4bit(MXFP4) | 12GB | 快適 | 約79 tok/s較正 |
| Llama 3.2 3B | 8bit(Q8_0) | 4.7GB | 快適 | 約74 tok/s較正 |
| Gemma 3 4B | 8bit(Q8_0) | 4.7GB | 快適 | 約67 tok/s較正 |
| Phi-4-mini 3.8B | 8bit(Q8_0) | 5.4GB | 快適 | 約62 tok/s較正 |
| Qwen3 4B | 8bit(Q8_0) | 5.7GB | 快適 | 約59 tok/s較正 |
| Llama-3-ELYZA-JP-8B | 4bit(Q4_K_M) | 6.2GB | 快適 | 約53 tok/s較正 |
| Qwen3.6 35B-A3B | 8bit(Q8_0) | 36GB | 快適 | 約53 tok/s較正 |
| Qwen3.5 35B-A3B | 8bit(Q8_0) | 36GB | 快適 | 約53 tok/s較正 |
| Qwen3.5 122B-A10B | 2bit(IQ2_M) | 38GB | 快適 | 約52 tok/s較正 |
| GLM-4.7-Flash 30B-A3B | 8bit(Q8_0) | 32GB | 快適 | 約48 tok/s較正 |
| Qwen3 30B-A3B | 8bit(Q8_0) | 32GB | 快適 | 約44 tok/s較正 |
| Qwen3-Coder 30B-A3B | 8bit(Q8_0) | 32GB | 快適 | 約44 tok/s較正 |
| Gemma 4 26B-A4B | 8bit(Q8_0) | 27GB | 快適 | 約39 tok/s較正 |
| Gemma 3n E4B | 8bit(Q8_0) | 7.7GB | 快適 | 約39 tok/s較正 |
| DeepSeek-R1 Distill Qwen 7B | 8bit(Q8_0) | 8.7GB | 快適 | 約35 tok/s較正 |
| Qwen2.5-Coder 7B | 8bit(Q8_0) | 8.7GB | 快適 | 約35 tok/s較正 |
| Llama 3.1 8B | 8bit(Q8_0) | 9.7GB | 快適 | 約32 tok/s較正 |
| DeepSeek-R1-0528 Qwen3 8B | 8bit(Q8_0) | 10.0GB | 快適 | 約31 tok/s較正 |
| Qwen3 8B | 8bit(Q8_0) | 10.0GB | 快適 | 約31 tok/s較正 |
| GLM-4.5-Air 106B-A12B | 2bit(Q2_K) | 45GB | 快適 | 約30 tok/s較正 |
| GLM-4.6V-Flash 9B | 8bit(Q8_0) | 10GB | 快適 | 約28 tok/s較正 |
| Llama 4 Scout 17B-16E | 2bit(Q2_K) | 40GB | 快適 | 約25 tok/s較正 |
| Gemma 3 12B | 8bit(Q8_0) | 13GB | 快適 | 約22 tok/s較正 |
| Mistral Nemo 12B | 8bit(Q8_0) | 14GB | 快適 | 約21 tok/s較正 |
| Qwen3 14B | 8bit(Q8_0) | 17GB | 実用 | 約18 tok/s較正 |
| Phi-4 14B | 8bit(Q8_0) | 17GB | 実用 | 約18 tok/s較正 |
| DeepSeek-R1 Distill Qwen 14B | 8bit(Q8_0) | 17GB | 実用 | 約17 tok/s較正 |
| DeepSeek-R1 Distill Qwen 14B Japanese | 8bit(Q8_0) | 17GB | 実用 | 約17 tok/s較正 |
| Qwen2.5-Coder 14B | 8bit(Q8_0) | 17GB | 実用 | 約17 tok/s較正 |
| Mistral Small 3.2 24B | 8bit(Q8_0) | 26GB | 実用 | 約11 tok/s較正 |
| Qwen3.5 27B | 8bit(Q8_0) | 28GB | 実用 | 約10 tok/s較正 |
| Gemma 3 27B | 8bit(Q8_0) | 29GB | 実用 | 約9.8 tok/s較正 |
| Gemma 4 31B | 8bit(Q8_0) | 33GB | 実用 | 約8.6 tok/s較正 |
| Qwen3 32B | 8bit(Q8_0) | 36GB | 実用 | 約8.0 tok/s較正 |
| DeepSeek-R1 Distill Qwen 32B | 8bit(Q8_0) | 36GB | 実用 | 約8.0 tok/s較正 |
| Qwen2.5-Coder 32B | 8bit(Q8_0) | 36GB | 実用 | 約8.0 tok/s較正 |
| Llama 3.3 70B | 4bit(Q4_K_M) | 44GB | 遅い | 約6.6 tok/s較正 |
動かないモデルと不足分
| モデル | 量子化 | 必要 | 不足 |
|---|---|---|---|
| gpt-oss-120b | 4bit(MXFP4) | 62GB | あと14GB |
| Qwen3 235B-A22B | 4bit(Q4_K_M) | 138GB | あと90GB |
gpt-oss-120bまで届くPC・Macに買い替えるなら
PR: 以下は広告リンクを含みます(Amazonアソシエイト・各社アフィリエイト)。価格の目安は執筆時点のもので変動します。価格・在庫はリンク先でご確認ください。
Mac Studio M4 Max(メモリ128GB・SSD 2TB)
gpt-oss-120b・Qwen3.5 122Bが載り、帯域546GB/sで実用速度。個人向けローカルLLMの本命
M4 Max・ユニファイドメモリ128GB・SSD 2TB ・ 目安 62〜72万円
要件を満たす中で最も手頃
Mac Studio M3 Ultra(メモリ256GB・SSD 2TB)
235B級MoEを1台で。帯域800GB/s。個人で持てる上限
M3 Ultra・ユニファイドメモリ256GB・SSD 2TB ・ 目安 95〜115万円
将来の用途拡張(大きなモデル・並列エージェント)に余裕
GPUなし開発デスクトップ(メモリ32GB・SSD 1TB)
コーディングAI・データ分析・自動化のサーバ役。GPUは後から足せる
Ryzen 7 / Core i7 クラス・メモリ32GB・NVMe 1TB・電源650W以上(GPU増設余地) ・ 目安 12〜18万円
Windowsで同じ仕事をするなら
この機種の実測データ(出典)
✅ M1 Max 1 の llama.cpp 公開ベンチマーク(GitHub Discussion): llama-7b F16 = 23.03 tok/s / llama-7b Q8_0 = 40.2 tok/s / llama-7b Q4_0 = 61.19 tok/s。この値からメモリ帯域幅に対する実効係数(72%)を求め、他モデルの速度推定に使っています。
よくある質問
Apple M1 Max(64GB)でローカルLLMは動く?
動きます。ユニファイドメモリ64GB(実効約48GB)に、収録40モデル中38本が載ります。日本語チャットならQwen3.6 35B-A3B(8bit(Q8_0))が推定約53 tok/sです。
Apple M1 Max(64GB)で動かないモデルは?
gpt-oss-120bは4bitで約62GB必要で、ユニファイドメモリがあと約14GB足りません。