GeForce RTX 4070 で動くローカルLLM一覧(2026年9月)
まず試すなら: Qwen3 14B(4bit(Q4_K_M)・必要10GB・約39 tok/s推定)。VRAM 12GBでQ4が載る。8Bとの差が体感できる中量級
足りないのは: gpt-oss-20bを動かすにはVRAMがあと約0.8GB必要(必要12GB / 実効12GB)。システムメモリに逃がすオフロードなら動きますが、速度は数分の一になります。
載るモデル(VRAMに全量が入る)
各モデルについて、載る中で最も高精度な量子化を表示。速度は推定(「較正」は同機種の公開ベンチで係数を合わせたもの)。
| モデル | 量子化 | 必要 | 判定 | 推定速度 |
|---|---|---|---|---|
| Gemma 4 26B-A4B | 2bit(IQ2_M) | 10GB | 快適 | 約130 tok/s推定 |
| Llama 3.2 3B | 8bit(Q8_0) | 4.7GB | 快適 | 約96 tok/s推定 |
| Gemma 3 4B | 8bit(Q8_0) | 4.7GB | 快適 | 約87 tok/s推定 |
| Phi-4-mini 3.8B | 8bit(Q8_0) | 5.4GB | 快適 | 約81 tok/s推定 |
| Qwen3 4B | 8bit(Q8_0) | 5.7GB | 快適 | 約76 tok/s推定 |
| Llama-3-ELYZA-JP-8B | 4bit(Q4_K_M) | 6.2GB | 快適 | 約68 tok/s推定 |
| Gemma 3n E4B | 8bit(Q8_0) | 7.7GB | 快適 | 約50 tok/s推定 |
| DeepSeek-R1 Distill Qwen 7B | 8bit(Q8_0) | 8.7GB | 快適 | 約45 tok/s推定 |
| Qwen2.5-Coder 7B | 8bit(Q8_0) | 8.7GB | 快適 | 約45 tok/s推定 |
| Llama 3.1 8B | 8bit(Q8_0) | 9.7GB | 快適 | 約41 tok/s推定 |
| DeepSeek-R1-0528 Qwen3 8B | 8bit(Q8_0) | 10.0GB | 快適 | 約40 tok/s推定 |
| Qwen3 8B | 8bit(Q8_0) | 10.0GB | 快適 | 約40 tok/s推定 |
| Mistral Small 3.2 24B | 2bit(Q2_K) | 10GB | 快適 | 約39 tok/s推定 |
| Qwen3 14B | 4bit(Q4_K_M) | 10GB | 快適 | 約39 tok/s推定 |
| DeepSeek-R1 Distill Qwen 14B | 4bit(Q4_K_M) | 11GB | 快適 | 約38 tok/s推定 |
| DeepSeek-R1 Distill Qwen 14B Japanese | 4bit(Q4_K_M) | 11GB | 快適 | 約38 tok/s推定 |
| Qwen2.5-Coder 14B | 4bit(Q4_K_M) | 11GB | 快適 | 約38 tok/s推定 |
| Phi-4 14B | 4bit(Q4_K_M) | 11GB | 快適 | 約38 tok/s推定 |
| Gemma 3 27B | 2bit(IQ2_M) | 11GB | 快適 | 約37 tok/s推定 |
| Gemma 3 12B | 6bit(Q6_K) | 11GB | 快適 | 約37 tok/s推定 |
| GLM-4.6V-Flash 9B | 8bit(Q8_0) | 10GB | 快適 | 約37 tok/s推定 |
| Qwen3.5 27B | 2bit(IQ2_M) | 11GB | 快適 | 約36 tok/s推定 |
| Mistral Nemo 12B | 6bit(Q6_K) | 11GB | 快適 | 約35 tok/s推定 |
CPUオフロードなら動く(システムメモリ32GB想定)
| モデル | 量子化 | 必要 | 判定 | 推定速度 |
|---|---|---|---|---|
| Gemma 4 31B | 4bit(Q4_K_M) | 19GB | 遅いCPUオフロード | 約4.5 tok/s推定 |
| Qwen3.6 35B-A3B | 4bit(Q4_K_M) | 22GB | 快適CPUオフロード | 約23 tok/s推定 |
| Qwen3.5 35B-A3B | 4bit(Q4_K_M) | 22GB | 快適CPUオフロード | 約23 tok/s推定 |
| GLM-4.7-Flash 30B-A3B | 4bit(Q4_K_M) | 19GB | 快適CPUオフロード | 約24 tok/s推定 |
| gpt-oss-20b | 4bit(MXFP4) | 12GB | 快適CPUオフロード | 約66 tok/s推定 |
| Qwen3 30B-A3B | 4bit(Q4_K_M) | 19GB | 快適CPUオフロード | 約22 tok/s推定 |
| Qwen3-Coder 30B-A3B | 4bit(Q4_K_M) | 19GB | 快適CPUオフロード | 約22 tok/s推定 |
| Qwen3 32B | 4bit(Q4_K_M) | 21GB | 遅いCPUオフロード | 約3.7 tok/s推定 |
| DeepSeek-R1 Distill Qwen 32B | 4bit(Q4_K_M) | 22GB | 遅いCPUオフロード | 約3.7 tok/s推定 |
| Qwen2.5-Coder 32B | 4bit(Q4_K_M) | 22GB | 遅いCPUオフロード | 約3.7 tok/s推定 |
動かないモデルと不足分
| モデル | 量子化 | 必要 | 不足 |
|---|---|---|---|
| Llama 3.3 70B | 4bit(Q4_K_M) | 44GB | あと32GB |
| Qwen3-Next 80B-A3B | 4bit(Q4_K_M) | 47GB | あと36GB |
| gpt-oss-120b | 4bit(MXFP4) | 62GB | あと50GB |
| Llama 4 Scout 17B-16E | 4bit(Q4_K_M) | 65GB | あと53GB |
| GLM-4.5-Air 106B-A12B | 4bit(Q4_K_M) | 72GB | あと60GB |
| Qwen3.5 122B-A10B | 4bit(Q4_K_M) | 74GB | あと63GB |
| Qwen3 235B-A22B | 4bit(Q4_K_M) | 138GB | あと127GB |
gpt-oss-20bまで届くPC・Macに買い替えるなら
PR: 以下は広告リンクを含みます(Amazonアソシエイト・各社アフィリエイト)。価格の目安は執筆時点のもので変動します。価格・在庫はリンク先でご確認ください。
自作: RTX 5070 Ti(16GB)・メモリ32GB
BTOより同予算で一段上のGPUに届く。画像生成とローカルLLMの定番
Ryzen 7 9700X・DDR5 16GB×2・RTX 5070 Ti・NVMe 2TB・電源850W ・ 目安 27〜35万円
要件を満たす中で最も手頃
自作: RTX 5090(32GB)・メモリ96GB
動画生成・学習・32B LLM。メモリ96GBで大型MoEのCPUオフロードも
Ryzen 9 9950X・DDR5 48GB×2・RTX 5090・NVMe 4TB・電源1000W・大型ケース ・ 目安 60〜80万円
将来の用途拡張(大きなモデル・並列エージェント)に余裕
Mac mini M4 Pro(メモリ48GB・SSD 1TB)
30BクラスのローカルLLMとエージェント並列運用を1台で。コスパの中心
M4 Pro・ユニファイドメモリ48GB・SSD 1TB・帯域273GB/s ・ 目安 30〜36万円
Macで同じ仕事をするなら
この機種の公開実測は未収録のため、同系統機種の実効係数(74%)で推定しています。
よくある質問
GeForce RTX 4070でローカルLLMは動く?
動きます。VRAM12GB(実効約12GB)に、収録40モデル中23本が載ります。日本語チャットならQwen3 14B(4bit(Q4_K_M))が推定約39 tok/sです。
GeForce RTX 4070で動かないモデルは?
gpt-oss-20bは4bitで約12GB必要で、VRAMがあと約0.8GB足りません。