モデル別 必要VRAM・メモリ一覧
4bit(Q4_K_M)のファイルサイズと、8,192トークン分のKVキャッシュ。詳細ページに量子化ごとの必要量と動く機種があります。
| モデル | 開発元 | パラメータ | 4bitサイズ | KV(8k) | 一言 |
|---|---|---|---|---|---|
| Gemma 4 26B-A4B | 25.23B MoE 活性4B | 16GB | 0.4GB | 2026年のGoogle製MoE。メモリ24〜32GBで速い | |
| Gemma 4 31B | 30.7B | 17GB | 1.4GB | 2026年のGoogle製dense上位。VRAM 24GB | |
| Qwen3.6 35B-A3B | Alibaba | 34.66B MoE 活性3B | 21GB | 0.2GB | Qwen3.5 35B-A3Bの改良版 |
| Qwen3.5 122B-A10B | Alibaba | 122.11B MoE 活性10B | 71GB | 0.2GB | メモリ96〜128GB級向け |
| Qwen3.5 27B | Alibaba | 26.9B | 16GB | 0.5GB | 2026年の主力dense。VRAM 24GBでQ4〜Q5 |
| Qwen3.5 35B-A3B | Alibaba | 34.66B MoE 活性3B | 21GB | 0.2GB | メモリ32GBのPC/Macで速く動く2026年の実用MoE |
| GLM-4.7-Flash 30B-A3B | Z.ai | 29.94B MoE 活性3B | 17GB | 0.8GB | MLA採用でKVが小さい軽量MoE |
| GLM-4.6V-Flash 9B | Z.ai | 9.4B | 5.7GB | 0.3GB | 画像理解の軽量モデル |
| Qwen3-Next 80B-A3B | Alibaba | 79.67B MoE 活性3B | 45GB | 0.2GB | ハイブリッド注意機構。長文でもKVが膨らみにくい |
| gpt-oss-120b | OpenAI | 116.83B MoE 活性5.1B | 59GB | 0.3GB | メモリ64GB以上のMac/Strix Haloで現実的 |
| gpt-oss-20b | OpenAI | 20.91B MoE 活性3.6B | 11GB | 0.2GB | OpenAI初のオープンモデル。MXFP4でVRAM 16GBに載る |
| GLM-4.5-Air 106B-A12B | Z.ai | 110.47B MoE 活性12B | 68GB | 1.5GB | メモリ64GB以上向けの高性能MoE |
| Qwen3 30B-A3B | Alibaba | 30.53B MoE 活性3.3B | 17GB | 0.8GB | MoE。メモリさえあれば速い。Macやメモリ多めのPC向き |
| Qwen3-Coder 30B-A3B | Alibaba | 30.53B MoE 活性3.3B | 17GB | 0.8GB | ローカルのコード補助の定番MoE |
| Gemma 3n E4B | 6.87B | 4.2GB | 0.1GB | スマホ/ノート向け設計。メモリ8GBで動く | |
| Mistral Small 3.2 24B | Mistral AI | 23.57B | 13GB | 1.3GB | VRAM 16GBでQ4が載る欧州製 |
| DeepSeek-R1-0528 Qwen3 8B | DeepSeek | 8.19B | 4.7GB | 1.1GB | R1蒸留の改良版8B |
| Llama 4 Scout 17B-16E | Meta | 107.77B MoE 活性17B | 61GB | 1.5GB | 総109BのMoE。メモリ64GB以上 |
| Qwen3 14B | Alibaba | 14.77B | 8.4GB | 1.3GB | VRAM 12GBでQ4が載る。8Bとの差が体感できる中量級 |
| Qwen3 235B-A22B | Alibaba | 235.09B MoE 活性22B | 132GB | 1.5GB | メモリ128GB級のMac Studio/Strix Haloで狙う巨大MoE |
| Qwen3 32B | Alibaba | 32.76B | 18GB | 2.0GB | VRAM 24GBで動く上限級のdenseモデル |
| Qwen3 4B | Alibaba | 4.02B | 2.3GB | 1.1GB | 4Bながら日本語が破綻しにくい。メモリ8GBのノートでも動く入門機 |
| Qwen3 8B | Alibaba | 8.19B | 4.7GB | 1.1GB | VRAM 8GBクラスの定番。日本語チャットの最初の1本 |
| Gemma 3 12B | 11.77B | 6.8GB | 0.8GB | VRAM 12GBで日本語が上手い定番 | |
| Gemma 3 27B | 27.01B | 15GB | 1.0GB | VRAM 24GB向け。日本語品質は最上位クラス | |
| Gemma 3 4B | 3.88B | 2.3GB | 0.3GB | 画像も読める小型。日本語も自然 | |
| Phi-4-mini 3.8B | Microsoft | 3.84B | 2.3GB | 1.0GB | GPUなしでも動く小型 |
| DeepSeek-R1 Distill Qwen 14B | DeepSeek | 14.77B | 8.4GB | 1.5GB | VRAM 12GB向け推論モデル |
| DeepSeek-R1 Distill Qwen 14B Japanese | CyberAgent | 14.77B | 8.4GB | 1.5GB | サイバーエージェントの日本語追加学習版 |
| DeepSeek-R1 Distill Qwen 32B | DeepSeek | 32.76B | 18GB | 2.0GB | VRAM 24GB向け推論モデル |
| DeepSeek-R1 Distill Qwen 7B | DeepSeek | 7.62B | 4.4GB | 0.4GB | 推論(考えてから答える)型の入門 |
| Llama 3.3 70B | Meta | 70.55B | 40GB | 2.5GB | 70B dense。VRAM 48GB以上かMac 64GB以上 |
| Phi-4 14B | Microsoft | 14.66B | 8.4GB | 1.6GB | 数学・推論に強い14B |
| Qwen2.5-Coder 14B | Alibaba | 14.77B | 8.4GB | 1.5GB | VRAM 12GB向けコードモデル |
| Qwen2.5-Coder 32B | Alibaba | 32.76B | 18GB | 2.0GB | ローカルコード補助の高品質dense。VRAM 24GB |
| Llama 3.2 3B | Meta | 3.21B | 1.9GB | 0.9GB | GPUなしのノートでも動く軽量級 |
| Qwen2.5-Coder 7B | Alibaba | 7.62B | 4.4GB | 0.4GB | 軽量コード補助。VRAM 8GBで実用 |
| Llama 3.1 8B | Meta | 8.03B | 4.6GB | 1.0GB | 英語圏の基準モデル。日本語はQwenに劣る |
| Mistral Nemo 12B | Mistral AI | 12.25B | 7.0GB | 1.3GB | 長文向け12B |
| Llama-3-ELYZA-JP-8B | ELYZA | 8.03B | 4.6GB | 1.0GB | 国産の日本語特化8B。VRAM 8GB |