Mistral Nemo Japanese 12B を動かすPCスペック(必要VRAM・メモリ・速度の目安)
日本語追加学習の12B。VRAM 8〜12GB
量子化別の必要メモリ
ファイルサイズは Hugging Face(mmnga/cyberagent-Mistral-Nemo-Japanese-Instruct-2408-gguf) の実サイズ(事実)。KVキャッシュは8,192トークン・fp16でモデル構造(40層)から計算。必要メモリ合計には計算バッファを含みます。
| 量子化 | ファイル | KV(8k) | 必要合計 | GPUなら | Macなら |
|---|---|---|---|---|---|
| 2bit(IQ2_M) 品質劣化大。最後の手段 | 4.1GB | 1.3GB | 6.0GB | VRAM 8GB〜 | 16GB〜 |
| 2bit(Q2_K) 品質劣化大。最後の手段 | 4.5GB | 1.3GB | 6.3GB | VRAM 8GB〜 | 16GB〜 |
| 3bit(IQ3_M) メモリ優先 | 5.3GB | 1.3GB | 7.2GB | VRAM 8GB〜 | 16GB〜 |
| 3bit(Q3_K_M) メモリ優先 | 5.7GB | 1.3GB | 7.6GB | VRAM 10GB〜 | 16GB〜 |
| 4bit(IQ4_XS) Q4_K_Mより一回り小さい | 6.3GB | 1.3GB | 8.2GB | VRAM 10GB〜 | 16GB〜 |
| 4bit(Q4_K_M) 標準。迷ったらこれ | 7.0GB | 1.3GB | 8.9GB | VRAM 10GB〜 | 16GB〜 |
| 5bit(Q5_K_M) 品質重視 | 8.1GB | 1.3GB | 10GB | VRAM 12GB〜 | 16GB〜 |
| 6bit(Q6_K) ほぼ無劣化 | 9.4GB | 1.3GB | 11GB | VRAM 12GB〜 | 18GB〜 |
| 8bit(Q8_0) 無劣化に近い | 12GB | 1.3GB | 14GB | VRAM 16GB〜 | 24GB〜 |
4bit(Q4_K_M)が動く機種と推定速度
速度はテキスト生成(tok/s)の推定。「較正」= 同機種のllama.cpp公開ベンチマークで実効係数を合わせた推定、「推定」= 同系統機種の係数を流用。10 tok/s で人が読む速さの約2倍です。
快適 20 tok/s以上(60機種)
- GeForce RTX 5090 約140 tok/s較正
- GeForce RTX 5080 Laptop 約96 tok/s推定
- GeForce RTX 5090 Laptop 約96 tok/s推定
- GeForce RTX 4090 約87 tok/s較正
- GeForce RTX 5080 約85 tok/s較正
- GeForce RTX 5070 Ti 約83 tok/s較正
- GeForce RTX 3080 12GB 約83 tok/s推定
- GeForce RTX 3080 Ti 約83 tok/s推定
- GeForce RTX 3090 Ti 約80 tok/s較正
- GeForce RTX 3090 約74 tok/s較正
- GeForce RTX 5070 Ti Laptop 約72 tok/s推定
- Radeon RX 7900 XTX 約71 tok/s推定
- GeForce RTX 4080 SUPER 約70 tok/s較正
- GeForce RTX 4080 約67 tok/s較正
- GeForce RTX 3080 10GB 約66 tok/s較正
- GeForce RTX 4070 Ti SUPER 約62 tok/s較正
- GeForce RTX 4090 Laptop 約62 tok/s推定
- GeForce RTX 5070 約60 tok/s較正
- Radeon RX 7900 XT 約59 tok/s推定
- Apple M2 Ultra(64GB) 約59 tok/s較正
- Apple M2 Ultra(128GB) 約59 tok/s較正
- Apple M2 Ultra(192GB) 約59 tok/s較正
- Apple M3 Ultra(96GB) 約56 tok/s較正
- Apple M3 Ultra(256GB) 約56 tok/s較正
- Apple M3 Ultra(512GB) 約56 tok/s較正
- Apple M1 Ultra(64GB) 約53 tok/s較正
- Apple M1 Ultra(128GB) 約53 tok/s較正
- Radeon RX 9070 XT 約48 tok/s推定
- Apple M4 Max(36GB) 約48 tok/s較正
- Apple M4 Max(48GB) 約48 tok/s較正
- Apple M4 Max(64GB) 約48 tok/s較正
- Apple M4 Max(128GB) 約48 tok/s較正
- GeForce RTX 4080 Laptop 約46 tok/s推定
- Radeon RX 7800 XT 約46 tok/s推定
- Radeon RX 9070 約46 tok/s推定
- GeForce RTX 4070 約46 tok/s推定
- GeForce RTX 4070 SUPER 約46 tok/s推定
- GeForce RTX 4070 Ti 約46 tok/s推定
- GeForce RTX 5060 Ti 16GB 約43 tok/s較正
- Apple M3 Max(36GB) 約38 tok/s較正
- ほか20機種
実用 8〜20 tok/s(20機種)
- Apple M1 Pro(16GB) 約20 tok/s較正
- Apple M1 Pro(32GB) 約20 tok/s較正
- AMD Ryzen AI Max+ 395(Strix Halo)(メモリ32GB) 約19 tok/s推定
- AMD Ryzen AI Max+ 395(Strix Halo)(メモリ64GB) 約19 tok/s推定
- AMD Ryzen AI Max+ 395(Strix Halo)(メモリ128GB) 約19 tok/s推定
- Apple M3 Pro(18GB) 約15 tok/s較正
- Apple M3 Pro(36GB) 約15 tok/s較正
- Apple M5(16GB) 約15 tok/s推定
- Apple M5(24GB) 約15 tok/s推定
- Apple M5(32GB) 約15 tok/s推定
- Apple M4(16GB) 約12 tok/s較正
- Apple M4(24GB) 約12 tok/s較正
- Apple M4(32GB) 約12 tok/s較正
- Apple M2(16GB) 約11 tok/s較正
- Apple M2(24GB) 約11 tok/s較正
- Apple M3(16GB) 約10 tok/s較正
- Apple M3(24GB) 約10 tok/s較正
- AMD Ryzen AI 300(Strix Point・Copilot+ PC)(メモリ16GB) 約8.8 tok/s推定
- AMD Ryzen AI 300(Strix Point・Copilot+ PC)(メモリ32GB) 約8.8 tok/s推定
- AMD Ryzen AI 300(Strix Point・Copilot+ PC)(メモリ64GB) 約8.8 tok/s推定
遅い 載るが遅い(12機種)
- Intel Core Ultra 200V(Lunar Lake・Copilot+ PC)(メモリ16GB) 約7.5 tok/s推定
- Intel Core Ultra 200V(Lunar Lake・Copilot+ PC)(メモリ32GB) 約7.5 tok/s推定
- Snapdragon X Elite(Copilot+ PC)(メモリ16GB) 約7.5 tok/s推定
- Snapdragon X Elite(Copilot+ PC)(メモリ32GB) 約7.5 tok/s推定
- Apple M1(16GB) 約6.8 tok/s較正
- 一般的なデスクトップ/ノートPC(DDR5-5600・GPUなし)(メモリ16GB) 約4.9 tok/s推定
- 一般的なデスクトップ/ノートPC(DDR5-5600・GPUなし)(メモリ32GB) 約4.9 tok/s推定
- 一般的なデスクトップ/ノートPC(DDR5-5600・GPUなし)(メモリ64GB) 約4.9 tok/s推定
- 一般的なデスクトップ/ノートPC(DDR5-5600・GPUなし)(メモリ128GB) 約4.9 tok/s推定
- 一般的なデスクトップ/ノートPC(DDR4-3200・GPUなし)(メモリ16GB) 約2.8 tok/s推定
- 一般的なデスクトップ/ノートPC(DDR4-3200・GPUなし)(メモリ32GB) 約2.8 tok/s推定
- 一般的なデスクトップ/ノートPC(DDR4-3200・GPUなし)(メモリ64GB) 約2.8 tok/s推定
CPUオフロードで動く(15機種・システムメモリ32GB想定)
- GeForce RTX 3070 Ti 約21 tok/s推定
- GeForce RTX 5060 Laptop 約19 tok/s推定
- GeForce RTX 5070 Laptop 約19 tok/s推定
- GeForce RTX 3060 Ti 約19 tok/s推定
- GeForce RTX 3070 約19 tok/s推定
- GeForce RTX 5060 約19 tok/s推定
- GeForce RTX 5060 Ti 8GB 約19 tok/s推定
- GeForce RTX 4060 Ti 8GB 約17 tok/s較正
- GeForce RTX 5050 約16 tok/s推定
- GeForce RTX 4060 Laptop 約16 tok/s推定
- GeForce RTX 4070 Laptop 約16 tok/s推定
- GeForce RTX 4060 約15 tok/s推定
- Radeon RX 7600 約14 tok/s推定
- GeForce RTX 3050 8GB 約14 tok/s推定
- GeForce RTX 4050 Laptop 約9.3 tok/s較正
動かない機種(4)を見る
- Apple M1(8GB) あと3.5GB
- Apple M2(8GB) あと3.5GB
- Apple M3(8GB) あと3.5GB
- 一般的なデスクトップ/ノートPC(DDR4-3200・GPUなし)(メモリ8GB) あと3.5GB
Mistral Nemo Japanese 12Bを動かせるPC・Macを今日買うなら
PR: 以下は広告リンクを含みます(Amazonアソシエイト・各社アフィリエイト)。価格の目安は執筆時点のもので変動します。価格・在庫はリンク先でご確認ください。
RTX 5070(12GB)デスクトップ・メモリ32GB
SDXLの画像生成が快適。14BクラスのローカルLLMがGPU完結
RTX 5070(VRAM 12GB)・メモリ32GB・NVMe 1TB ・ 目安 20〜28万円
要件を満たす中で最も手頃
RTX 5070 Ti(16GB)デスクトップ・メモリ32GB
FLUX・27B MoE・gpt-oss-20b。ローカルAIの定番ライン
RTX 5070 Ti(VRAM 16GB)・メモリ32GB・NVMe 2TB・電源750W ・ 目安 28〜38万円
将来の用途拡張(大きなモデル・並列エージェント)に余裕
Mac mini M4 Pro(メモリ48GB・SSD 1TB)
30BクラスのローカルLLMとエージェント並列運用を1台で。コスパの中心
M4 Pro・ユニファイドメモリ48GB・SSD 1TB・帯域273GB/s ・ 目安 30〜36万円
Macで同じ仕事をするなら
よくある質問
Mistral Nemo Japanese 12Bを動かすのに必要なVRAMは?
4bit量子化(4bit(Q4_K_M))でファイル7.0GB、8,192トークンのKVキャッシュを含めて約8.9GBが必要です。GPU単体ならGeForce RTX 3080 10GB(VRAM 10GB)から実用速度で動きます。
Mistral Nemo Japanese 12BはMacで動く?
動きます。ユニファイドメモリ16GB以上のApple Silicon(例: Apple M2 Pro(16GB))で4bit量子化が実用速度です。
このクラスの選び方: ローカルLLM(8Bクラス)に必要なPC / MacかWindowsか