AI PCナビ使うAIと、させたい仕事に合うPC・Macを。
トップモデル別 › Llama 3.3 70B

Llama 3.3 70B を動かすPCスペック(必要VRAM・メモリ・速度の目安)

70B dense。VRAM 48GB以上かMac 64GB以上

44GB4bitで必要なメモリ(KV 8k込み)
要ユニファイドGPU単体では不足
64GBMac最小構成: M2 Ultra(64GB)
131,072最大コンテキスト(学習時)

量子化別の必要メモリ

ファイルサイズは Hugging Face(bartowski/Llama-3.3-70B-Instruct-GGUF) の実サイズ(事実)。KVキャッシュは8,192トークン・fp16でモデル構造(80層)から計算。必要メモリ合計には計算バッファを含みます。

量子化ファイルKV(8k)必要合計GPUならMacなら
2bit(IQ2_M)
品質劣化大。最後の手段
22GB2.5GB26GBVRAM 32GB〜48GB〜
2bit(Q2_K)
品質劣化大。最後の手段
25GB2.5GB28GBVRAM 32GB〜48GB〜
3bit(IQ3_M)
メモリ優先
30GB2.5GB34GBGPU単体では不可48GB〜
3bit(Q3_K_M)
メモリ優先
32GB2.5GB36GBGPU単体では不可48GB〜
4bit(IQ4_XS)
Q4_K_Mより一回り小さい
35GB2.5GB39GBGPU単体では不可64GB〜
4bit(Q4_K_M)
標準。迷ったらこれ
40GB2.5GB44GBGPU単体では不可64GB〜
5bit(Q5_K_M)
品質重視
47GB2.5GB51GBGPU単体では不可96GB〜
6bit(Q6_K)
ほぼ無劣化
54GB2.5GB59GBGPU単体では不可96GB〜
8bit(Q8_0)
無劣化に近い
70GB2.5GB75GBGPU単体では不可128GB〜
16bit(F16)
元精度
131GB2.5GB138GBGPU単体では不可192GB〜

4bit(Q4_K_M)が動く機種と推定速度

速度はテキスト生成(tok/s)の推定。「較正」= 同機種のllama.cpp公開ベンチマークで実効係数を合わせた推定、「推定」= 同系統機種の係数を流用。10 tok/s で人が読む速さの約2倍です。

快適 20 tok/s以上(0機種)

  • なし

実用 8〜20 tok/s(10機種)

遅い 載るが遅い(8機種)

CPUオフロードで動く(6機種・システムメモリ32GB想定)

動かない機種(82)を見る

Llama 3.3 70Bを動かせるPC・Macを今日買うなら

PR: 以下は広告リンクを含みます(Amazonアソシエイト・各社アフィリエイト)。価格の目安は執筆時点のもので変動します。価格・在庫はリンク先でご確認ください。

ぴったり常時稼働サーバー型

Ryzen AI Max+ 395 ミニPC(メモリ128GB)

Windows/Linuxで128GBユニファイド。gpt-oss-120b・70BクラスをGPU側に96GB割り当てて常時サービング

Ryzen AI Max+ 395・LPDDR5X 128GB(256GB/s)・NVMe 2TB ・ 目安 32〜48万円

要件を満たす中で最も手頃

余裕を持つなら常時稼働サーバー型

Mac Studio M3 Ultra(メモリ512GB)をLLMサーバに

DeepSeek V3級(671B)の4bitを1台で。チームのローカルLLMサーバ

M3 Ultra・ユニファイドメモリ512GB・SSD 4TB ・ 目安 150〜200万円

将来の用途拡張(大きなモデル・並列エージェント)に余裕

別の形ならMac

Mac mini M4 Pro(メモリ64GB・SSD 1TB)

70BクラスのローカルLLMまで。同価格帯のGeForce機より載るモデルが大きい

M4 Pro・ユニファイドメモリ64GB・SSD 1TB ・ 目安 36〜42万円

Macで同じ仕事をするなら

よくある質問

Llama 3.3 70Bを動かすのに必要なVRAMは?

4bit量子化(4bit(Q4_K_M))でファイル40GB、8,192トークンのKVキャッシュを含めて約44GBが必要です。GPU単体のVRAMには載らず、Macのユニファイドメモリか複数GPUが必要です。

Llama 3.3 70BはMacで動く?

動きます。ユニファイドメモリ64GB以上のApple Silicon(例: Apple M2 Ultra(64GB))で4bit量子化が実用速度です。

手持ちのPCで判定する