GeForce RTX 3090 Ti で動くローカルLLM一覧(2026年9月)
まず試すなら: Qwen3.5 35B-A3B(4bit(Q4_K_M)・必要22GB・約200 tok/s較正)。メモリ32GBのPC/Macで速く動く2026年の実用MoE
足りないのは: Llama 3.3 70Bを動かすにはVRAMがあと約20GB必要(必要44GB / 実効24GB)。システムメモリに逃がすオフロードなら動きますが、速度は数分の一になります。
載るモデル(VRAMに全量が入る)
各モデルについて、載る中で最も高精度な量子化を表示。速度は推定(「較正」は同機種の公開ベンチで係数を合わせたもの)。
| モデル | 量子化 | 必要 | 判定 | 推定速度 |
|---|---|---|---|---|
| Qwen3.5 35B-A3B | 4bit(Q4_K_M) | 22GB | 快適 | 約200 tok/s較正 |
| Qwen3.6 35B-A3B | 4bit(Q4_K_M) | 22GB | 快適 | 約200 tok/s較正 |
| gpt-oss-20b | 4bit(MXFP4) | 12GB | 快適 | 約180 tok/s較正 |
| Llama 3.2 3B | 8bit(Q8_0) | 4.7GB | 快適 | 約170 tok/s較正 |
| GLM-4.7-Flash 30B-A3B | 5bit(Q5_K_M) | 22GB | 快適 | 約150 tok/s較正 |
| Gemma 3 4B | 8bit(Q8_0) | 4.7GB | 快適 | 約150 tok/s較正 |
| Qwen3 30B-A3B | 5bit(Q5_K_M) | 22GB | 快適 | 約140 tok/s較正 |
| Qwen3-Coder 30B-A3B | 5bit(Q5_K_M) | 22GB | 快適 | 約140 tok/s較正 |
| Phi-4-mini 3.8B | 8bit(Q8_0) | 5.4GB | 快適 | 約140 tok/s較正 |
| Qwen3 4B | 8bit(Q8_0) | 5.7GB | 快適 | 約130 tok/s較正 |
| Llama-3-ELYZA-JP-8B | 4bit(Q4_K_M) | 6.2GB | 快適 | 約120 tok/s較正 |
| Gemma 4 26B-A4B | 6bit(Q6_K) | 23GB | 快適 | 約100 tok/s較正 |
| Gemma 3n E4B | 8bit(Q8_0) | 7.7GB | 快適 | 約88 tok/s較正 |
| DeepSeek-R1 Distill Qwen 7B | 8bit(Q8_0) | 8.7GB | 快適 | 約79 tok/s較正 |
| Qwen2.5-Coder 7B | 8bit(Q8_0) | 8.7GB | 快適 | 約79 tok/s較正 |
| Llama 3.1 8B | 8bit(Q8_0) | 9.7GB | 快適 | 約72 tok/s較正 |
| DeepSeek-R1-0528 Qwen3 8B | 8bit(Q8_0) | 10.0GB | 快適 | 約70 tok/s較正 |
| Qwen3 8B | 8bit(Q8_0) | 10.0GB | 快適 | 約70 tok/s較正 |
| GLM-4.6V-Flash 9B | 8bit(Q8_0) | 10GB | 快適 | 約64 tok/s較正 |
| Gemma 3 12B | 8bit(Q8_0) | 13GB | 快適 | 約51 tok/s較正 |
| Mistral Nemo 12B | 8bit(Q8_0) | 14GB | 快適 | 約48 tok/s較正 |
| Qwen3 14B | 8bit(Q8_0) | 17GB | 快適 | 約40 tok/s較正 |
| Phi-4 14B | 8bit(Q8_0) | 17GB | 快適 | 約40 tok/s較正 |
| DeepSeek-R1 Distill Qwen 14B | 8bit(Q8_0) | 17GB | 快適 | 約40 tok/s較正 |
| DeepSeek-R1 Distill Qwen 14B Japanese | 8bit(Q8_0) | 17GB | 快適 | 約40 tok/s較正 |
| Qwen2.5-Coder 14B | 8bit(Q8_0) | 17GB | 快適 | 約40 tok/s較正 |
| Mistral Small 3.2 24B | 6bit(Q6_K) | 20GB | 快適 | 約33 tok/s較正 |
| Qwen3 32B | 4bit(Q4_K_M) | 21GB | 快適 | 約31 tok/s較正 |
| DeepSeek-R1 Distill Qwen 32B | 4bit(Q4_K_M) | 22GB | 快適 | 約31 tok/s較正 |
| Qwen2.5-Coder 32B | 4bit(Q4_K_M) | 22GB | 快適 | 約31 tok/s較正 |
| Gemma 4 31B | 5bit(Q5_K_M) | 23GB | 快適 | 約29 tok/s較正 |
| Qwen3.5 27B | 6bit(Q6_K) | 23GB | 快適 | 約29 tok/s較正 |
| Gemma 3 27B | 6bit(Q6_K) | 23GB | 快適 | 約29 tok/s較正 |
CPUオフロードなら動く(システムメモリ32GB想定)
| モデル | 量子化 | 必要 | 判定 | 推定速度 |
|---|---|---|---|---|
| Llama 3.3 70B | 4bit(Q4_K_M) | 44GB | 動かないCPUオフロード | 約1.9 tok/s較正 |
動かないモデルと不足分
| モデル | 量子化 | 必要 | 不足 |
|---|---|---|---|
| Qwen3-Next 80B-A3B | 4bit(Q4_K_M) | 47GB | あと24GB |
| gpt-oss-120b | 4bit(MXFP4) | 62GB | あと38GB |
| Llama 4 Scout 17B-16E | 4bit(Q4_K_M) | 65GB | あと41GB |
| GLM-4.5-Air 106B-A12B | 4bit(Q4_K_M) | 72GB | あと48GB |
| Qwen3.5 122B-A10B | 4bit(Q4_K_M) | 74GB | あと51GB |
| Qwen3 235B-A22B | 4bit(Q4_K_M) | 138GB | あと115GB |
Llama 3.3 70Bまで届くPC・Macに買い替えるなら
PR: 以下は広告リンクを含みます(Amazonアソシエイト・各社アフィリエイト)。価格の目安は執筆時点のもので変動します。価格・在庫はリンク先でご確認ください。
Ryzen AI Max+ 395 ミニPC(メモリ128GB)
Windows/Linuxで128GBユニファイド。gpt-oss-120b・70BクラスをGPU側に96GB割り当てて常時サービング
Ryzen AI Max+ 395・LPDDR5X 128GB(256GB/s)・NVMe 2TB ・ 目安 32〜48万円
要件を満たす中で最も手頃
Mac Studio M3 Ultra(メモリ512GB)をLLMサーバに
DeepSeek V3級(671B)の4bitを1台で。チームのローカルLLMサーバ
M3 Ultra・ユニファイドメモリ512GB・SSD 4TB ・ 目安 150〜200万円
将来の用途拡張(大きなモデル・並列エージェント)に余裕
Mac mini M4 Pro(メモリ64GB・SSD 1TB)
70BクラスのローカルLLMまで。同価格帯のGeForce機より載るモデルが大きい
M4 Pro・ユニファイドメモリ64GB・SSD 1TB ・ 目安 36〜42万円
Macで同じ仕事をするなら
この機種の実測データ(出典)
RTX 3090 Ti の llama.cpp 公開ベンチマーク(GitHub Discussion): llama-2-7b Q4_0 = 171.19 tok/s。この値からメモリ帯域幅に対する実効係数(65%)を求め、他モデルの速度推定に使っています。
よくある質問
GeForce RTX 3090 TiでローカルLLMは動く?
動きます。VRAM24GB(実効約24GB)に、収録40モデル中33本が載ります。日本語チャットならQwen3.5 35B-A3B(4bit(Q4_K_M))が推定約200 tok/sです。
GeForce RTX 3090 Tiで動かないモデルは?
Llama 3.3 70Bは4bitで約44GB必要で、VRAMがあと約20GB足りません。