AI PCナビ使うAIと、させたい仕事に合うPC・Macを。
トップGPU別 › GeForce RTX 4050 Laptop

GeForce RTX 4050 Laptop で動くローカルLLM一覧(2026年9月)

12快適(20 tok/s以上)
0実用(8〜20 tok/s)
21CPUオフロードで動く
7動かない

まず試すなら: Gemma 3n E4B(5bit(Q5_K_M)・必要5.5GB・約33 tok/s較正)。スマホ/ノート向け設計。メモリ8GBで動く

足りないのは: Qwen3 8Bを動かすにはVRAMがあと約0.9GB必要(必要6.5GB / 実効5.5GB)。システムメモリに逃がすオフロードなら動きますが、速度は数分の一になります。

載るモデル(VRAMに全量が入る)

各モデルについて、載る中で最も高精度な量子化を表示。速度は推定(「較正」は同機種の公開ベンチで係数を合わせたもの)。

モデル量子化必要判定推定速度
DeepSeek-R1-0528 Qwen3 8B2bit(Q2_K)4.8GB快適約43 tok/s較正
Llama 3.2 3B8bit(Q8_0)4.7GB快適約43 tok/s較正
Qwen3 4B6bit(Q6_K)4.8GB快適約43 tok/s較正
GLM-4.6V-Flash 9B2bit(Q2_K)4.7GB快適約40 tok/s較正
Gemma 3 4B8bit(Q8_0)4.7GB快適約39 tok/s較正
Qwen3 8B3bit(IQ3_M)5.4GB快適約37 tok/s較正
Llama 3.1 8B3bit(Q3_K_M)5.4GB快適約37 tok/s較正
Phi-4-mini 3.8B8bit(Q8_0)5.4GB快適約36 tok/s較正
Gemma 3 12B2bit(IQ2_M)5.5GB快適約35 tok/s較正
DeepSeek-R1 Distill Qwen 7B4bit(Q4_K_M)5.4GB快適約34 tok/s較正
Qwen2.5-Coder 7B4bit(Q4_K_M)5.4GB快適約34 tok/s較正
Gemma 3n E4B5bit(Q5_K_M)5.5GB快適約33 tok/s較正

CPUオフロードなら動く(システムメモリ32GB想定)

モデル量子化必要判定推定速度
Gemma 4 26B-A4B4bit(Q4_K_M)17GB実用CPUオフロード約11 tok/s較正
Gemma 4 31B4bit(Q4_K_M)19GB遅いCPUオフロード約2.7 tok/s較正
Qwen3.6 35B-A3B4bit(Q4_K_M)22GB実用CPUオフロード約15 tok/s較正
Qwen3.5 27B4bit(Q4_K_M)17GB遅いCPUオフロード約3.1 tok/s較正
Qwen3.5 35B-A3B4bit(Q4_K_M)22GB実用CPUオフロード約15 tok/s較正
GLM-4.7-Flash 30B-A3B4bit(Q4_K_M)19GB実用CPUオフロード約14 tok/s較正
gpt-oss-20b4bit(MXFP4)12GB実用CPUオフロード約17 tok/s較正
Qwen3 30B-A3B4bit(Q4_K_M)19GB実用CPUオフロード約13 tok/s較正
Qwen3-Coder 30B-A3B4bit(Q4_K_M)19GB実用CPUオフロード約13 tok/s較正
Mistral Small 3.2 24B4bit(Q4_K_M)16GB遅いCPUオフロード約3.7 tok/s較正
Qwen3 14B4bit(Q4_K_M)10GB遅いCPUオフロード約7.0 tok/s較正
Qwen3 32B4bit(Q4_K_M)21GB遅いCPUオフロード約2.4 tok/s較正
Gemma 3 27B4bit(Q4_K_M)17GB遅いCPUオフロード約3.1 tok/s較正
DeepSeek-R1 Distill Qwen 14B4bit(Q4_K_M)11GB遅いCPUオフロード約6.8 tok/s較正
DeepSeek-R1 Distill Qwen 14B Japanese4bit(Q4_K_M)11GB遅いCPUオフロード約6.8 tok/s較正
DeepSeek-R1 Distill Qwen 32B4bit(Q4_K_M)22GB遅いCPUオフロード約2.4 tok/s較正
Phi-4 14B4bit(Q4_K_M)11GB遅いCPUオフロード約6.7 tok/s較正
Qwen2.5-Coder 14B4bit(Q4_K_M)11GB遅いCPUオフロード約6.8 tok/s較正
Qwen2.5-Coder 32B4bit(Q4_K_M)22GB遅いCPUオフロード約2.4 tok/s較正
Mistral Nemo 12B4bit(Q4_K_M)8.9GB実用CPUオフロード約9.3 tok/s較正
Llama-3-ELYZA-JP-8B4bit(Q4_K_M)6.2GB快適CPUオフロード約22 tok/s較正

動かないモデルと不足分

モデル量子化必要不足
Llama 3.3 70B4bit(Q4_K_M)44GBあと38GB
Qwen3-Next 80B-A3B4bit(Q4_K_M)47GBあと42GB
gpt-oss-120b4bit(MXFP4)62GBあと56GB
Llama 4 Scout 17B-16E4bit(Q4_K_M)65GBあと59GB
GLM-4.5-Air 106B-A12B4bit(Q4_K_M)72GBあと66GB
Qwen3.5 122B-A10B4bit(Q4_K_M)74GBあと69GB
Qwen3 235B-A22B4bit(Q4_K_M)138GBあと133GB

Qwen3 8Bまで届くPC・Macに買い替えるなら

PR: 以下は広告リンクを含みます(Amazonアソシエイト・各社アフィリエイト)。価格の目安は執筆時点のもので変動します。価格・在庫はリンク先でご確認ください。

ぴったりノートPC

GPUノート(RTX 5070 Laptop 8GB・メモリ32GB)

持ち歩いて画像生成の入門や8BクラスのローカルLLMを回す人

RTX 5060/5070 Laptop(VRAM 8GB)・メモリ32GB・NVMe 1TB ・ 目安 20〜28万円

要件を満たす中で最も手頃

余裕を持つならノートPC

GPUノート(RTX 5070 Ti Laptop 12GB・メモリ32GB)

ノートでSDXLの画像生成や14BクラスのローカルLLMを実用速度で

RTX 5070 Ti Laptop(VRAM 12GB)・メモリ32GB・NVMe 1TB ・ 目安 27〜36万円

将来の用途拡張(大きなモデル・並列エージェント)に余裕

別の形ならMac

Mac mini M4 Pro(メモリ48GB・SSD 1TB)

30BクラスのローカルLLMとエージェント並列運用を1台で。コスパの中心

M4 Pro・ユニファイドメモリ48GB・SSD 1TB・帯域273GB/s ・ 目安 30〜36万円

Macで同じ仕事をするなら

この機種の実測データ(出典)

RTX 4050 Laptop の llama.cpp 公開ベンチマーク(GitHub Discussion): llama-2-7b Q4_0 = 43.72 tok/s。この値からメモリ帯域幅に対する実効係数(87%)を求め、他モデルの速度推定に使っています。

よくある質問

GeForce RTX 4050 LaptopでローカルLLMは動く?

動きます。VRAM6GB(実効約5.5GB)に、収録40モデル中12本が載ります。日本語チャットならGemma 3n E4B(5bit(Q5_K_M))が推定約33 tok/sです。

GeForce RTX 4050 Laptopで動かないモデルは?

Qwen3 8Bは4bitで約6.5GB必要で、VRAMがあと約0.9GB足りません。

この機種で判定ツールを開く