VRAM 16GBで動かすローカルLLM完全ガイド|モデル別の早見表と「収まる・あふれる」の境界を実測で解説

VRAM 16GBで動かすローカルLLM完全ガイドをテーマにしたアイキャッチ画像 GPU・グラフィックボード

VRAM 16GBとは、GPUが搭載するビデオメモリ容量のこと。ローカルLLM推論では、主にモデルの重み、KVキャッシュ、実行バッファなどの置き場として使われます。

VRAM 16GBのGPUで動くローカルLLMは、量子化を前提にすれば7B〜14B級が快適、32B級は条件次第、70B級は16GB単体では快適に動かない(オフロード/複数GPU前提)。この境界を決めるのはモデルの重みだけではありません。文脈長(num_ctx)に応じて膨らむKVキャッシュなどの確保分も16GBを圧迫します。まずは早見表で使いたいモデルが収まるかを確認し、その後で「なぜそうなるのか」を仕組みから見ていきます。

この記事の要点

  • ・VRAM 16GBで快適に動くのは7B〜14B級、32B級は量子化とオフロード次第、70B級は16GB単体では快適に動かない(オフロード/複数GPU前提)
  • ・収まるかどうかは「モデル重み+KVキャッシュなどの確保分+実行バッファ」の合計で決まる
  • ・同じモデルでも量子化(Q4/Q8/FP16)とnum_ctxで収まる・あふれるが反転する

VRAM 16GBのグラフィックボードはここから比較できる。

VRAM 16GBで動くローカルLLM早見表|収まる・あふれる・動かないの一覧

最初に結論を表で渡します。下の早見表は、パラメータ帯と量子化の組み合わせごとに、16GBのGPU単体で「快適に収まる/ギリギリ/オフロード前提/動かない」を整理したもの。自分が動かしたいモデルの規模を縦軸で探し、量子化を横軸で見れば、おおよその判定が3スクロール以内で付きます。

早見表の見方|「収まる」が何を意味するか

ここでいう「収まる」は、モデルの重みと推論に必要なメモリが16GBの中に入り、CPUへのオフロードなしにGPUだけで動く状態を指します。「ギリギリ」は、短い文脈なら入るが、num_ctxを伸ばすとあふれる境界帯。「オフロード前提」は、一部の層をCPU(システムRAM)へ逃がさないと載らない状態を意味します。

注意したいのが、この判定は固定値ではないという点。同じモデルでも、文脈長を長く取ればKVキャッシュなどの確保分が増え、収まっていたものがあふれます。早見表はあくまで「標準的な文脈長で動かした場合の目安」として読んでください。実測値による裏付けは後半のセクションで示します。

7B〜70Bまでモデル規模別のVRAM目安一覧

下の数値は「パラメータ数×量子化のビット幅」から導いた重みの概算です。実際にはこれに推論時のバッファとKVキャッシュなどの確保分が上乗せされるため、重みの目安に2〜3GB程度の余裕を見て判断するのが現実的。なお、Gemma 4 E4Bのように表記上の有効パラメータと実メモリがズレるモデルでは、同じ量子化でも目安より上振れします。

パラメータ帯 Q4量子化の重み目安 Q8量子化の重み目安 16GB単体での可否 使いどころ
3B〜4B級 約2〜5GB 約4〜9GB 余裕で収まる 常駐させたまま要約・分類を裏で流す帯。文脈も伸ばしやすい
7B〜8B級 約4〜5GB 約7〜8GB 快適に収まる 対話とコード補完の常用帯
12B〜14B級 約8〜9GB 約14〜15GB Q4は収まる/Q8はKVキャッシュ込みで超えやすい 品質を上げたい対話向け。Q4なら4GiB前後のマージンが残る
27B〜32B級(Dense) 約16〜20GB 約32GB以上 Q4_K_Mは超える(当サイトのRTX 5080実測ではGPU常駐61〜78%で動作)/Q3級まで落とすと1枚に載る例がある Q4_K_Mのままでも動くが7〜13 tok/sで待ちが大きい。Q3級に落として全量載せるのが現実的で、Qwen3.8-27BのUD-Q3_K_XLはGPU側13,068MiBに収まり、RTX 5060 Tiで28.61・RTX 5080で52.69 tok/s(llama.cppでの別記事の実測)
MoE型(30B〜35B-A3B等) 約19〜24GB(モデル依存) 条件次第 Q4_K_M級は1枚には載りきらない(GPU常駐58〜75%) あふれても活性が小さいぶん速度が残る帯。5060 Tiで約50〜62・5080で約56〜73 tok/s(後述の実測)
70B級 約40GB 約70GB 16GB単体への全量GPUロードは不可 2枚目のGPUかRAMオフロードが前提

表で押さえておきたいのが、MoE(Mixture of Experts)型の扱い。MoE型は各トークンで使う活性パラメータが小さいため、同じ総パラメータ数のDense型より計算量や生成速度の面で有利になりやすい。ただし、重みをGPUに全量載せる場合のVRAMは総パラメータ側に近づくため、「活性3Bだから3Bモデル並みのVRAMで済む」とは限らない。実際、Q4_K_M のダウンロードサイズは qwen3-coder:30b(A3B)が約18.6GB、qwen3.5/3.6 の35B-A3Bが約24GB、Gemma 4 26B A4Bでも約18GBあり、いずれも16GB単体には載りません。活性パラメータ相当の小ささにはなりません。16GB環境では、低ビット量子化やMoE重みのCPU配置、GPU/CPUオフロードを組み合わせて成立するケースが多い。このあたりの境界は後半の実測で具体的に示します。

逆に、Dense型の32B級をFP16(量子化なし)で動かすのは16GBでは現実的ではありません。重みだけで60GB超を要するため、24GBや32GBのGPUでも単体では厳しい帯。16GBで32B級に手を出すなら、Q4まで落としたうえで、あふれる分をCPUや2枚目のGPUへ逃がす前提になります。

なぜ16GBで「収まる・あふれる」が決まるのか|VRAM消費の内訳と量子化

VRAM使用量は単一の数字ではなく、いくつかの要素の合計で決まります。内訳をざっくり分けると、モデルの重み、KVキャッシュなどの確保分、推論時の実行バッファの3つ。このうち最も大きいのが重みですが、文脈を長く取る使い方ではKVキャッシュなどの確保分が無視できない大きさに育ちます。

モデル重みの計算|パラメータ数×量子化ビット幅

モデルの重みが占めるVRAMは、おおまかに「パラメータ数×1パラメータあたりのビット幅÷8」で求まります。FP16なら1パラメータ16ビット(2バイト)なので、7Bモデルは約14GB。これがQ8(8ビット相当)になると半分の約7GB、Q4(4ビット相当)ならさらに半分の約3.5〜4GBまで下がる、というのが量子化の効きどころ。

つまり同じ7Bモデルでも、FP16なら16GBに対してかなり窮屈、Q4なら余裕で収まります。「7Bが動くか」ではなく「どの量子化の7Bが動くか」で考えるのが正しい見方。量子化はモデルの重みを圧縮する技術で、ビット幅を落とすほどVRAMは小さくなりますが、その分だけ精度がわずかに削られます。このトレードオフの詳細は次のセクションで扱います。

ここで効いてくるのが、パラメータ数と量子化の掛け算で重みが決まるという関係。14B級をQ4で動かすと約8〜9GB、32B級をQ4で動かすと約18〜20GB。16GBという容量に対して、14B級Q4は十分なマージンがありますが、32B級Q4は重みだけで容量を超えるか、超えなくても推論バッファ込みであふれます。この差が「収まる・あふれる」の分かれ目。

context長とKVキャッシュなどの確保分がVRAMを食う仕組み

見落とされがちなのが、重みとは別にVRAMを消費するKVキャッシュなどの確保分。LLMが文章を生成する際、過去のトークンの状態を保持しておくためのメモリで、文脈長(num_ctx)に比例して増えていきます。短い質問応答なら小さく済みますが、長文の要約や大きなコードベースを読ませる用途では、この確保分が数GB単位で膨らむことがある。

そのため、重みが16GBに収まっていても安心はできません。num_ctxを4096から32768へ伸ばせば、確保分が大きく増えて16GBからあふれる、という現象が起きます。「モデルは載ったのに長い文脈を渡したら落ちた」というケースの多くは、これが原因。

モデルの重みが16GBに収まっても、num_ctx(文脈長)を大きく取るとKVキャッシュなどの確保分が膨らみ、推論の途中でVRAM不足になることがあります。長い文脈を扱う用途では、重みに余裕を持たせた量子化を選ぶか、文脈長を必要な範囲に絞ること。

増えた分をすべて「KVキャッシュ分」と言い切れない点にも触れておきます。実際には注意機構のための一時バッファや、推論エンジンが確保する作業領域なども含まれるため、ここでは「KVキャッシュなどの確保分」とまとめています。いずれにせよ、文脈長を伸ばすほどVRAMの余裕が削られる、という方向性は変わりません。

量子化と文脈長、この2つを動かすと収まり方が変わるため、早見表の判定は「標準的な文脈長での目安」と捉えるのが正確。実際の境界がどこにあるのかは、数値で確かめるのが一番確実です。次は当サイトの検証環境での実測値で、16GBの収まり方を裏付けていきます。

モデルサイズ別の実際|7B・14B・32Bを16GBで動かす境界線

ここからは早見表の概算を、当サイトの検証環境での実測値で深掘りします。VRAM使用量はいずれもnvidia-smiのmemory.used由来のGPU全体の使用量(デスクトップ表示などのベースライン込み、単位はMiB)で、モデル単体の増分とは別物。GPUの世代やドライバ、モデルのタグ更新で数値は動くため、各表の計測条件はその表の上に添えています。

まず、当サイトの検証環境にある2枚のカード(RTX 5060 Ti 16GB / RTX 5080)を、それぞれ1枚だけで動かしたときの実測早見表。重みはいずれもQ4_K_M級です。

この表の計測条件|2026-06-12/RTX 5060 Ti 16GB(Oculink)とRTX 5080をそれぞれ1枚/Ollama 0.23.3/3回計測の平均/生成512トークン/num_ctxは既定値/思考モードを持つモデル(gemma4等)はthink=false/VRAMはnvidia-smiのmemory.used(GPU全体の使用量・MiB)

モデル(Q4_K_M) パラメータ 5060 Ti 速度(tok/s) 5080 速度(tok/s) 5060 Ti VRAM(GPU全体) 5080 VRAM(GPU全体) 16GB単体の判定
llama3.2:3b 3B 157.7 275.2 3353MiB(3.27GiB) 5580MiB(5.45GiB) 余裕
phi4-mini:3.8b 3.8B 133.6 236.3 4065MiB(3.97GiB) 6250MiB(6.10GiB) 余裕
gemma3:4b 4B 115.7 191.6 4011MiB(3.92GiB) 6213MiB(6.07GiB) 余裕
mistral:7b 7B 84.8 153.0 5513MiB(5.38GiB) 7709MiB(7.53GiB) 快適
llama3.1:8b 8B 79.1 141.2 5961MiB(5.82GiB) 8189MiB(8.00GiB) 快適
deepseek-r1:8b 8B 73.2 121.6 6177MiB(6.03GiB) 8378MiB(8.18GiB) 快適
qwen3.5:9b 9B 59.8 102.9 8073MiB(7.88GiB) 10245MiB(10.00GiB) 快適
gemma3:12b 12B 47.9 83.0 9209MiB(8.99GiB) 10719MiB(10.47GiB) 収まる
qwen3:14b 14B 42.7 76.8 10117MiB(9.88GiB) 11887MiB(11.61GiB) 収まる
phi4:14b 14B 44.0 78.2 10445MiB(10.20GiB) 12171MiB(11.89GiB) 収まる
codestral:22b 22B 18.2 30.3 14025MiB(13.70GiB) 15380MiB(15.02GiB) ギリギリ(Dense全量ロードの上限付近)
gemma4:26b(MoE/A4B) 26B 31.0 36.4 14827MiB(14.48GiB) 15612MiB(15.25GiB) 一部CPUオフロード/GPU使用量は天井近く
qwen3.5:35b-a3b(MoE) 35B-A3B 15.4 18.9 14885MiB(14.54GiB) 15755MiB(15.39GiB) 16GB超・一部CPUオフロード前提・低速
qwen3.5:27b / gemma4:31b / qwen3:32b(Dense) 27〜32B — — — — 16GB超・一部CPUオフロード前提(この2026-06-12計測では未計測。後述の1枚での実測にあり)

この表から読み取れること。14B級まではどちらのカードでもVRAMに4〜6GiBの余裕を残して快適に動きます。同じモデルなら5080は5060 Tiの1.7倍前後(22Bまでで1.66〜1.80倍)の速度で、収まるかどうかは変わらず速さだけが変わる、という関係になっています。

22BのDense(codestral)は5060 Tiで13.7GiB・18tok/s台、5080でも15.0GiB・30tok/s台で、ここが16GB単体に全量ロードできるDense型の上限付近。27〜32BのDense型は、6月の計測ではOllamaのQ4_K_Mタグが「VRAM不足」としてスキップされていました。2026-08-25に1枚で測り直すと、Q4_K_Mのままでも動きます——ただしGPUに載るのは61〜78%で、速度は7〜13 tok/s(後述の表)。量子化を下げれば全量載ります(Qwen3.8-27Bの実測ではUD-Q3_K_XLがGPU側13,068MiBに収まり、5060 Tiで28.61・5080で52.69 tok/s。Q4_K_Mは合計16,326MiBで16GBを超える)。

一方、総35BのMoE(A3B)型は、重みがQ4_K_Mでも約24GB(qwen3.5:35b-a3b)で16GBには収まりきらず、一部をCPUへ逃がして動きます(5060 Tiで14.5GiB・15tok/s台、5080で15.4GiB・18.9 tok/s)。同じMoEでも総26BのGemma 4 A4Bは、GPU使用量が14.5〜15.3GiBまで達して31〜36tok/s出ます。ただしQ4_K_Mの配布サイズは約18GBあり、16GBに全量は載りません(2枚のカードが見える構成で測ると2枚合計19,760MiBを使っており、1枚では収まらないことがわかります)。このモデルも一部はCPU側に置かれた状態で、これも活性パラメータの小ささに反してVRAMは総パラメータ側に効いています。MoEの2本(26B A4Bと35B-A3B)だけは2枚のカードの差が1.2倍前後まで縮んでいて、容量の限界近くではGPUの素の速さ以外が効いてくることも読み取れます。活性が小さくても重みVRAMまで小さくなるわけではない——MoEを「小さいモデル」と早合点しないことが、16GB選びの勘所です。最新のqwen3-coder:30bやqwen3.6:35b-a3bも、16GB単体ではこのMoE帯と同じ窮屈さで、2026-08-17に1枚ずつで測るとモデルの58〜75%しかVRAMに載っていませんでした(後述の1枚での実測)。それでも生成速度はRTX 5060 Ti・RTX 5080それぞれ1枚で約50〜73 tok/sあり、あふれを解消して倍以上にしたいなら2枚目GPUでオフロードを解消した実測の構成になります。

VRAM 16GB(RTX 5060 Ti)に各モデルが収まるか RTX 5060 Ti 16GB単体・2026-06-12実測。3〜14B級は4〜6GiBの余裕で快適、22Bのcodestralは13.7GiBで収まり、MoE型(26B/35B-A3B)は14GiB前後まで使うが全量は載らず、27〜32B denseは16GB超で全量は載らない(この2026-06-12計測では未計測)。数値はGPU全体のVRAM使用量とtok/s。 VRAM 16GBに収まるか — RTX 5060 Ti 16GB 実測(2026-06・GPU全体使用量) VRAM 16GB 上限 llama3.2:3b 3.3GiB 157.7 tok/s・余裕 mistral:7b 5.4GiB 84.8 tok/s・快適 gemma3:12b 9.0GiB 47.9 tok/s・収まる phi4:14b 10.2GiB 44.0 tok/s・収まる codestral:22b 13.7GiB 18.2 tok/s・分水嶺 gemma4:26b (MoE) 14.5GiB 31.0 tok/s・一部CPUへ qwen3.5:35b-a3b (MoE) 14.5GiB 15.4 tok/s・一部CPUへ 27〜32B dense 16GB超 → 単体に収まらず 緑=快適に収まる/琥珀=GPU使用量は天井近くだが全量は載らない/赤=16GB超で単体には収まらない。MoEは活性が小さくても重みVRAMは総パラメータ側に効く。
RTX 5060 Ti 16GB単体での各モデルのVRAM使用量(GPU全体・2026-06-12実測)。22Bが全量ロードの上限付近、27〜32B denseは16GB超で全量は載らない(この日は未計測)。

続いて、同じ16GBでも上位のRTX 5080単体での実測を見ます。コア数が多いぶん同じモデルでも速く、容量の使い切り方の違いも見えてきます。表に記載するVRAM使用量も同じくGPU全体の使用量(MiB)です。

7B〜14B(快適帯)の実測と推奨設定

7B〜8B級は16GBに対して余裕のある帯。当サイトの検証環境(RTX 5080単体)では、mistral 7B級が153.0 tokens/sec・GPU全体で7709MiB(7.53GiB)、llama3.1系の8B級が141.2 tokens/sec・8189MiB(8.00GiB)を記録しました。いずれもGPU全体使用量が8GiB前後で、16GBの半分程度。文脈長を多少伸ばしても余裕があり、対話用途なら最も扱いやすい帯です。

12B〜14B級になると、収まりつつも容量の使用率が上がります。gemma4の12B級は同じ日に別途測った値で73.8 tokens/sec・11042MiB(10.78GiB)(この1件だけ Ollama 0.30.7)、同じ表と同条件では14B級のphi4が78.2 tokens/sec・12171MiB(11.89GiB)、qwen3系の14B級が76.8 tokens/sec・11887MiB(11.61GiB)。GPU全体で11〜12GiBを使う計算で、16GBに対しては4GiB前後のマージンが残ります。この余裕が文脈長を伸ばす際の緩衝になる。14B級は速度と賢さのバランスが良く、16GBのGPUで常用するなら有力な帯です。

速度の傾向としては、パラメータ数が増えるほどtokens/secは下がります。8B級で約140 tokens/sec、14B級で約75 tokens/secと、規模が倍になると速度はおおむね半分前後。対話のレスポンスを重視するなら8B級、回答の質を取るなら14B級、という使い分けが現実的な落とし所になります。

20B台〜35B級の境界帯|16GBで収まる・あふれるの実際

20B後半〜32B級が16GBの境界帯。当サイトの検証環境(RTX 5080単体)では、codestral 22B級が30.3 tokens/sec・15380MiB(15.02GiB)、Gemma 4 26B A4B(MoE型)が36.4 tokens/sec・15612MiB(15.25GiB)を記録しました。どちらもGPU全体使用量が15GiB台で、16GBのほぼ天井まで使い切っている状態。動作は確認できましたが、ここから文脈長を大きく伸ばす余地はほとんど残っていません。実際、qwen3の32B級(Dense)はこの6月の計測ではVRAM不足としてスキップされました(2026-08-25に測り直すと、Q4_K_MはGPUに64%だけ載った状態で7.4 tok/s。後述の1枚での実測)。Dense型の32B級は16GB単体では厳しい、という結論は変わりません。

ここで効いてくるのがMoE型の存在。Qwen3.5-35B-A3B(MoE)は、RTX 5080単体ではVRAMを15755MiB(15.39GiB)まで使い切り、それでも収まりきらない分が約4割ほどCPUへあふれた状態で動作します。総パラメータは35Bでも活性パラメータが小さいMoEのため、CPUへ一部を逃がせばDense型の32B級が載らない16GBでも一応動く。ただし速度は18.9 tokens/secと、対話には少し待ちを感じる水準まで落ちます。「35Bが16GBで動く」のは事実ですが、CPUオフロード前提で快適とまでは言い切れないのが境界帯の正直なところ。

OOM(メモリ不足)を避けるための実務的な指針としては、20B台〜32B級に手を出すなら、Q4以下の量子化を選び、num_ctxを欲張らないこと。特に30B〜35B級のMoEや32B Denseでは、Q4_K_Mでも16GB単体に全量GPUロードできない場合があるため、低ビット量子化やCPU/GPUオフロードを前提に考えるのが安全です。当サイトの検証で15GiB台まで使い切っているモデルは、文脈長を伸ばした瞬間にあふれる可能性が高い帯です。ここで確認できたのは「標準的な文脈長で動作した」という範囲であり、長い文脈での上限までは未検証。それ以上を求めるなら、2枚目のGPUへ一部を逃がすオフロードという次の手が必要になります。

1枚だけで動かしたときの実測|12B〜14B級・MoE・27〜32B Dense

16GBのカードを1枚だけ使い、12B〜14B級・MoE型・27〜32B級のDense型がどこまで載るかを測ったものです。GPU常駐率は、モデルのうちVRAMに載っている割合(Ollamaの/api/psが返すsize_vram÷size)で、残りはCPU側に置かれます。

この表の計測条件|2026-08-17/RTX 5060 Ti 16GB(Oculink)とRTX 5080をそれぞれ1枚/Ollama 0.32.3/3回計測しIQRで外れ値を除いた中央値/生成512トークン/think=false/実際にロードされた文脈長 8192/VRAMはnvidia-smiのmemory.used(GPU全体の使用量・MiB)/27〜32B Denseの3本だけ2026-08-25(他の条件は同じ)。この3本は毎回モデルをアンロードし、ロード直前のRTX 5080の空きVRAMが14.7〜14.8GBあることを確認してから測っています。
なお、RTX 5080はデスクトップ表示にも使っているためロード前の空きVRAMが約14.9GB、RTX 5060 Tiは表示に使っておらず約16.1GBです。一部がCPU側に置かれているモデル(GPU常駐率が100%未満のもの)は、GPUに載る層数がこの空きVRAMで変わります。2枚の速度差はカードの優劣を示す数字ではありません(27〜32B Denseの3本をRTX 5080の値だけにしているのはこのためです)。

モデル(Q4_K_M級) 5060 Ti 速度(tok/s) 5080 速度(tok/s) 5060 Ti VRAM(GPU全体) 5080 VRAM(GPU全体) GPU常駐率(5060 Ti/5080)
gemma4:12b(12B) 46.4 80.0 8554MiB(8.35GiB) 10030MiB(9.79GiB) 100%
qwen3:14b(14B) 43.6 80.2 10142MiB(9.90GiB) 11625MiB(11.35GiB) 100%
phi4:14b(14B) 44.1 80.4 10368MiB(10.13GiB) 11838MiB(11.56GiB) 100%
qwen3-coder:30b(30B-A3B・MoE) 61.8 72.5 14260MiB(13.93GiB) 15350MiB(14.99GiB) 75%/74%
qwen3.6:35b-a3b(35B-A3B・MoE) 49.9 55.5 14612MiB(14.27GiB) 15583MiB(15.22GiB) 59%/58%
qwen3.5:27b(27B・Dense) — 12.8 — 15626MiB(15.26GiB) 78%(5080)
gemma4:31b(31B・Dense) — 7.5 — 15546MiB(15.18GiB) 61%(5080)
qwen3:32b(32B・Dense) — 7.4 — 15407MiB(15.05GiB) 64%(5080)

12B〜14B級は両方のカードで常駐率100%、VRAMはGPU全体で8〜12GiB台に収まりました。速度は5060 Tiが43〜46 tok/s、5080が80 tok/s前後で、カード間の差は約1.7〜1.8倍。上の2026-06-12の表と同じ判定で、この帯が16GBに余裕を持って収まるという結論は動きません。

見え方が変わったのはMoE型のほう。qwen3-coder:30bとqwen3.6:35b-a3bはどちらも1枚には載りきらず、GPU常駐率は58〜75%で、残りはCPU側に置かれた状態です。それでも生成速度は5060 Tiで約50〜62 tok/s、5080で約56〜73 tok/sあり、あふれた割合ほどには落ちていません。MoEは1トークンの生成に使う重みが総パラメータのごく一部なので、CPU側に残った分を通っても計算量が小さく済むためです。ただしVRAMはどちらのカードでも14〜15GiB台まで埋まっていて、文脈長を伸ばす余地はほとんど残っていません。

同じ「あふれた状態」でも、DenseとMoEでは落ち方がまるで違います。27〜32BのDense 3本はGPU常駐率61〜78%で7〜13 tok/s。MoEの2本は常駐率58〜75%とほぼ同じ割合しか載っていないのに、約56〜73 tok/s出ています。速度を決めているのは、あふれた量ではなく1トークンの生成に使う重みの量のほう。16GBで30B級を狙うなら、DenseかMoEかを先に見るのが早い。

同じ日に2枚構成(RTX 5080+RTX 5060 Ti)で測ると常駐率は100%に戻り、qwen3.6:35b-a3bが129.3 tok/s、qwen3-coder:30bが157.8 tok/s。RTX 5080単体との差は約2.2〜2.3倍。これは同じ日・同じ条件で測った1枚と2枚の比較です。一方、1枚側があふれてどこまで落ちるかはモデルと実行環境でかなり振れます(2026-06-12にRTX 5080単体で測った値は、qwen3.5:35b-a3bが18.9 tok/s、qwen3.6:35b-a3bが62.2 tok/sと、同じ日の同じカードでも3倍以上違いました。この2つはOllamaのバージョンも違います)。倍率を別の日の測定と並べて「何倍になった」と読むのは避けてください。

16GBを超えるモデルを動かす|CPUオフロードとllama.cppの設定

「あふれる」モデルを諦める必要はありません。VRAMに載りきらない層をRAM側へ逃がすのがGPU/CPUオフロード。llama.cppならGPUに載せる層数を指定し、残りをCPUに分担させます。

llama.cppではオフロード層数の指定(GPUに何層載せるか)でVRAMと速度を調整します。層数を増やすほどGPU処理が増えて速くなりますが、その分VRAMを食う。16GBに収まる限界まで層を載せ、あふれる分だけをCPUに回すのがセオリーです。ここで効いてくるのがRAM容量。CPU側に逃がした層はシステムメモリを使うため、32GB以上、できれば64GB級あると大型モデルでも余裕が出ます。Ollamaは収まらない分を自動でCPUに振り分ける挙動。手軽な反面、思った以上にCPU側へ逃げて速度が落ちる場合もあります。

速度の落ち方は実測で確認できました。Qwen3.5-35B-A3Bは、RTX 5080単体(超過分がCPUへあふれた状態)だと18.9 tokens/secでした。これを2枚目のRTX 5060 Ti(Oculink接続)へ分散してCPUあふれを解消すると124.9 tokens/secまで上昇。当サイトの検証環境(RTX 5080+5060 Ti・num_ctx=4096)での値です。1枚で無理に押し込むより、空いたGPUへ逃がすほうが速い、という結果。CPUオフロードはRAMへ逃がす分どうしても遅くなりますが、「動かない」が「動く」に変わる現実解です。

16GB VRAMのGPU選びと用途別の落とし所

結局どの16GB GPUを買うか。当サイトで使っている2機種に、コスパ候補のRTX 5070 Tiを加えて整理します。

項目 RTX 5060 Ti 16GB RTX 5070 Ti RTX 5080
VRAM 16GB GDDR7 16GB GDDR7 16GB GDDR7
CUDAコア 4608 8960 10752
メモリインターフェース幅 128-bit 256-bit 256-bit
TDP 180W 300W 360W
参考価格(2026年6月・国内実売の確認時点。在庫や為替で変動) 90,000円〜 175,000円〜 200,000円台〜
AI用途の目安 16GB帯の入門・LLM推論 コスパ重視の主力 速度重視の上位

3機ともVRAMは16GBで、収まるモデルの大きさは同じ。違いは演算性能とメモリ帯域、つまり「同じモデルがどれだけ速く回るか」です。生成速度は重みを読み出す帯域に強く効くので、同じGDDR7でもバス幅が128-bitの5060 Tiと256-bitの5070 Ti/5080では差が出ます。kakaku.com 2026-06時点の参考価格でも、RTX 5060 Ti 16GBは9万円台から手が届きます。

LLM推論が主目的なら、まずRTX 5060 Ti 16GB。16GBという容器の大きさが収まるモデルを決め、容量が同じなら入門帯でも同じモデルが動きます。速度に投資する余裕があればRTX 5080。画像生成やComfyUIも兼ねるなら、生成枚数がCUDAコア数に響くため5070 Ti以上が快適です。

この早見表から一歩踏み込むと、極端な量子化で27B級を16GBに載せられるかは1bit・Ternary圧縮の実測で、拡散型という新しいモデルの載り方はDiffusionGemmaをローカルで動かす検証で個別に追っています。

グラボ単体で買うならこの記事で見た「VRAM 16GB」の条件のまま、グラフィックボードを型番ごとに絞り込めます。長さ・厚み・推奨電源も出しています。

GPU選びを開く →

VRAM 16GBを積んだPCごと探すならこの記事で見た「VRAM 16GB」の条件のまま、販売中のBTOパソコンを絞り込めます。GPU・メモリ・価格から探せます。

BTO選びを開く →

まとめ

16GBで動くかどうかは、モデルの大きさ・量子化・文脈長の3つで決まります。7B〜14B級はQ4で余裕、Q4_K_Mで全量GPUロードできる上限はDense 22B級付近で、26BのMoEは一部CPUオフロードを含めて動きます。27B級以上のDense型もQ4では全量ロードが厳しく、CPU/RAMオフロードや複数GPUが前提です。収まらないときは量子化を落とすか、CPU/2枚目GPUへのオフロードという次の一手。当サイトの検証では、35B-A3Bを1枚で18.9、2枚で124.9 tokens/secと差が出ました(2026-06-12実測。2026-08-17に別のMoE 2本を同じ条件で測ったときの1枚と2枚の差は約2.2〜2.3倍)。まず使いたいモデルの規模を決め、それに16GBが足りるかで判断するのが近道です。

よくある質問

Q. VRAM 16GBで32Bモデルは動きますか?

Dense型の32B級はQ4でも16GB単体への全量ロードは厳しく、オフロードが前提です。実際に2026-08-25にRTX 5080単体で測ると、qwen3:32bのQ4_K_MはGPUに64%だけ載った状態で7.4 tok/sで動きました。Q4_K_Mで全量GPUロードできる上限はDense 22B級付近で、26BのMoEは一部CPUオフロードを含めて動きます。当サイトの検証環境(RTX 5080単体)ではcodestral 22B級が15380MiB(15.02GiB)とほぼ天井。MoE型の35B-A3Bは15755MiB(15.39GiB)までVRAMを使い切り、超過分がCPUへあふれるため速度は18.9 tokens/secまで落ちます(いずれも2026-06-12実測。同じ35B-A3B級でも値はモデルと実行環境で大きく振れ、2026-08-17にRTX 5080単体で測ったqwen3.6:35b-a3bは55.5 tokens/secでした)。

Q. 量子化はQ4とQ8のどちらを選ぶべきですか?

16GBに収めたいならQ4が現実的です。Q8は精度が高い分VRAM消費が約2倍になり、中型モデルでは収まらなくなります。一般的にQ4_K_Mは品質とサイズのバランスが良く、定番の実用ラインの一つです(用途によってはIQ系・UD系も選択肢)。

Q. オフロードすると遅くなりますか?

CPU側へ逃がすと遅くなりますが、2枚目のGPUへ逃がす場合は速くなることもあります。当サイトの検証では35B-A3Bを1枚から2枚構成にして約1.9〜6.6倍に向上しました。幅があるのは、1枚側がどれだけCPUへあふれていたかで変わるためです(2枚側は約122〜125 tok/sでほぼ一定)。なお2026-08-17にqwen3.6:35b-a3bとqwen3-coder:30bで同じ比較をしたときは約2.2〜2.3倍でした。

参考資料

Metaが公開した30Bクラスのモデルを16GBで動かした実測は、Muse Glimmer 30BをVRAM 16GBで動かす にまとめている。層数の指定・総コンテキスト指定・DFlashの効き方を測った。

「収まる・あふれる」の境界をVRAMの数字だけで引けない例として、MiniMax Music 3をVRAM 16GBで動かすがある。空き容量に応じて確保量が変わるため、観測されたピークが必要量にならない。

一段下の 12GB でどこまで動くかはVRAM 12GBの壁はどこにあるか|context・動画フレーム数・あふれた後の分かれ目を実測で測っている。

アフィリエイトについて
当サイトはAmazonアソシエイト・プログラムの参加者です。Amazonのアソシエイトとして、当サイトは適格販売により収入を得ています。本記事には各種アフィリエイトリンク(広告)を含み、リンク経由で購入されると当サイトに紹介料が入ります。読者の購入価格は変わりません。
タイトルとURLをコピーしました