ローカルLLM用PCのおすすめスペック|VRAM 16GBの3つの価格帯を構成と速さで比較

ローカルLLM PC スペックに関する記事のアイキャッチ画像 - ローカルLLM用PCのおすすめスペック|VRAM 16GBの3つの価格帯を構成と速さで比較 GPU・グラフィックボード

この記事の要点

ローカルLLM用のPCを、エントリー・ミドル・ハイエンドの3つの価格帯で比べた。この記事で比べる3つの価格帯はどれも VRAM の容量が同じなので、VRAM に全部載せられるモデルの大きさはほぼ同じだ。差が出るのは速さで、VRAM に全部載る LLM と今回の画像生成では、ハイエンドはエントリーより生成にかかる時間が短く、ミドルの模擬値はその間だった。

VRAM に全部載る大きさのモデルでチャットやコーディングをするなら、エントリーでも動き、待ち時間をどこまで縮めたいかで価格帯を上げる。画像生成を数多く回すなら、今回のモデルではハイエンドがエントリーより1枚が速かった (ミドルの模擬値はその間)。

VRAM に収まらない大きなモデル (今回測ったのは MoE という作りのもの) では、生成の速さの価格帯の差が小さかった。こうしたモデルを重く使うなら、GPU の価格帯より先にメインメモリの容量を決める。

用途別に選ぶローカルLLM用PC

ローカルLLM は、文章でやり取りする AI (大規模言語モデル) を、ネットの向こうのサービスではなく自分の PC で動かす使い方だ。その速さを大きく左右するのが GPU と、GPU に載っているメモリ (VRAM) になる。

この記事では、GPU が RTX 5060 Ti 16GB の完成品をエントリー、RTX 5070 Ti をミドル、RTX 5080 をハイエンドと呼ぶ。3つの価格帯は、どれも VRAM (GPU に載っているメモリ) が16GB の GDDR7 だ。同じモデルを同じ設定で使うなら、VRAM に全部載るかどうかは3つの価格帯でほぼ変わらない。違いが出るのは速さだ。

当サイトの BTO 選定ツールが2026年9月28日に集めた完成品 (標準構成) の価格の中央値は、エントリーが約38万円、ミドルが約48万円、ハイエンドが約61万円だった。価格の範囲は隣の価格帯と重なる。構成の中身は、後の「各価格帯の完成品のよくある構成」で詳しく見る。

RTX 5060 Ti には8GB版もあり、ここで扱うのは16GB版だけだ。VRAM の容量は NVIDIA の公称仕様 (Founders Edition / リファレンス設計) による。16GB でどんなモデルが動くかは「VRAM 16GBでローカルAIはどこまでできるか」を先に読むと、この先の話がつかみやすい。

用途ごとの選び方は次の表のとおり。

用途 選ぶ価格帯 メインメモリ 生成にかかる時間の目安 (LLM は512トークンの生成部分の計算値、画像は1枚あたり)
VRAM に全部載る大きさのモデルでチャット・コーディング (この記事では9B〜14B の3モデル) エントリーでも動く。待ち時間を縮めたい分だけ上の価格帯へ (ミドルの秒数は RTX 5070 Ti の実機ではなく模擬値) 32GB以上 qwen3:14b で、エントリー約11.7秒/ミドル (模擬値) 約6.8秒/ハイエンド約6.6秒
画像生成をよく回す (この記事では FLUX.2 Klein 9B の1モデル。非商用ライセンスのモデル) 今回のモデルではハイエンドがエントリーより速く、ミドル (模擬値) はその間 32GB以上 FLUX.2 Klein 9B (Q8_0)・1024×1024 の2枚目 (読み込み済み) で、エントリー8.8秒/ミドル (模擬値) 5.8秒/ハイエンド4.7秒
VRAM に収まらない大きなモデルを重く使う (この記事では、コーディング向けの qwen3-coder:30b を含む MoE の30B〜35B の3モデル) 今回の MoE の3モデルでは、生成部分の価格帯の差が小さかった。生成の速さだけで見るなら価格帯は予算に合わせてよいが、長いコードや資料を読み込む速さは価格帯ごとに比べていない (MoE でないモデルも測っていない) 64GB以上を先に決める (あふれた分の置き場の余裕を見た目安。64GB では測っていない) qwen3.5:35b-a3b で、エントリー約9.8秒/ミドル・ハイエンド約8.2〜9.2秒 (ミドルは模擬値。今回の測定では両者の差を見分けられなかった)

トークンは、LLM が文章を区切って扱う単位のことだ。LLM の秒数は、512トークンを生成する部分だけの計算値になる。同じ長さの応答なら、実際に画面で待つ時間はこれに質問の読み込みなどが加わる。LLM は速さだけを測っており、回答の質は比べていない。

ミドルは RTX 5080 を制限した模擬値、エントリーは外付け接続で測った値だ。秒数はメインメモリ96GB の測定機での値で、メインメモリの欄はこの記事の目安になる (32GB・64GB の完成品では測っていない)。VRAM からあふれるモデルの速さは、CPU とメインメモリの構成でも変わる。詳しい条件は最後の「測定の条件と注意点」にまとめた。

コーディング向けのモデルでも、この記事で測った qwen3-coder:30b は VRAM に全部は載らず、表の3行目の側に入る。使いたいモデルが VRAM に全部載るかどうかで、見る行が変わる。

MoE は、モデル全体は大きいが、1トークンを作るたびに計算に使うのはその一部だけという作りのモデルを指す。詳しくは後の節で扱う。

ここでの価格帯の分け方は VRAM 16GB の GPU だけに絞った分け方で、販売店の「エントリー」「ミドル」の表記と一致するとは限らない。完成品の構成表にある GPU の型番で当てはめる。RTX 5060 Ti には型番が同じ8GB版があるので、構成表で VRAM が16GB かどうかも確かめる。

各価格帯の完成品は、VRAM 16GB・メモリ32GB以上の完成品の一覧で見比べられる。16GB 以外も含めて予算帯ごとに考えたい場合は、AI用PC 購入ガイドが入り口になる。

3つの価格帯の GPU のスペック

3つの価格帯の GPU を、公称仕様で並べる。

GPU VRAM メモリバス幅 消費電力の目安 (Total Graphics Power) 推奨電源容量 (Required System Power)
RTX 5060 Ti 16GB (エントリー) 16GB (GDDR7) 128-bit 180W 600W
RTX 5070 Ti (ミドル) 16GB (GDDR7) 256-bit 300W 750W
RTX 5080 (ハイエンド) 16GB (GDDR7) 256-bit 360W 850W

値はすべて NVIDIA の公称仕様で、Founders Edition またはリファレンス設計のカードが前提だ。メーカー製のカードでは消費電力などが異なることがある。推奨電源容量は、NVIDIA が基準にした PC での最小値で、CPU など構成によって変わる。

VRAM の容量が同じなので、VRAM に全部載せられるモデルの大きさは3つの価格帯でほぼ同じだ。違いは速さに出る。GPU 単体の違いをもっと詳しく知りたい場合は「VRAM 16GB GPU を選ぶなら|AI 用途別に比較」で扱っている。

実測と模擬値で見る速さの違い

エントリーとハイエンドは実機で測り、ミドルは RTX 5080 を制限して RTX 5070 Ti に近づけた模擬値で見る。まずは、LLM が512トークンの文章を生成するのにかかる秒数だ。

VRAM に全部載る LLM の生成時間 (512トークン)

モデル エントリー (RTX 5060 Ti 16GB) ミドル (RTX 5070 Ti を想定した模擬値) ハイエンド (RTX 5080)
qwen3.5:9b (VRAM に全部載る) 約7.6秒 約5.2秒 約4.6秒
gemma3:12b (VRAM に全部載る) 約10.4秒 約6.4秒 約6.0秒
qwen3:14b (VRAM に全部載る) 約11.7秒 約6.8秒 約6.6秒

エントリーの実測値に比べ、ミドルの模擬値では生成にかかる時間が大きく縮んだ (RTX 5070 Ti の実機で同じだけ縮むかは測っていない)。ミドル (模擬値) からハイエンドへの縮み方は、gemma3:12b と qwen3:14b では小さかった。この3モデルは各条件1回ずつ (2026年9月28日) 測った値で、VRAM からあふれる3モデルで見た測り直しによる違いがここでも出るかは確かめていない。

この秒数は、下の毎秒トークン数から計算した生成部分だけの値だ。質問 (プロンプト) を読み込む時間やモデルを読み込む時間は含まないので、実際に画面で待つ時間はこれより長くなる。ミドルは模擬値、エントリーは外付け接続での測定になる。

画像生成の1枚あたりの時間

画像生成は FLUX.2 Klein 9B を量子化して小さくした Q8_0 版で、1024×1024 の画像を作った。FLUX.2 Klein 9B は、開発元が非商用のライセンス (FLUX Non-Commercial License) で公開しているモデルで、モデル自体を仕事や本番の用途、収益につながる用途で使うには開発元の別の許諾が要る。また、違法・権利侵害のコンテンツを防ぐフィルターを設けるか、生成した画像を人に見せたり送ったりする前に (公開かどうかを問わず) 確かめることも、使う条件になっている。生成した画像の扱いはモデルの使い方とは別に定められているので、使う前にライセンスの原文を確かめる (同じ開発元の FLUX.2 Klein 4B は Apache 2.0 で公開されている)。

条件 2枚目 (読み込み済み) 1枚目 (読み込みを含む)
エントリー (RTX 5060 Ti 16GB) 8.8秒 15.7秒
ミドル (RTX 5070 Ti を想定した模擬値) 5.8秒 13.0秒
ハイエンド (RTX 5080) 4.7秒 11.7秒

ハイエンドはエントリーより1枚が速く、ミドル (模擬値) はその間だった。2枚目は、同じワークフロー・同じプロンプトで、seed だけを変えて続けて作ったときの値だ。測ったのは1モデル・1ワークフローの時間だけで、画像の出来は比べていない。1枚目はモデルの読み込みを含むため、外付け接続のエントリーでは読み込みの時間が接続の影響を受けうる。どれも単一のワークフロー・単一のプロンプトでの値で、ミドルは模擬値になる。

秒数のもとになった測定値 (1秒あたりに作れるトークン数)

上の LLM の秒数は、ここに載せる1秒あたりに作れるトークン数 (毎秒トークン数) から計算した。3回測った中央値で、この表の3モデルは3つの条件とも VRAM に100%載っていた。

モデル エントリー (RTX 5060 Ti 16GB) ミドル (RTX 5070 Ti を想定した模擬値) ハイエンド (RTX 5080)
qwen3.5:9b 毎秒67.5トークン 毎秒98.4トークン 毎秒110.8トークン
gemma3:12b 毎秒49.4トークン 毎秒80.2トークン 毎秒85.1トークン
qwen3:14b 毎秒43.6トークン 毎秒75.8トークン 毎秒77.7トークン

ミドルは RTX 5070 Ti の実機の値ではなく、RTX 5080 を制限した模擬値だ。エントリーは外付け接続で測っており、完成品の内蔵接続とは接続の帯域が違う。その影響は測っていない。いずれも単一の測定機・単一のプロンプトでの値で、細部は最後の節に書いた。

大きなモデルを使うならメモリを先に決める

VRAM 16GB に収まらないモデルも動かせる。今回の測定では、VRAM に載りきらないモデルを Ollama が GPU とメインメモリの両方に分けて載せて動かした。どれだけ VRAM に載ったかは、ollama ps というコマンドで確かめられる (CPU 側と GPU 側に載った割合が表示される)。

今回測った3モデルは、どれも MoE (Mixture of Experts) と呼ばれる作りだ。開発元の公表値では、qwen3.5:35b-a3b と qwen3.6:35b-a3b の元になったモデルは全体で35B のパラメータを持ち、1トークンを作るたびに計算に使われるのは約3B だ。qwen3-coder:30b も、全体30B のうち1トークンごとに使われるのは3.3B とされている。

ただしモデル全体はどこかに置いておく必要があるので、VRAM 16GB からあふれる。あふれた分は、メインメモリが置き場になる。

モデル エントリー (RTX 5060 Ti 16GB) ミドル・ハイエンド (模擬値1回と RTX 5080 2回の範囲)
qwen3.5:35b-a3b (VRAM からあふれる) 約9.8秒 約8.2〜9.2秒
qwen3.6:35b-a3b (VRAM からあふれる・5月取得の版) 約9.7秒 約8.2〜9.0秒
qwen3-coder:30b (VRAM からあふれる) 約7.8秒 約6.4〜7.1秒

秒数は512トークンを生成する部分だけの計算値で、前の節と同じく実際に画面で待つ時間より短い。この3モデルは2026年9月29日に測り直した値で、ハイエンドはミドル (模擬値) の前後で2回測った。同じ RTX 5080 でも2回の差が最大で1割ほどあり、ミドル (模擬値) の値はその2回の範囲の中か近くに入ったので、ミドルとハイエンドは3回の範囲でまとめて示す。エントリーは外付け接続での測定だ。qwen3.6:35b-a3b は2026年5月に取得した版で測っており、今の既定タグ (qwen3.6:35b-a3b) とは中身が違う (今の qwen3.6:35b-a3b-q4_K_M タグと同じ中身)。

VRAM に全部載るモデルと比べると、価格帯を上げても、生成部分の秒数の縮み方は小さかった。ミドルとハイエンドの違いは、測るたびのばらつきに埋もれて見分けられなかった。

下の図は、VRAM に全部載る qwen3:14b とあふれる qwen3.5:35b-a3b を、毎秒トークン数で並べたものだ。棒が長いほど速く、上の表の秒数とは大小が逆になる。あふれる qwen3.5:35b-a3b は、ハイエンドを2回測った値をどちらも載せている。

価格帯ごとの生成速度 (14B と 35B-A3B)全部 VRAM に載るモデル (14B) と一部をメインメモリへ置くモデル (35B-A3B) で、3つの価格帯の生成速度の差がどう違うか14B・エントリー毎秒43.6トークン14B・ミドル(模擬)毎秒75.8トークン14B・ハイエンド毎秒77.7トークン35B-A3B・エントリー毎秒52.5トークン35B-A3B・ミドル(模擬)毎秒58.1トークン35B-A3B・ハイエンド1回目毎秒62.4トークン35B-A3B・ハイエンド2回目毎秒55.4トークン単位: tok/s
図: qwen3:14b (2026年9月28日) と qwen3.5:35b-a3b (9月29日に測り直し) の生成速度 (毎秒トークン数・3回の中央値)。ミドルは RTX 5080 を制限した模擬値。35B-A3B のハイエンドはミドルの前後で2回測った値

この結果は MoE の3モデルで見たもので、VRAM からあふれたモデル全般に当てはまるとは言えない。それでも、こうしたモデルを重く使うなら、あふれた分の置き場になるメインメモリの容量を、GPU の価格帯より先に決める。

目安は64GB 以上だ。これはあふれた分を置く余裕を見た目安で、測ったのはメインメモリ96GB の測定機だけになる。あふれ方をさらに詳しく追った実測は「16GB VRAMで38%あふれる qwen3.5:35b-a3b、2枚目でオフロード解消し約1.9倍に」にある。リンク先はこの記事とは別の測定で、あふれた割合も条件が違うため、この記事の表の値とはそのまま比べられない。

メインメモリを多めに積んだ完成品は、メモリ64GB以上の完成品の一覧から選べる。メモリそのものの選び方は「AI用PCのメモリ(RAM)選び方ガイド」で扱っている。

電源とストレージ

電源

NVIDIA が示す推奨電源容量は、エントリーの RTX 5060 Ti が600W、ミドルの RTX 5070 Ti が750W、ハイエンドの RTX 5080 が850W だ。これは NVIDIA が基準にした PC での最小値で、CPU やほかの部品の構成によって必要な量は変わる。

完成品の構成表にある電源容量を、この値と照らし合わせる。この値は下限の目安として扱う。

もう1つ注意がある。NVIDIA の仕様は Founders Edition またはリファレンス設計のカードが前提で、メーカー製カードの仕様はメーカーごとに異なりうる。完成品に載るカードはメーカー製のことが多い。

推論中に GPU が実際にどれくらい電力を使うかは「ローカルLLM推論時のGPU電力を実測|RTX 5080・5060 Tiの1枚/2枚構成を比較」で測っている。

ストレージ

この記事の測定で使ったモデルのファイルの大きさは、次のとおりだ。

モデル ファイルの大きさ
qwen3.5:9b (Q4_K_M) 6.6GB
gemma3:12b (Q4_K_M) 8.1GB
qwen3:14b (Q4_K_M) 9.3GB
qwen3-coder:30b (Q4_K_M) 18.6GB
qwen3.5:35b-a3b (Q4_K_M) 23.9GB
qwen3.6:35b-a3b (Q4_K_M・5月取得の版) 23.9GB
FLUX.2 Klein 9B (Q8_0) の3ファイル 19.0GB
合計 109.4GB

この記事で扱ったモデルだけで、合計109.4GB になる。値は Ollama と ComfyUI が保存しているファイルのバイト数を、1GB = 10億バイトで換算したものだ。FLUX.2 Klein 9B は本体・テキストエンコーダー・VAE の3ファイルの合計になる。

これはファイルの大きさで、実行時に使う VRAM やメインメモリの量ではない。同じモデルでも、量子化の種類が違えば大きさは変わる。

各価格帯の完成品のよくある構成

3つの価格帯の GPU を積んだ完成品が、実際にどんな構成で売られているかをまとめる。当サイトの BTO 選定ツールが2026年9月28日に集めた商品データのうち、GPU が RTX 5060 Ti 16GB・RTX 5070 Ti・RTX 5080 のデスクトップの完成品を、ツールの表示と同じく色違いなどを1機種にまとめて数えた (メーカー直販は含まない)。

価格帯 GPU (集計した機種) 価格 (中央値と、真ん中の半分の機種が収まる範囲) CPU (多いもの) メインメモリ SSD 電源 一覧
エントリー RTX 5060 Ti 16GB (7社・111機種) 約38万円 (約30万〜43万円) Core Ultra 7 270K Plus、Ryzen 7 9700X、Ryzen 7 7700 32GB が約7割、16GB が約3割。64GB は1機種 1TB が約8割 750W が約5割、650W が3割強。80 PLUS BRONZE が中心 メモリ32GB以上の一覧
ミドル RTX 5070 Ti (10社・164機種) 約48万円 (約44万〜55万円) Core Ultra 7 270K Plus、Ryzen 7 9800X3D 32GB が約6割、16GB が約3割。64GB は11機種 1TB が約7割、2TB が約3割 850W が約5割、1000W が約4割。80 PLUS GOLD が中心 メモリ32GB以上の一覧
ハイエンド RTX 5080 (11社・139機種) 約61万円 (約54万〜71万円) Core Ultra 7 270K Plus、Ryzen 7 9800X3D 32GB が約7割、64GB 以上が約2割、16GB が約1割 1TB が半分強、2TB が約4割 1000W が半分強、1200W が約3割。80 PLUS GOLD が中心 メモリ32GB以上の一覧

表の数字は2026年9月28日に集めた掲載価格と標準構成で、注文時に変更した構成は含まない。選定ツールの表示は定期的に更新されるので、ツールに出る機種数はこの表と変わることがある。CPU は機種ごとのばらつきが大きく、表に挙げたものでも各価格帯の1〜2割台だ。今売られている機種は表の一覧で確かめられる。一覧はこの記事の目安に合わせてメモリ32GB以上に絞った状態で開くが、絞り込みはその画面で外せるので、16GB の構成を探すこともできる。

価格の中央値は、エントリーからミドルで約10万円、ミドルからハイエンドで約13万円高かった。ただし価格の範囲は隣の価格帯と近いか重なる。真ん中の半分の機種で見ると、エントリーの上側 (約43万円) とミドルの下側 (約44万円) はほぼ並び、ミドルとハイエンドは約54万〜55万円で重なる。予算の額だけでは価格帯は決まらないので、構成表の GPU の型番で見分ける。GPU のほかにも、上の価格帯ほど容量の大きい電源を積んだ機種が多く、2TB の SSD を積んだ機種の割合も増えていた。

メインメモリは、どの価格帯も32GB が最も多かった。ただし標準で16GB の機種も、エントリーとミドルでは約3割あり、この記事の目安 (32GB以上) に届かない。64GB 以上を標準で積んだ機種は、エントリーでは1機種、ミドルでも11機種だけで、ハイエンドでも約2割だった。VRAM からあふれる大きなモデルのために64GB 以上にしたいなら、注文時にメモリを増やせるかを販売ページで確かめる。

電源は、多くの機種が NVIDIA の推奨電源容量 (エントリー600W・ミドル750W・ハイエンド850W) を上回る容量を標準で積んでいた。ミドルとハイエンドでは、推奨電源容量ちょうどの機種も約1割あった。推奨電源容量は基準の PC での下限の目安なので、構成表の容量と照らし合わせる。

測定の条件と注意点

前の節で省いた細部を、ここにまとめる。

測定機とソフト

  • 測定機は Intel Core i7-14700F・メインメモリ96GB・Windows。3つの条件は同じ日 (2026年9月28日) に同じ設定で測った。VRAM からあふれる3モデルだけは、翌日 (9月29日) に同じ設定で測り直した。ハイエンド→エントリー→ミドル→ハイエンドの順に測り、どの回も測る前にほかの処理が GPU を使っていないことを確かめている。エントリーもこの間に2回測っており、表にはミドルの直前に測った回の値を載せた (もう1回との差は毎秒トークン数で1〜3%)。
  • LLM は Ollama 0.34.4 で、各モデル Q4_K_M・コンテキスト長8192・思考モードなし。512トークンの生成を3回測り、その中央値を毎秒トークン数として示した。3回とも同じ日本語の質問 (50〜70トークン) を使い、seed を固定して生成を512トークンで打ち切った (どの回も512トークンまで生成した)。temperature は指定せずモデルの既定値のまま使った。測定の前にほかのモデルを VRAM から降ろし、測るモデルを読み込んだ状態で3回続けて測っている (毎秒トークン数に読み込みの時間は入らない)。
  • 画像生成は FLUX.2 Klein 9B (Q8_0 GGUF)・1024×1024・4ステップで、ComfyUI 0.37.1 (PyTorch 2.14.0+cu130) を3つの条件とも同じ起動設定で使った。使う GPU は、環境変数で GPU の番号を PCI バスの順にそろえたうえで (CUDA_DEVICE_ORDER=PCI_BUS_ID)、ComfyUI の起動時に番号で指定した (--cuda-device)。そのうえで、測定ログに記録した GPU の名前と識別番号、生成中のその GPU の VRAM 使用量と消費電力の上昇で、狙った GPU が動いていることを確かめた。モデルのファイルは flux-2-klein-9b-Q8_0.gguf・qwen_3_8b_fp8mixed.safetensors・flux2-vae.safetensors の3つだ (Q8_0 のファイルの SHA256 は dfa8908dd58c で始まる)。サンプラーは euler、スケジューラーは Flux2Scheduler (4ステップ)、CFG は1.0 で、seed は3つの条件で同じ値の並びを使った。ComfyUI を起動し直して1枚目と2枚目を測ることを3回くり返し、それぞれ中央値を示した。秒数は ComfyUI が知らせる実行開始から実行完了までの時間で、ComfyUI の起動にかかる時間は含まない (1枚目にはモデルの読み込みが入る)。
  • LLM の秒数 (512トークンを生成する部分だけ) は、512 ÷ 毎秒トークン数 で計算し、小数1桁に丸めた。

本記事の実測値は2026年9月28日 (VRAM からあふれる3モデルは29日) に、上記の測定機・設定で計測したもの。測定機の構成の詳細は検証環境のページにある。ほかの GPU やモデルでの値はAIハードウェア実測データベースから探せる。

ミドルの模擬値の作り方

  • ミドルは RTX 5070 Ti の実機ではなく、ハイエンドと同じ RTX 5080 (同じ PCIe 5.0 x16 の内蔵接続) を制限した模擬値だ。RTX 5070 Ti の消費電力 (300W)・メモリの速さ・演算の規模に近づけるため、電力上限を300W 相当 (83%) にし、コアクロックを 633MHz、メモリクロックを 1000MHz 下げた。CUDA コア数などの構成そのものは再現できないので、RTX 5070 Ti の実機の性能を示す値ではない。
  • 計測中の実際のクロック (9月28日の測定) は、コア約2,227MHz・メモリ約13,801MHz だった。9月29日の測り直しでも同じ設定にし、電力上限が298.8W になっていることを確かめてから測った。制限なしの RTX 5080 はコア約2,850MHz・メモリ約14,801MHz だった。
  • CUDA コア数 (演算ユニットの数) は、NVIDIA の公称仕様で RTX 5060 Ti が4,608、RTX 5070 Ti が8,960、RTX 5080 が10,752 だ。10,752 と 8,960 の差そのものは合わせられないため、クロックを下げて演算量の合計を近づけている。

エントリーの接続

  • エントリーの RTX 5060 Ti 16GB は、OCuLink (PCIe 4.0 x4) の外付け接続で測った。ハイエンドは PCIe 5.0 x16 の内蔵接続だ。
  • 完成品の内蔵接続とは接続の帯域が違う。その影響は、VRAM に全部載る場合もあふれる場合も測っていないので、完成品で同じ値になるとは言えない。

VRAM からあふれた3モデルの見方

VRAM に収まらなかった3モデルの生の値を載せる (2026年9月29日の再測定)。括弧内は VRAM に載った割合で、Ollama の報告値だ。同じ RTX 5080 を約25分あけて2回測ると、2回目は3モデルとも遅く、毎秒トークン数が1回目より6〜11%少なかった。2回の差の原因は確かめていないが、GPU の消費電力は2回ともほぼ同じだった。ミドル (模擬値) の値はその範囲の中か近くに入ったので、ミドルとハイエンドは3回の最小〜最大で示す。エントリーは3モデルとも、この3回のどの値よりも遅かった。

モデル エントリー (RTX 5060 Ti 16GB) ミドル・ハイエンド (模擬値1回と RTX 5080 2回の範囲)
qwen3.5:35b-a3b 毎秒52.5トークン (60%) 毎秒55.4〜62.4トークン (59%)
qwen3.6:35b-a3b (5月取得の版) 毎秒52.7トークン (60%) 毎秒57.2〜62.1トークン (59%)
qwen3-coder:30b 毎秒65.8トークン (75%) 毎秒71.7〜79.6トークン (74%)
  • VRAM に全部載った3モデル (9B〜14B で MoE ではない) とあふれた3モデル (MoE) は、大きさも作りも違う。価格帯の差が小さかった原因を、あふれたことだけに帰すことはできない。
  • MoE でないモデルが VRAM からあふれた場合は測っていない。同じモデルを VRAM に全部載せた場合とも比べていない。
  • 価格帯の差が小さかったと言えるのは、512トークンを生成する部分についてだけだ。長い質問 (プロンプト) を読み込む速さは価格帯ごとに比べていないので、長いコードや資料を読ませる使い方でも価格帯の差が小さいとは言えない。
  • ローカル LLM を動かすソフトの llama.cpp は、VRAM の総量より大きいモデルを CPU と GPU の両方で処理し、部分的に高速化できると説明している。今回あふれた3モデルでも処理の一部は GPU の外で行われており、価格帯の差が小さかった結果と矛盾はしないが、それが原因とは決められない。
  • VRAM に載らない部分はメインメモリに置かれ、その部分の計算を CPU が担うため、速さは測定機の CPU とメインメモリの構成にも左右される。メインメモリの容量は、あふれた分を置けるかどうかに関わる。
  • 測定機のメインメモリは96GB で、32GB や64GB の完成品では測っていない。メインメモリ32GB の完成品で同じ値になるとは言えない。ミドルは、ここでも RTX 5080 を制限した模擬値だ。

画像生成の条件

  • ComfyUI のログは、3条件それぞれの3回目の起動分だけが残っている。そのログでは、画像生成モデルの本体 (ログの表示で 9708MB。1MB を1024×1024バイトとする表示で、約9.5GiB) は VRAM に全部載った状態 (loaded completely) で生成していた。
  • テキストエンコーダーは、本体を載せるときに一部が VRAM から外されていた。LLM のような「VRAM に載った割合」の値は取っていない。
  • 2枚目の値は同じワークフロー・同じプロンプトで、seed だけを1枚目と変えて作り直した場合のもので、プロンプトを変えながら作った場合は測っていない。

モデルの版

  • qwen3.6:35b-a3b は、2026年5月に取得して手元に置いていた版で測った。2026年9月28日に確認した Ollama の公開中の既定タグ (qwen3.6:35b-a3b) とは中身 (ファイル構成) が違い、公開中の qwen3.6:35b-a3b-q4_K_M タグと同じ中身だった。
  • ほかの5モデルは、公開中のタグと同じ中身だった。測った6モデルの ID (ollama list に出る、manifest の digest の先頭12文字) は、qwen3.5:9b が 6488c96fa5fa、gemma3:12b が f4031aab637d、qwen3:14b が bdbd181c33f2、qwen3.5:35b-a3b が 3460ffeede54、qwen3.6:35b-a3b が 07d35212591f、qwen3-coder:30b が 06c1097efce0 だ。

まとめ

わかりやすく言えば、今回測った範囲では (ミドルは RTX 5080 を制限した模擬値)、VRAM 16GB の中で GPU の価格帯を上げて手に入るのは主に「速さ」で、VRAM に収まらない大きなモデルを動かすには、あふれた分を置くメインメモリの容量が要る、ということだ。

よくある質問

メインメモリは32GBで足りる?

VRAM に全部載るモデルと画像生成が中心なら、この記事の目安は32GB以上だ。VRAM に収まらない大きなモデルを重く使うなら、あふれた分を置く余裕を見て64GB以上を先に考える。ただし測定機のメインメモリは96GB で、32GB や64GB の完成品では、足りるかどうかも速さも測っていない。

電源容量は構成表のどこを見ればいい?

構成表の電源の欄にある容量 (W) を見て、GPU ごとの推奨電源容量と照らし合わせる。推奨電源容量は NVIDIA が基準の PC で示した最小値なので、下限として見る。CPU など他の部品が変われば必要な量も変わる。

VRAM 16GBより大きいものが要るのはどんなとき?

モデル全体を VRAM に載せて動かしたいときだ。この記事の範囲では、VRAM に収まらないモデルも Ollama が GPU とメインメモリに分けて載せて動いた。一方で、同じモデルを VRAM に全部載せた場合の速さとは比べていない。VRAM を32GB にしたときの変化は「VRAM 32GBで何が変わるか」で扱っている。

参考資料

タイトルとURLをコピーしました