この記事では、モデル名の上で12B〜14BとされるローカルLLMを「12B〜14B級」と呼ぶ。名前に付く数字はサイズクラスの呼称で、実際のパラメータ数とは厳密には一致しない(Gemma 4 12Bは公称11.95B、Qwen3 14Bは14.8B)。
VRAM 16GBのGPUを用意したとき、この帯のモデルをどう選ぶか。当サイトの検証環境で4本を同一条件で測ったところ、この4本のあいだでは生成速度にほとんど差が付きませんでした。差が出たのはVRAM使用量とピーク電力です。この記事は、個別のモデル名ではなく何を基準に選ぶかを軸に、判断に使える数字を並べます。
- 測ったのは Gemma 3 12B / Gemma 4 12B / Phi-4 14B / Qwen3 14B のQ4_K_M版4本。この4本については、VRAM 16GBに全層が載った(使用量8.35〜10.12GiB、枠の残り5.8〜7.6GiB、常駐率いずれも100%)
- 4本のあいだでは生成速度で選ぶ意味がほとんどない。RTX 5080での実測は75.92〜77.40 tok/sで、開きは1.9%
- 差が出たのはVRAM使用量(8.35〜10.12GiB)と生成中のピークボード電力(257.6〜301.7W)
- RTX 5060 Ti 16GBでも4本とも全層常駐した。速度はRTX 5080比で12Bの2本が約61%、14Bの2本が約57%
基準1: VRAM 16GBに全層が載るか
最初に決まるのは容量です。1枚のGPUに全体が収まればGPU上で完結します。収まらない場合は、構成に応じて複数GPUへの分散やCPU側への退避(オフロード)が起きます。とくにCPUオフロードが入ると速度は大きく落ちるため、この境目が選定の一番外側の枠になります。
4本をRTX 5060 Ti 16GBで測ったときのVRAM使用量です。このカードはOSの画面表示を担当していないため、表示由来のVRAM使用が乗りにくい。容量判定にはこちらを使います。
| モデル | VRAM使用量 | 16GB枠の残り | GPU常駐率 |
|---|---|---|---|
| Gemma 4 12B(Ollama: gemma4:12b) | 8.35GiB | 約7.6GiB | 100% |
| Gemma 3 12B(Ollama: gemma3:12b) | 9.22GiB | 約6.7GiB | 100% |
| Qwen3 14B(Ollama: qwen3:14b) | 9.90GiB | 約6.0GiB | 100% |
| Phi-4 14B(Ollama: phi4:14b) | 10.12GiB | 約5.8GiB | 100% |
残りは、このカードが nvidia-smi 上で報告する総VRAM 16,311MiB(約15.93GiB)から引いた値です。製品表記の「16GB」をそのまま16.00GiBとして引いた数ではありません。この4本は、いずれも余裕を持って収まりました。ただし必要なVRAMはパラメータ数と量子化だけで決まるわけではなく、レイヤー構成やアテンションの方式、埋め込み層の大きさ、ランタイム側のバッファでも変わります。同じ12B〜14B級でも別のモデルが同じように収まるとは限らないので、新しいモデルを試すときは実際に読み込んで確認してください。
逆に載りきらない場合は、動かないのではなく遅くなります。VRAMが足りないときの挙動と対処はVRAM不足でLLMが起動しないときのOOMリスクと対処で扱っています。
基準2: 生成速度はモデルで変わるか
この4本については、ほとんど変わりませんでした。RTX 5080 16GBで同一条件(Ollama 0.32.3・num_ctx=8192・think=false・出力512トークン・同一プロンプト・3回の中央値)で測った値です。
| モデル | 生成速度 | 1往復の合計時間 | 入力処理まで |
|---|---|---|---|
| Gemma 3 12B(Ollama: gemma3:12b) | 77.40 tok/s | 約7.02秒 | 401.05ms |
| Phi-4 14B(Ollama: phi4:14b) | 76.43 tok/s | 約6.82秒 | 116.2ms |
| Qwen3 14B(Ollama: qwen3:14b) | 76.18 tok/s | 約6.88秒 | 157.8ms |
| Gemma 4 12B(Ollama: gemma4:12b) | 75.92 tok/s | 約7.18秒 | 436.3ms |
生成速度の開きは最大で1.9%。公称12Bと14Bの2クラスにまたがる4本ですが、速度はほぼ横並びでした。512トークンを出し切るまでの合計で見ても6.82〜7.18秒、開きは約5%に収まります。
つまりこの4本から選ぶなら、速いモデルを探すという選び方はあまり意味を持ちません。判断は次の基準へ移ります。別のモデルを候補に入れる場合は、同じように差が小さいとは限らないので測り直してください。
load_duration と prompt_eval_duration の合計、モデル常駐後の中央値)。最初のトークンを生成する時間も、出力を書き出す時間も含みませんので、一般に言うTTFT(最初のトークンが返るまで)とは別の値です。入力52トークン時の測定で、長い文章を投げるほどこの分は伸びます。なお、モデルが読み込まれていない状態から呼ぶと、この値は4本とも6.10〜8.02秒まで跳ね上がります。中身はほぼモデルの読み込み時間(5.98〜7.89秒)です。今回のように入力が52トークンと短い場合、未ロードからの待ち時間はほとんどがモデルの読み込みで占められました。この再ロード待ちは OLLAMA_KEEP_ALIVE で常駐させれば避けられます。入力が長くなればプロンプト処理の側も効いてくるため、常に読み込みが支配的とは限りません。常駐運用の設定はOllamaを常駐・並列運用する実運用設定で扱っています。
基準3: VRAM使用量とピーク電力——ここで差が出る
速度差が小さかったため、今回測ったハードウェア面の指標ではVRAM使用量とピーク電力に差が出ました。RTX 5080で、生成中のカード単体のボード電力を連続サンプリングし、その最大値を取った値です。
| モデル | 生成中のピークボード電力 | ピークGPU温度 | VRAM使用量(5060 Ti側) |
|---|---|---|---|
| Gemma 4 12B(Ollama: gemma4:12b) | 257.6W | 63℃ | 8.35GiB |
| Gemma 3 12B(Ollama: gemma3:12b) | 262.2W | 65℃ | 9.22GiB |
| Qwen3 14B(Ollama: qwen3:14b) | 289.6W | 64℃ | 9.90GiB |
| Phi-4 14B(Ollama: phi4:14b) | 301.7W | 66℃ | 10.12GiB |
ピーク電力は最小と最大で44.1Wの差。VRAMは8.35GiBと10.12GiBで1.8GiB近く違います。速度が1.9%しか変わらないので、ハードウェア面で4本を分けているのはこの2つでした(生成品質は測っていません。後述)。
RTX 5080のTotal Graphics Powerはメーカー公称360Wで、今回の最大301.7Wは公称の約84%にあたります。NVIDIAは必要システム電源を850Wとしていますが、これは特定の構成を基準にした値で、実際の必要容量はCPUや周辺構成、カードメーカーによって変わります。手元のカードの推奨値も確認してください。
基準4: 1ランク下のGPUではどうなるか
同じ16GBでもGPUが変われば速度は変わります。RTX 5060 Ti 16GBで同じ4本を測った値です。
| モデル | RTX 5060 Ti | RTX 5080 | 比 | 5060 Tiのピーク電力 |
|---|---|---|---|---|
| Gemma 3 12B(Ollama: gemma3:12b) | 47.56 tok/s | 77.40 tok/s | 61.4% | 155.2W |
| Gemma 4 12B(Ollama: gemma4:12b) | 46.52 tok/s | 75.92 tok/s | 61.3% | 157.5W |
| Phi-4 14B(Ollama: phi4:14b) | 44.06 tok/s | 76.43 tok/s | 57.6% | 174.2W |
| Qwen3 14B(Ollama: qwen3:14b) | 43.56 tok/s | 76.18 tok/s | 57.2% | 166.9W |
4本とも全層常駐したうえで、速度はRTX 5080比で12Bの2本が約61%、14Bの2本が約57%でした。パラメータ数が多い側で比が下がる形になっていますが、4本の観測なので、この比率を他のモデルへそのまま当てはめることはできません。
ピーク電力は155.2〜174.2Wと、RTX 5080の6割程度でした。今回の4本はRTX 5080 16GBとRTX 5060 Ti 16GBの両方で全層常駐し、差が出たのは生成速度とピーク電力でした。
VRAMが12GBの世代(RTX 5070やRTX 4070 SUPERなど)になると話が変わります。14Bの2本は num_ctx=8192 の時点で9.90〜10.12GiBを使っており、12GB GPUなら残りは約2GiB前後まで小さくなります。そこにOSの画面表示や常駐プロセスのぶんも乗るため、実際の余裕は使う環境で変わります。8GB世代については、今回16GBカードで測った使用量が最小でも8.35GiBだったことから、単一の8GB GPUへの全層常駐は見込めません(8GB GPU自体では測っていません)。複数GPUへの分散やCPUオフロードが必要になり、ここに挙げた速度は出ません。
基準5: コンテキストを伸ばすとどうなるか
ここまでの数値はすべて num_ctx=8192 での測定です。コンテキスト長を伸ばすと、入力を保持するKVキャッシュの分だけVRAM使用量が増えます。上の「16GB枠の残り5.8〜7.6GiB」は、この増分を吸収するための余裕にあたります。
増える量はモデルのレイヤー数やアテンション構成(GQA/MQAの有無など)で変わるため、一律には決まりません。当サイトでは8192以外のコンテキスト長では測っていないので、具体的な増分は示しません。長いコンテキストで運用する予定があるなら、実際に使う長さで一度VRAM使用量を確認するのが確実です。
Ollamaはコーディングツールやエージェント用途に64K以上のコンテキストを推奨しています。その領域に本記事の数値をそのまま当てはめることはできません。長文でVRAMがどう膨らむかはVRAM不足でLLMが起動しないときのOOMリスクと対処を参照してください。
基準6: 量子化を上げるとどうなるか
本記事の数値は、いずれもOllamaの公式ライブラリで配布されているQ4_K_M版を使った測定です。より情報量の多い量子化に上げると、必要なVRAMは増えます。
ただし増え方はモデルによって違います。今回扱った4本のQ8_0版は、Ollama公式ライブラリの表示で12Bの2本が約13GB、14Bの2本が約16GBです。ただしこれはOllamaライブラリに表示される配布サイズであって、実行時のVRAM使用量ではありません。コンテキストのKVキャッシュやランタイム側のバッファは別に要ります。12Bの2本は配布サイズだけ見れば16GB未満ですが、Q8_0での実行時VRAMは測っていないので、全層常駐できるとは断定できません。14Bの2本は配布サイズだけで約16GBと表示されるため、全層常駐はかなり厳しいと見込まれます(これも未実測です)。「Q8にするなら上位GPUが必要」と一律に言えるものではなく、モデルごとに実際に読み込んで確かめる必要があります。
用途で選ぶなら——ただし品質は測っていない
ここまでの基準は、どれも速度・容量・電力という測れる軸でした。一方で「コード生成が得意か」「翻訳が安定するか」といった品質は、本記事では一切測定していません。同じ課題を解かせて出力を比べる、という検証はしていないためです。
そのうえで、各モデルの公式が掲げている設計目標を整理すると次のようになります。これは当サイトの実測ではなく、開発元の主張です。
| モデル | 開発元が掲げる設計目標 | 当サイトの実測で言えること |
|---|---|---|
| Gemma 4 12B | 単一GPUや限られた計算資源で扱える効率性 | 4本中でピーク電力・VRAM使用量とも最小 |
| Gemma 3 12B | 同上 | ピーク電力は4本中2番目に低い。VRAMはGemma 4より0.87GiB多い |
| Phi-4 14B | 合成データを重視した訓練レシピで、数学・コード・推論を強化(Phi-4 テクニカルレポート) | ピーク電力とVRAM使用量が4本中で最大。速度は他と横並び |
| Qwen3 14B | 119言語・方言への対応と長コンテキスト処理(Qwen3 公式アナウンス) | 速度・VRAM・電力とも中間。thinkingを無効にして測定 |
コーディング用途にPhi-4、多言語用途にQwen3という整理は、この設計目標に沿ったものです。ただし当サイトが数字で裏づけたわけではないので、実際の用途で試して確かめてください。コード生成に特化したモデルとの比較はコーディング用ローカルLLMの横断比較、翻訳用途は翻訳用LLM比較で扱っています。
Gemma 4 12B単体の詳細はVRAM 16GBでGemma 4 12Bを動かすにまとめてあります。
測定条件
4モデル×2GPUの8件すべてを、2026年8月17日に同一条件で測っています。
| 機材 | RTX 5080 16GB(OSの画面表示を担当)/ RTX 5060 Ti 16GB(OCuLink接続・画面表示なし)/ i7-14700F / RAM 96GB / NVIDIAドライバ 610.47 |
|---|---|
| ソフトウェア | Ollama 0.32.3 |
| 量子化 | Ollama公式ライブラリのQ4_K_M版(各モデルのdigestを記録) |
| 生成条件 | num_ctx=8192 / 出力512トークン / think=false(Qwen3のようなハイブリッド型も思考トークンを生成しない設定)/ 同一プロンプト(入力52トークン)/ seed固定 / OLLAMA_NUM_PARALLEL=1 |
| 集計 | 各モデル3回実行し、その中央値(3回では外れ値の自動除外は働かないため、実質は3回の中央値) |
| VRAM | nvidia-smi の memory.used の生成中最大値。容量判定には画面表示を担当していないRTX 5060 Ti側の値を使用 |
| 電力・温度 | 生成中に連続サンプリングした、カード単体のボード電力とGPU温度のそれぞれ最大値。壁のコンセントで測った消費電力ではない |
測っていないこと
- 生成品質。コード・翻訳・要約のいずれについても、モデル間で出力を比較していない
- 消費電力量(Wh)と電気代。測っているのはピーク電力だけで、生成中の平均電力や時間積分は取っていない
- 量子化形式ごとの品質差。測定はQ4_K_M版のみ
num_ctx=8192以外のコンテキスト長。KVキャッシュの増分も未計測- 2枚のGPUにまたがせた場合の挙動。今回はいずれも1枚に収まっている
- 今回の4本以外のモデル、および16GB以外のVRAM容量での実測
- 壁のコンセントで測ったシステム全体の消費電力
よくある質問
Q. この4本ならどれを選べばいいですか
速度で選ぶ理由はありません(開き1.9%)。VRAMの余裕を残したい、あるいはピーク電力を抑えたいならGemma系(8.35〜9.22GiB / 257.6〜262.2W)。用途が明確ならその用途を掲げているモデル、という順で決めるのが実測から言えることです。ただし用途への適性は当サイトでは測っていないので、最後は実際のタスクで試してください。
Q. VRAM 16GBで足りますか
今回の4本については足りました。実測で8.35〜10.12GiBなので、16GB枠に5.8〜7.6GiBの余裕が残っています。コンテキストを大きく伸ばす場合は、この余裕をKVキャッシュが食う点に注意してください。別のモデルを使うなら、同じ帯でも実際に読み込んで確認するのが確実です。
Q. RTX 5060 Ti 16GBでも実用になりますか
少なくとも今回測った範囲では、生成速度とVRAM常駐の面で問題なく動きました。4本とも全層常駐したうえで、43.56〜47.56 tok/sを記録。RTX 5080比では12Bの2本が約61%、14Bの2本が約57%でした。ピーク電力も155.2〜174.2Wと軽い。用途に足りるかは扱う文章量や求める応答の速さによります。
Q. モデルが世代交代したらこの記事は使えなくなりますか
使えるのは基準の部分だけです。「16GBに全層載るか」「速度」「ピーク電力とVRAM」「コンテキストを伸ばしたときの余裕」「品質は別途確かめる」という見方は、後継モデルにもそのまま当てはまります。一方で「16GBに収まる」「速度差は2%以内」「1ランク下で6割前後」といった数値は、今回の4本を測った結果であって、新しいモデルには引き継げません。銘柄が変わったら測り直してください。
Q. 最初の応答が遅いのですが
モデルが読み込まれていない状態から呼ぶと、ロードと入力処理の合計が4本とも6.10〜8.02秒かかります。中身はほぼ読み込み時間です。OLLAMA_KEEP_ALIVE でモデルを常駐させれば、この部分は0.12〜0.44秒まで下がります(出力を書き出す時間は別途かかります)。
まとめ
- 測ったのはGemma 3 12B / Gemma 4 12B / Phi-4 14B / Qwen3 14BのQ4_K_M版。この4本はVRAM 16GBに全層常駐した(8.35〜10.12GiB、余裕5.8〜7.6GiB)
- 4本のあいだでは速度で選ぶ意味が薄い。RTX 5080で75.92〜77.40 tok/s、開きは1.9%
- 実際の選定軸はVRAM使用量とピーク電力(257.6〜301.7W)。消費電力量は測っていないため電気代の比較はできない。用途への適性も測っていない
- RTX 5060 Ti 16GBでも4本とも全層常駐。速度はRTX 5080比で12Bの2本が約61%、14Bの2本が約57%
参考資料
- Ollama 公式: モデルライブラリ(タグと配布サイズ)
- Ollama Docs: Context length(コンテキスト長と必要メモリ)
- GeForce RTX 5080 公式スペック(NVIDIA)
- GeForce RTX 5060 ファミリー公式スペック(NVIDIA)
- Phi-4 Technical Report(Microsoft Research)
- Qwen3 公式アナウンス(Qwen Team)
本記事は AIハードウェア図鑑 が記載時点の情報をもとに執筆。製品アップデートや第三者ベンチマーク・価格・対応ランタイム等の変動で評価が変わる可能性がある。一定期間経過した内容は再検証を推奨する。
当サイトはAmazonアソシエイト・プログラムの参加者です。Amazonのアソシエイトとして、当サイトは適格販売により収入を得ています。

