RTX 5080 16GBで12B〜14B級ローカルLLMを比較|4モデルのVRAM・速度・ピーク電力実測

RTX 5080で12B-14B級LLMはどれを選ぶ?gemma3・phi4・qwen3をテーマにしたアイキャッチ画像 ローカルLLM

この記事では、モデル名の上で12B〜14BとされるローカルLLMを「12B〜14B級」と呼ぶ。名前に付く数字はサイズクラスの呼称で、実際のパラメータ数とは厳密には一致しない(Gemma 4 12Bは公称11.95B、Qwen3 14Bは14.8B)。

VRAM 16GBのGPUを用意したとき、この帯のモデルをどう選ぶか。当サイトの検証環境で4本を同一条件で測ったところ、この4本のあいだでは生成速度にほとんど差が付きませんでした。差が出たのはVRAM使用量とピーク電力です。この記事は、個別のモデル名ではなく何を基準に選ぶかを軸に、判断に使える数字を並べます。

この記事の要点

  • 測ったのは Gemma 3 12B / Gemma 4 12B / Phi-4 14B / Qwen3 14B のQ4_K_M版4本。この4本については、VRAM 16GBに全層が載った(使用量8.35〜10.12GiB、枠の残り5.8〜7.6GiB、常駐率いずれも100%)
  • 4本のあいだでは生成速度で選ぶ意味がほとんどない。RTX 5080での実測は75.92〜77.40 tok/sで、開きは1.9%
  • 差が出たのはVRAM使用量(8.35〜10.12GiB)と生成中のピークボード電力(257.6〜301.7W)
  • RTX 5060 Ti 16GBでも4本とも全層常駐した。速度はRTX 5080比で12Bの2本が約61%、14Bの2本が約57%

基準1: VRAM 16GBに全層が載るか

最初に決まるのは容量です。1枚のGPUに全体が収まればGPU上で完結します。収まらない場合は、構成に応じて複数GPUへの分散やCPU側への退避(オフロード)が起きます。とくにCPUオフロードが入ると速度は大きく落ちるため、この境目が選定の一番外側の枠になります。

4本をRTX 5060 Ti 16GBで測ったときのVRAM使用量です。このカードはOSの画面表示を担当していないため、表示由来のVRAM使用が乗りにくい。容量判定にはこちらを使います。

モデル VRAM使用量 16GB枠の残り GPU常駐率
Gemma 4 12B(Ollama: gemma4:12b) 8.35GiB 約7.6GiB 100%
Gemma 3 12B(Ollama: gemma3:12b) 9.22GiB 約6.7GiB 100%
Qwen3 14B(Ollama: qwen3:14b) 9.90GiB 約6.0GiB 100%
Phi-4 14B(Ollama: phi4:14b) 10.12GiB 約5.8GiB 100%

残りは、このカードが nvidia-smi 上で報告する総VRAM 16,311MiB(約15.93GiB)から引いた値です。製品表記の「16GB」をそのまま16.00GiBとして引いた数ではありません。この4本は、いずれも余裕を持って収まりました。ただし必要なVRAMはパラメータ数と量子化だけで決まるわけではなく、レイヤー構成やアテンションの方式、埋め込み層の大きさ、ランタイム側のバッファでも変わります。同じ12B〜14B級でも別のモデルが同じように収まるとは限らないので、新しいモデルを試すときは実際に読み込んで確認してください。

今回の構成では、表示担当のRTX 5080側で同じモデルが約2GB多く観測されました。差は1,994〜2,019MiBで、4本ともほぼ一定です。デスクトップの描画やモデル以外の常駐プロセスが一因と考えられますが、この2枚はGPU自体も接続方式も違うため、表示分だけを切り分けて測ったものではありません。容量が足りるかを見るときは、使うGPUで実際に測るのが確実です。

逆に載りきらない場合は、動かないのではなく遅くなります。VRAMが足りないときの挙動と対処はVRAM不足でLLMが起動しないときのOOMリスクと対処で扱っています。

基準2: 生成速度はモデルで変わるか

この4本については、ほとんど変わりませんでした。RTX 5080 16GBで同一条件(Ollama 0.32.3・num_ctx=8192・think=false・出力512トークン・同一プロンプト・3回の中央値)で測った値です。

モデル 生成速度 1往復の合計時間 入力処理まで
Gemma 3 12B(Ollama: gemma3:12b) 77.40 tok/s 約7.02秒 401.05ms
Phi-4 14B(Ollama: phi4:14b) 76.43 tok/s 約6.82秒 116.2ms
Qwen3 14B(Ollama: qwen3:14b) 76.18 tok/s 約6.88秒 157.8ms
Gemma 4 12B(Ollama: gemma4:12b) 75.92 tok/s 約7.18秒 436.3ms

生成速度の開きは最大で1.9%。公称12Bと14Bの2クラスにまたがる4本ですが、速度はほぼ横並びでした。512トークンを出し切るまでの合計で見ても6.82〜7.18秒、開きは約5%に収まります。

つまりこの4本から選ぶなら、速いモデルを探すという選び方はあまり意味を持ちません。判断は次の基準へ移ります。別のモデルを候補に入れる場合は、同じように差が小さいとは限らないので測り直してください。

「入力処理まで」は、モデルが読み込み済みの状態で入力の処理が終わるまでの時間です(Ollamaが返す load_duration と prompt_eval_duration の合計、モデル常駐後の中央値)。最初のトークンを生成する時間も、出力を書き出す時間も含みませんので、一般に言うTTFT(最初のトークンが返るまで)とは別の値です。入力52トークン時の測定で、長い文章を投げるほどこの分は伸びます。

なお、モデルが読み込まれていない状態から呼ぶと、この値は4本とも6.10〜8.02秒まで跳ね上がります。中身はほぼモデルの読み込み時間(5.98〜7.89秒)です。今回のように入力が52トークンと短い場合、未ロードからの待ち時間はほとんどがモデルの読み込みで占められました。この再ロード待ちは OLLAMA_KEEP_ALIVE で常駐させれば避けられます。入力が長くなればプロンプト処理の側も効いてくるため、常に読み込みが支配的とは限りません。常駐運用の設定はOllamaを常駐・並列運用する実運用設定で扱っています。

基準3: VRAM使用量とピーク電力——ここで差が出る

速度差が小さかったため、今回測ったハードウェア面の指標ではVRAM使用量とピーク電力に差が出ました。RTX 5080で、生成中のカード単体のボード電力を連続サンプリングし、その最大値を取った値です。

モデル 生成中のピークボード電力 ピークGPU温度 VRAM使用量(5060 Ti側)
Gemma 4 12B(Ollama: gemma4:12b) 257.6W 63℃ 8.35GiB
Gemma 3 12B(Ollama: gemma3:12b) 262.2W 65℃ 9.22GiB
Qwen3 14B(Ollama: qwen3:14b) 289.6W 64℃ 9.90GiB
Phi-4 14B(Ollama: phi4:14b) 301.7W 66℃ 10.12GiB

ピーク電力は最小と最大で44.1Wの差。VRAMは8.35GiBと10.12GiBで1.8GiB近く違います。速度が1.9%しか変わらないので、ハードウェア面で4本を分けているのはこの2つでした(生成品質は測っていません。後述)。

この値はピーク電力なので、消費電力量(Wh)や電気代の比較には使えません。生成中の平均電力や時間積分は測っていないため、「1Wあたり何トークン」や「1か月で何kWhの差」を出すことはできません。ピークが高いモデルの平均も高いとは限らないためです。ここから言えるのは、瞬間的なボード電力がどこまで上がるかと、同条件で測ったピーク温度の比較までです。7秒前後の生成で測った値なので、長時間動かし続けたときの発熱も評価できていません。

RTX 5080のTotal Graphics Powerはメーカー公称360Wで、今回の最大301.7Wは公称の約84%にあたります。NVIDIAは必要システム電源を850Wとしていますが、これは特定の構成を基準にした値で、実際の必要容量はCPUや周辺構成、カードメーカーによって変わります。手元のカードの推奨値も確認してください。

基準4: 1ランク下のGPUではどうなるか

同じ16GBでもGPUが変われば速度は変わります。RTX 5060 Ti 16GBで同じ4本を測った値です。

モデル RTX 5060 Ti RTX 5080 比 5060 Tiのピーク電力
Gemma 3 12B(Ollama: gemma3:12b) 47.56 tok/s 77.40 tok/s 61.4% 155.2W
Gemma 4 12B(Ollama: gemma4:12b) 46.52 tok/s 75.92 tok/s 61.3% 157.5W
Phi-4 14B(Ollama: phi4:14b) 44.06 tok/s 76.43 tok/s 57.6% 174.2W
Qwen3 14B(Ollama: qwen3:14b) 43.56 tok/s 76.18 tok/s 57.2% 166.9W

4本とも全層常駐したうえで、速度はRTX 5080比で12Bの2本が約61%、14Bの2本が約57%でした。パラメータ数が多い側で比が下がる形になっていますが、4本の観測なので、この比率を他のモデルへそのまま当てはめることはできません。

ピーク電力は155.2〜174.2Wと、RTX 5080の6割程度でした。今回の4本はRTX 5080 16GBとRTX 5060 Ti 16GBの両方で全層常駐し、差が出たのは生成速度とピーク電力でした。

VRAMが12GBの世代(RTX 5070やRTX 4070 SUPERなど)になると話が変わります。14Bの2本は num_ctx=8192 の時点で9.90〜10.12GiBを使っており、12GB GPUなら残りは約2GiB前後まで小さくなります。そこにOSの画面表示や常駐プロセスのぶんも乗るため、実際の余裕は使う環境で変わります。8GB世代については、今回16GBカードで測った使用量が最小でも8.35GiBだったことから、単一の8GB GPUへの全層常駐は見込めません(8GB GPU自体では測っていません)。複数GPUへの分散やCPUオフロードが必要になり、ここに挙げた速度は出ません。

基準5: コンテキストを伸ばすとどうなるか

ここまでの数値はすべて num_ctx=8192 での測定です。コンテキスト長を伸ばすと、入力を保持するKVキャッシュの分だけVRAM使用量が増えます。上の「16GB枠の残り5.8〜7.6GiB」は、この増分を吸収するための余裕にあたります。

増える量はモデルのレイヤー数やアテンション構成(GQA/MQAの有無など)で変わるため、一律には決まりません。当サイトでは8192以外のコンテキスト長では測っていないので、具体的な増分は示しません。長いコンテキストで運用する予定があるなら、実際に使う長さで一度VRAM使用量を確認するのが確実です。

Ollamaはコーディングツールやエージェント用途に64K以上のコンテキストを推奨しています。その領域に本記事の数値をそのまま当てはめることはできません。長文でVRAMがどう膨らむかはVRAM不足でLLMが起動しないときのOOMリスクと対処を参照してください。

基準6: 量子化を上げるとどうなるか

本記事の数値は、いずれもOllamaの公式ライブラリで配布されているQ4_K_M版を使った測定です。より情報量の多い量子化に上げると、必要なVRAMは増えます。

ただし増え方はモデルによって違います。今回扱った4本のQ8_0版は、Ollama公式ライブラリの表示で12Bの2本が約13GB、14Bの2本が約16GBです。ただしこれはOllamaライブラリに表示される配布サイズであって、実行時のVRAM使用量ではありません。コンテキストのKVキャッシュやランタイム側のバッファは別に要ります。12Bの2本は配布サイズだけ見れば16GB未満ですが、Q8_0での実行時VRAMは測っていないので、全層常駐できるとは断定できません。14Bの2本は配布サイズだけで約16GBと表示されるため、全層常駐はかなり厳しいと見込まれます(これも未実測です)。「Q8にするなら上位GPUが必要」と一律に言えるものではなく、モデルごとに実際に読み込んで確かめる必要があります。

本記事では量子化形式ごとの生成品質は比較していません。測ったのはQ4_K_M版の速度・VRAM・ピーク電力・温度だけです。一般に高ビットの量子化ほど量子化による誤差は小さくなりますが、その差が実際の出力にどう出るかは、この測定からは何も言えません。

用途で選ぶなら——ただし品質は測っていない

ここまでの基準は、どれも速度・容量・電力という測れる軸でした。一方で「コード生成が得意か」「翻訳が安定するか」といった品質は、本記事では一切測定していません。同じ課題を解かせて出力を比べる、という検証はしていないためです。

そのうえで、各モデルの公式が掲げている設計目標を整理すると次のようになります。これは当サイトの実測ではなく、開発元の主張です。

モデル 開発元が掲げる設計目標 当サイトの実測で言えること
Gemma 4 12B 単一GPUや限られた計算資源で扱える効率性 4本中でピーク電力・VRAM使用量とも最小
Gemma 3 12B 同上 ピーク電力は4本中2番目に低い。VRAMはGemma 4より0.87GiB多い
Phi-4 14B 合成データを重視した訓練レシピで、数学・コード・推論を強化(Phi-4 テクニカルレポート) ピーク電力とVRAM使用量が4本中で最大。速度は他と横並び
Qwen3 14B 119言語・方言への対応と長コンテキスト処理(Qwen3 公式アナウンス) 速度・VRAM・電力とも中間。thinkingを無効にして測定

コーディング用途にPhi-4、多言語用途にQwen3という整理は、この設計目標に沿ったものです。ただし当サイトが数字で裏づけたわけではないので、実際の用途で試して確かめてください。コード生成に特化したモデルとの比較はコーディング用ローカルLLMの横断比較、翻訳用途は翻訳用LLM比較で扱っています。

Gemma 4 12B単体の詳細はVRAM 16GBでGemma 4 12Bを動かすにまとめてあります。

測定条件

4モデル×2GPUの8件すべてを、2026年8月17日に同一条件で測っています。

機材 RTX 5080 16GB(OSの画面表示を担当)/ RTX 5060 Ti 16GB(OCuLink接続・画面表示なし)/ i7-14700F / RAM 96GB / NVIDIAドライバ 610.47
ソフトウェア Ollama 0.32.3
量子化 Ollama公式ライブラリのQ4_K_M版(各モデルのdigestを記録)
生成条件 num_ctx=8192 / 出力512トークン / think=false(Qwen3のようなハイブリッド型も思考トークンを生成しない設定)/ 同一プロンプト(入力52トークン)/ seed固定 / OLLAMA_NUM_PARALLEL=1
集計 各モデル3回実行し、その中央値(3回では外れ値の自動除外は働かないため、実質は3回の中央値)
VRAM nvidia-smi の memory.used の生成中最大値。容量判定には画面表示を担当していないRTX 5060 Ti側の値を使用
電力・温度 生成中に連続サンプリングした、カード単体のボード電力とGPU温度のそれぞれ最大値。壁のコンセントで測った消費電力ではない

測っていないこと

  • 生成品質。コード・翻訳・要約のいずれについても、モデル間で出力を比較していない
  • 消費電力量(Wh)と電気代。測っているのはピーク電力だけで、生成中の平均電力や時間積分は取っていない
  • 量子化形式ごとの品質差。測定はQ4_K_M版のみ
  • num_ctx=8192 以外のコンテキスト長。KVキャッシュの増分も未計測
  • 2枚のGPUにまたがせた場合の挙動。今回はいずれも1枚に収まっている
  • 今回の4本以外のモデル、および16GB以外のVRAM容量での実測
  • 壁のコンセントで測ったシステム全体の消費電力

よくある質問

Q. この4本ならどれを選べばいいですか

速度で選ぶ理由はありません(開き1.9%)。VRAMの余裕を残したい、あるいはピーク電力を抑えたいならGemma系(8.35〜9.22GiB / 257.6〜262.2W)。用途が明確ならその用途を掲げているモデル、という順で決めるのが実測から言えることです。ただし用途への適性は当サイトでは測っていないので、最後は実際のタスクで試してください。

Q. VRAM 16GBで足りますか

今回の4本については足りました。実測で8.35〜10.12GiBなので、16GB枠に5.8〜7.6GiBの余裕が残っています。コンテキストを大きく伸ばす場合は、この余裕をKVキャッシュが食う点に注意してください。別のモデルを使うなら、同じ帯でも実際に読み込んで確認するのが確実です。

Q. RTX 5060 Ti 16GBでも実用になりますか

少なくとも今回測った範囲では、生成速度とVRAM常駐の面で問題なく動きました。4本とも全層常駐したうえで、43.56〜47.56 tok/sを記録。RTX 5080比では12Bの2本が約61%、14Bの2本が約57%でした。ピーク電力も155.2〜174.2Wと軽い。用途に足りるかは扱う文章量や求める応答の速さによります。

Q. モデルが世代交代したらこの記事は使えなくなりますか

使えるのは基準の部分だけです。「16GBに全層載るか」「速度」「ピーク電力とVRAM」「コンテキストを伸ばしたときの余裕」「品質は別途確かめる」という見方は、後継モデルにもそのまま当てはまります。一方で「16GBに収まる」「速度差は2%以内」「1ランク下で6割前後」といった数値は、今回の4本を測った結果であって、新しいモデルには引き継げません。銘柄が変わったら測り直してください。

Q. 最初の応答が遅いのですが

モデルが読み込まれていない状態から呼ぶと、ロードと入力処理の合計が4本とも6.10〜8.02秒かかります。中身はほぼ読み込み時間です。OLLAMA_KEEP_ALIVE でモデルを常駐させれば、この部分は0.12〜0.44秒まで下がります(出力を書き出す時間は別途かかります)。

まとめ

  • 測ったのはGemma 3 12B / Gemma 4 12B / Phi-4 14B / Qwen3 14BのQ4_K_M版。この4本はVRAM 16GBに全層常駐した(8.35〜10.12GiB、余裕5.8〜7.6GiB)
  • 4本のあいだでは速度で選ぶ意味が薄い。RTX 5080で75.92〜77.40 tok/s、開きは1.9%
  • 実際の選定軸はVRAM使用量とピーク電力(257.6〜301.7W)。消費電力量は測っていないため電気代の比較はできない。用途への適性も測っていない
  • RTX 5060 Ti 16GBでも4本とも全層常駐。速度はRTX 5080比で12Bの2本が約61%、14Bの2本が約57%

参考資料

本記事は AIハードウェア図鑑 が記載時点の情報をもとに執筆。製品アップデートや第三者ベンチマーク・価格・対応ランタイム等の変動で評価が変わる可能性がある。一定期間経過した内容は再検証を推奨する。

アフィリエイトについて
当サイトはAmazonアソシエイト・プログラムの参加者です。Amazonのアソシエイトとして、当サイトは適格販売により収入を得ています。
タイトルとURLをコピーしました