この記事の要点
- モデル全体が GPU に載っている条件では、VRAM 12GB の RTX 4070 Super のほうが RTX 5060 Ti 16GB より速い
- モデルが載りきらなくなると順番が入れ替わり、RTX 5060 Ti 16GB が前に出る
- 指定できる num_ctx は、容量の差がそのまま出るモデルと、どちらのカードでも測定上限の近くまで届いて差がつかないモデルに分かれる
この結果が言える範囲: Ollama 0.32.3・量子化 Q4_K_M・単体 GPU・各条件3回の中央値。速度は num_ctx=8192 固定で、比べたのは同じドックに差し替えた 2枚(別の接続で測った RTX 5080 16GB は参考値)。num_ctx の上限は 2,048 刻みで上げて常駐 100% を保てた最大値で、探索の上限は 131,072、KV キャッシュの設定でも結果は変わる。この9モデルでは、RTX 4070 Super での常駐率が 100% を割った条件で順位が入れ替わった。画像生成や学習用途は範囲の外にある。
12GBと16GBで、変わるものと変わらないもの
VRAM 12GB の RTX 4070 Super と 16GB の RTX 5060 Ti を同じ機材に差し替えて走らせると、速いほうが条件で入れ替わった。この9モデルでは、どちらが前に出るかは容量の数字ではなく、RTX 4070 Super で常駐率が 100% だったかどうかと一致していた。ただし常駐率が同じなら速度も揃う、という話ではない。同じ RTX 4070 Super でも、常駐率がほぼ同じ 41〜54% どうしでモデルによって速度が 8〜12倍に割れた。常駐率が両方とも 100% だった条件では 12GB の RTX 4070 Super が 7〜12% 上回り、載りきらなくなると RTX 5060 Ti 16GB が前に出る。
容量の差がはっきり出るのは、速度ではなく、指定できる num_ctx のほうである。qwen3:14b では、KV キャッシュ f16 のとき常駐 100% を保てる num_ctx に 4.2倍の開きが付いた。その一方で gemma4:12b のように、どちらのカードでも測定範囲の上限まで届いて差がつかないモデルもある。
ローカル LLM を動かす手順そのものはローカルLLMの始め方で扱っている。
同じドックに差し替えて、同じ条件で測り直した
RTX 4070 Super 12GB と RTX 5060 Ti 16GB は、同じ MINISFORUM DEG1 (OCuLink) にカードだけを差し替えて動かしている。接続方式の差は入っていない。表に参考として並ぶ RTX 5080 16GB だけは PCIe x16 直結で、接続の条件が違う。
ソフトウェアの条件は揃えた。Ollama 0.32.3、量子化 Q4_K_M、num_ctx=8192、num_predict=512、think=false (測定スクリプト上は 0)、単体 GPU、各条件3回の中央値。2枚のカードで並べて測ったのは 9モデルで、Ollama のバージョンも量子化も num_ctx も同じ値に固定してある。num_ctx を固定するのは、num_ctx が動くと常駐の割合も生成速度も一緒に動くためである。
常駐率は、Ollama の /api/ps が返す size_vram / size から算出した値で、本記事ではこれを便宜上「常駐率」と呼ぶ。100% は Ollama 上でモデルが 100% GPU として扱われている状態を指し、それを下回るときは一部が GPU の外にある。
測定は 2026年9月、Ollama 0.32.3 で実施した。RTX 5060 Ti と RTX 5080 については、phi4:14b・qwen3:14b・qwen3.6:35b-a3b の3モデルだけ 2026年8月の回から採っている。8月の回も Ollama 0.32.3・Q4_K_M・num_ctx=8192・各条件3回の中央値で、設定は9月と同じである。
同じドックの2枚では、全部載っている間は 12GB のほうが速かった
9モデルの生成速度と、そのときの常駐率を並べる。
| モデル | 4070S 12GB | 5060 Ti 16GB | 5080 16GB (参考) |
|---|---|---|---|
| gemma3:12b | 48.9 tok/s (常駐 100%) | 45.5 tok/s (常駐 100%) | 82.6 tok/s (常駐 100%) |
| gemma4:12b | 47.4 tok/s (常駐 100%) | 44.4 tok/s (常駐 100%) | 81.1 tok/s (常駐 100%) |
| qwen3.5:9b | 72.2 tok/s (常駐 100%) | 64.6 tok/s (常駐 100%) | 118.0 tok/s (常駐 100%) |
| qwen3:14b | 47.1 tok/s (常駐 100%) | 43.4 tok/s (常駐 100%) | 80.2 tok/s (常駐 100%) |
| phi4:14b | 41.8 tok/s (常駐 95%) | 44.1 tok/s (常駐 100%) | 80.4 tok/s (常駐 100%) |
| gemma4:26b | 45.7 tok/s (常駐 51%) | 59.0 tok/s (常駐 74%) | 72.0 tok/s (常駐 73%) |
| qwen3-coder:30b | 40.9 tok/s (常駐 53%) | 67.3 tok/s (常駐 75%) | 80.6 tok/s (常駐 74%) |
| qwen3.5:35b-a3b | 44.7 tok/s (常駐 41%) | 54.6 tok/s (常駐 59%) | 65.0 tok/s (常駐 58%) |
| qwen3.6:35b-a3b | 45.9 tok/s (常駐 41%) | 49.9 tok/s (常駐 59%) | 55.5 tok/s (常駐 58%) |
参考に並べた RTX 5080 は gemma3:12b を常駐 100% で 82.6 tok/s、同じ常駐 100% の RTX 4070 Super は 48.9 tok/s で、約1.7倍の開きがある。接続も世代も違うため要因は切り分けていないが、常駐率が同じでも速度が揃わないことは、9モデルの表からも読める。
9モデルの表は num_ctx=8192 に固定した条件での値で、num_ctx が変われば同じモデルでも常駐率と生成速度は動く。プロンプトの内容、並列実行、長時間運転したときの温度は測定の範囲に入っていない。
常駐率がどちらのカードでも 100% だった gemma3:12b・gemma4:12b・qwen3.5:9b・qwen3:14b の4モデルでは、12GB の RTX 4070 Super が 7〜12% 上回った。開きが最も大きい qwen3.5:9b で 72.2 tok/s 対 64.6 tok/s、最も小さい gemma4:12b でも 47.4 tok/s 対 44.4 tok/s である。
NVIDIA 公式ページの記載では、RTX 4070 SUPER は CUDA コア 7,168・12GB GDDR6X・192bit・220W、RTX 5060 Ti は CUDA コア 4,608・16GB / 8GB GDDR7・128bit・180W となっている。CUDA コアの数は RTX 4070 SUPER のほうが多く、速かったほうと向きは合う。ただし世代が違えばクロックも1コアあたりの中身も違うので、コア数の比 (7,168 対 4,608) をそのまま速度の比としては読めない。実際の速度差は 7〜12% だった。1トークンずつ生成していく処理では、演算の速さよりも、重みをメモリから読み出す速さのほうが結果を左右しやすい。メモリはバス幅が 192bit と 128bit だが、GDDR6X と GDDR7 では1ピンあたりの転送速度が違うので、バス幅の数字だけを並べても読み出しの速さの大小は決まらない。どちらがどれだけ影響したかは、この測定では切り分けていない。
載りきらなくなると順番が入れ替わる
12GB のカードでの常駐率が 41〜53% まで下がった gemma4:26b・qwen3-coder:30b・qwen3.5:35b-a3b・qwen3.6:35b-a3b の4モデルでは、RTX 5060 Ti 16GB が上回った。開きが最も大きいのは qwen3-coder:30b で、40.9 tok/s 対 67.3 tok/s、1.6倍の差が付いている。12GB のカードでの常駐率が 95% にとどまった phi4:14b でも 41.8 tok/s 対 44.1 tok/s と、すでに順番は入れ替わっていた。
この9モデルでは、入れ替わりは 12GB のカードの常駐率が 100% を割った条件でだけ起きていた。境目にあたる phi4:14b (12GB のカードで常駐 95%、16GB のカードは 100%) の差は 41.8 対 44.1 で 5% ほどと小さく、3回の中央値しか採っていないため、この1モデルの向きは幅を持って読んでほしい。qwen3-coder:30b であれば常駐 53% 対 75% で、Ollama が GPU にあると報告した割合が高い RTX 5060 Ti 16GB のほうが速い。ここで見えている差は、容量そのものの差というより、どれだけ載せられたかの差に対応している。
12GBであふれた後は、常駐率がほぼ同じでもモデルによって速度が8〜12倍違う
RTX 4070 Super 12GB 単体では、2枚で並べた 9モデルのほかにも、常駐率が 100% に届かなかったモデルを測っている。ここでは9モデルの表から、12GB のカードでの常駐率が 41〜53% まで下がった4つを再掲し、12GB のカードだけで測った4つを足して並べる。
| モデル | 常駐率 | 生成速度 |
|---|---|---|
| qwen3.5:35b-a3b | 41% | 44.7 tok/s |
| qwen3.6:35b-a3b | 41% | 45.9 tok/s |
| gemma4:26b | 51% | 45.7 tok/s |
| qwen3-coder:30b | 53% | 40.9 tok/s |
| gemma4:31b | 42% | 3.9 tok/s |
| qwen3:32b | 47% | 4.1 tok/s |
| qwen3.5:27b | 54% | 5.0 tok/s |
| codestral:22b | 68% | 10.1 tok/s |
ここに並ぶのは常駐率が 100% に届かなかった条件のみである。モデルの内部構造は測定の対象外にある。
常駐率は 41〜54% とほぼ同じところに集まっているのに、結果は2つに割れた。qwen3.5:35b-a3b 44.7 tok/s、qwen3.6:35b-a3b 45.9 tok/s、gemma4:26b 45.7 tok/s、qwen3-coder:30b 40.9 tok/s が 40 tok/s 台に踏みとどまる一方、gemma4:31b 3.9 tok/s、qwen3:32b 4.1 tok/s、qwen3.5:27b 5.0 tok/s は一桁まで落ちている。同じくらいの常駐率どうしで 8〜12倍の開きだ。常駐 68% の codestral:22b は 10.1 tok/s で、2つの群の中間に位置する。
この分かれ方の理由について、この測定では要因を切り分けていない。GPU に載りきらなかった後、どれだけの重みを実際に読みに行くかがモデルの作りで違う、という見方は、VRAM 12GB を主題にした別記事の測定で扱っている。
num_ctx をどこまで上げられるか
num_ctx を 2,048 刻みで上げていき、常駐率 100% を保てた最大値を探した結果を並べる。
| モデル | KVキャッシュ | 4070S 12GB | 5060 Ti 16GB |
|---|---|---|---|
| qwen3:14b | f16 | 8,192 | 34,816 |
| qwen3:14b | q8_0 | 16,384 | 131,072 (測定上限) |
| qwen3:14b | q4_0 | 30,720 | 131,072 (測定上限) |
| gemma4:12b | f16 | 131,072 (測定上限) | 131,072 (測定上限) |
| qwen3.5:9b | f16 | 126,976 | 131,072 (測定上限) |
131,072 は測定範囲の上限であって、そこで頭打ちになったという意味ではない。上限に達したモデルが実際にどこまで伸びるかは、この測定の範囲の外にある。
num_ctx の上限として並べた数字は、その値を指定したときに常駐率が 100% のままでいられたか、という測定である。その長さの文脈をモデルが実際に有効に扱えるかは別の話で、モデルが公称している文脈長や、長い文脈を入れたときの出力の品質・精度は、この測定では見ていない。
qwen3:14b では容量の差がそのまま出た。KV キャッシュ f16 で常駐 100% を保てた最大の num_ctx は、12GB のカードで 8,192、16GB のカードで 34,816。4.2倍の開きがある。KV キャッシュを q8_0 に落とすと 16,384 対 131,072 (測定上限) まで動いた。
差がつかないモデルもある。gemma4:12b は f16 のままどちらのカードでも 131,072 に届き、qwen3.5:9b は 16GB のカードが 131,072、12GB のカードも 126,976 とその手前まで伸びた。容量の差が、100% 常駐を保てる num_ctx の上限に出るかどうかは、重みが枠をどれだけ使うかと、そのモデルが1トークンあたりどれだけ KV キャッシュを使うかの両方で変わる。重みの規模が近い qwen3:14b と gemma4:12b で、同じ 12GB のカード・同じ f16 の条件でも上限が 8,192 対 131,072 まで開いたのは、残り容量の差だけでは説明が付かない。1トークンあたりの KV キャッシュ量そのものは、この測定では出していない。
KV キャッシュの量子化そのものはVRAM 16GBでローカルLLMのコンテキスト長はどこまで伸ばせるか|KVキャッシュ量子化の実測で扱っている。
実際に使い切れるのは何GBか
測定中に確保された VRAM の最大値も記録している。
| カード | 測定中に確保された最大 | そのときのモデル |
|---|---|---|
| RTX 4070 Super 12GB | 10,482 MiB (約 10.2 GiB) | qwen3.5:35b-a3b |
| RTX 5060 Ti 16GB | 15,963 MiB (約 15.6 GiB) | phi4:14b |
確保量はモデルと設定で変わる。ここに出したのは測定中に観測された最大値で、そのカードの上限そのものではない。
同じ測定で計測器が出したカードの総容量は、RTX 4070 Super が 12,282 MiB、RTX 5060 Ti 16GB が 16,311 MiB だった。確保された最大はそれぞれ 10,482 MiB と 15,963 MiB で、どちらも総容量までは使われていない。ただし 12GB のカードの最大は常駐率 41% のモデルで観測した値で、重みは層の単位で載るため、総容量との差がそのまま「使えない容量」というわけではない。最大に達したときのモデルも、12GB のカードでは qwen3.5:35b-a3b、16GB のカードでは phi4:14b と別だった。
4月に測ったときと変わったこと
同じ機材で 2026年4月にも測っている。当時の値と、今回の測定の値を並べる。
| モデル・カード | 2026年4月 | 2026年8〜9月 |
|---|---|---|
| phi4:14b / 4070S 12GB | 14.4 tok/s | 41.8 tok/s |
| phi4:14b / 5060 Ti 16GB | 44.1 tok/s | 44.1 tok/s |
| qwen3:14b / 4070S 12GB | 32.2 tok/s | 47.1 tok/s |
| qwen3:14b / 5060 Ti 16GB | 42.8 tok/s | 43.4 tok/s |
条件が揃っていないので、これは速度の優劣を比べる表ではなく、同じ機材で値がどう動いたかを見る表である。右の列は RTX 4070 Super の2行が 2026年9月の回、RTX 5060 Ti の2行が 2026年8月の回で、期間の取り方も揃っていない。
動きは片方に偏っていた (ただし RTX 4070 Super は4月から9月、RTX 5060 Ti は4月から8月の比較である)。RTX 4070 Super 12GB では phi4:14b が 14.4 tok/s から 41.8 tok/s へ、qwen3:14b が 32.2 tok/s から 47.1 tok/s へ上がっている。RTX 5060 Ti 16GB は phi4:14b が 44.1 tok/s から 44.1 tok/s (4月が 44.09 tok/s、表に載せた回が 44.06 tok/s で、別々の記録が小数第1位で同じ値に丸まっている)、qwen3:14b が 42.8 tok/s から 43.4 tok/s と、ほぼ同じところにとどまった。
ただし 2026年4月の回は Ollama 0.20.5 世代で、num_ctx を記録していない。2026年9月の回は num_ctx=8192 に固定してある。前提が揃っていないため、この変化の原因は特定していない。
どちらを選ぶか
この測定で容量の差が直接表れたのは、載る量と、指定できる num_ctx の上限だった。生成速度そのものではない。
| 条件 | この測定で観測されたこと |
|---|---|
| 常駐率が 100% になる | 12GB の RTX 4070 Super が上回った |
| モデルが GPU に載りきらない | RTX 5060 Ti 16GB が上回った |
| 長い文脈を扱いたい | qwen3:14b では 16GB のカードのほうが上限が高く、gemma4:12b と qwen3.5:9b はどちらのカードでも測定上限の近くまで届いた |
速度について読める範囲には限りがある。ここに出した速度は RTX 4070 Super 1枚での実測であって、12GB のカード一般の速度ではない。12GB という容量の制約から来る傾向は、ほかの 12GB のカードを見るときの参考になる。ただし常駐できる量や num_ctx の上限そのものが同じ数字になるとは限らない。実際に使える容量はドライバや同時に動かしているものでも変わり、この測定でも総容量 12,282 MiB に対して確保された最大は 10,482 MiB だった。速度のほうは世代とメモリ規格で変わる。測ったのは RTX 4070 Super・RTX 5060 Ti 16GB・RTX 5080 の3枚だけである。
12GB という容量は世代をまたいで存在する。NVIDIA 公式ページの記載では、現行世代の RTX 5070 も CUDA コア 6,144・12GB GDDR7・192bit だ。RTX 5070 は当サイトの測定対象に入っていない。12GB のカードでローカル AI を始めるときの構成は、世代の違う 12GB のカードを扱った記事でまとめている。
16GB のカードも RTX 5060 Ti だけではない。同じ容量で何が違うかはVRAM 16GB GPU を選ぶなら|AI 用途別に比較に用途ごとの形でまとめてある。
グラボ単体を探すなら現行モデルを 8GB から 32GB まで、ASUS・MSI・GIGABYTE などの製品ごとに絞り込める。長さ・厚み・スロット・補助電源も出しているので、必要な容量とケース・電源の条件から探せる。
まとめ
この9モデルでは、順位の入れ替わりは RTX 4070 Super での常駐率が 100% を割った条件と一致した。常駐率 100% だった4モデルは RTX 4070 Super が速く、100% を割った5モデルは RTX 5060 Ti 16GB が速い、という対応である。要因を切り分ける実験はしていないので、常駐率が速度を決めていると言い切れる測定ではない。ただし常駐率だけで速度が決まるわけではない。同じ RTX 4070 Super で常駐率が 41〜54% とほぼ揃っていても速度は 8〜12倍に割れ、常駐率が 100% どうしでも RTX 4070 Super と RTX 5080 では約1.7倍の開きがあった (RTX 5080 は接続も世代も違うカードで、この差の要因は切り分けていない)。Ollama 0.32.3・量子化 Q4_K_M・num_ctx=8192・単体 GPU・各条件3回の中央値という条件で、同じ MINISFORUM DEG1 (OCuLink) にカードを差し替えて測った範囲の話である。
常駐率が 100% だった4モデルでは 12GB の RTX 4070 Super が 7〜12% 上回り、12GB のカードの常駐率が 41〜53% まで落ちた4モデルでは RTX 5060 Ti 16GB が上回った。RTX 4070 Super 12GB だけを見ると、常駐率がほぼ同じ 41〜54% でも 40 tok/s 台に踏みとどまるモデルと一桁まで落ちるモデルに分かれ、その開きは 8〜12倍あった。
容量の差がそのまま出たのは、指定できる num_ctx の上限で、qwen3:14b では KV キャッシュ f16 で 4.2倍。一方 gemma4:12b と qwen3.5:9b は、どちらのカードでも測定上限の近くまで届いている。速度の数値は RTX 4070 Super と RTX 5060 Ti 16GB の実測であり、同じ容量の別のカードにそのまま当てはまるものではない。
この記事の測り方と、測っていないこと
各モデルは Ollama 0.32.3 から呼び出し、量子化 Q4_K_M、num_ctx=8192、num_predict=512、think=false (測定スクリプト上は 0) で生成させ、条件ごとに3回走らせた中央値を採っている。生成速度は 1秒あたりの生成トークン数 (tok/s)、常駐率は Ollama の /api/ps が返す size_vram / size で、どちらも実行時の記録から取った値である。
num_ctx の上限は別の手順で測っている。num_ctx を 2,048 刻みで上げ、常駐率 100% を保てた最大値を記録した。探索の上限は 131,072 で、そこに達したモデルはそれ以上を追っていない。VRAM の確保量は、測定中に観測された最大値を採っている。
数値そのものの読み方はベンチマーク数値の読み取り方で扱っている。
この測定で見ていないこと
- 画像生成・動画生成での 12GB と 16GB の差 (この記事は LLM 推論のみ)
- num_ctx 8192 以外での速度 (num_ctx は上限だけを測り、速度は 8,192 固定)
- 2枚構成にしたときの 12GB と 16GB の差
- カード上のメモリから重みを読み出す速さそのものの実測
- Q4_K_M 以外の量子化での比較
- 同じ 12GB の別のカード (RTX 4070 / RTX 5070 など)
- 学習・ファインチューニング用途
- 長時間の連続運転でのクロック低下や温度の影響
- 2026年4月と2026年9月で値が動いた原因の切り分け
- 長い文脈を入れたときの出力の品質・精度 (num_ctx に大きい値を指定できることと、その長さを有効に扱えることは別)
- モデルごとの1トークンあたりの KV キャッシュ量
- 常駐率 100% に届かなかったモデルの、あふれた重みの読み出し量
よくある質問
16GB あればモデルは全部載るのか
この測定では、16GB のカードでも常駐 100% に届かないモデルがあった。gemma4:26b で 74%、qwen3.5:35b-a3b と qwen3.6:35b-a3b で 59% である。載りきるかどうかは容量だけで決まらず、モデルの大きさと num_ctx の組み合わせで動く。
文脈を伸ばすと生成速度はどうなるのか
速度は num_ctx=8192 に固定して測っており、文脈を伸ばした状態での速度はこの測定に含まれていない。num_ctx のほうは、常駐率 100% を保てる上限だけを探している。
RTX 5060 Ti の 8GB 版でも同じ結果になるのか
RTX 5060 Ti には 8GB 版と 16GB 版があり、ここで測ったのは 16GB 版だけである。8GB 版は測定対象に入っていない。
GPU を2枚にすれば 12GB でも足りるのか
この測定は単体 GPU に限っているため、この記事の数値からは読み取れない。2枚の GPU をつないで VRAM をまとめる構成は別記事で扱っている。
参考資料
- NVIDIA 公式: GeForce RTX 4070 Family 製品ページ (RTX 4070 SUPER 仕様)
- NVIDIA 公式: GeForce RTX 5060 Family 製品ページ (RTX 5060 Ti 仕様)
- NVIDIA 公式: GeForce RTX 5070 Family 製品ページ (RTX 5070 仕様)
- Ollama 公式 GitHub: ローカル LLM 推論ランタイム
- Hugging Face 公式: Google Gemma 3 12B モデルカード
- Hugging Face 公式: Alibaba Qwen3-14B モデルカード
- 測定に使った検証環境
12GB のカード1枚に絞って限界を測った結果はVRAM 12GBの壁はどこにあるか|context・動画フレーム数・あふれた後の分かれ目を実測にまとめてある。num_ctx の上限と、動画の生成が止まる条件も扱っている。
当サイトはAmazonアソシエイト・プログラムの参加者です。Amazonのアソシエイトとして、当サイトは適格販売により収入を得ています。本記事には各種アフィリエイトリンク(広告)を含み、リンク経由で購入されると当サイトに紹介料が入ります。読者の購入価格は変わりません。

