AIハードウェア実測データベース|GPU別のVRAM・速度・生成時間

このページの数字は、すべて自分の機材で測った値です。表は機材と測り方ごとに分けてあり、context 長のように行ごとに違う条件は「測定条件」の列に出しています。比べられるかどうかは、表ではなく条件で決まります——同じ表の中でも、測定条件の列が違う行はそのまま比べられません。測り方と各列の読み方は表の下にまとめています。

代表値

下の詳細表に出ているのと同じ測定から、規模帯 × 機材ごとに 1 件(画像・動画はワークフロー × 機材ごとに 1 件)を決まった手順で選んだものです。一部の規模帯には、これとは別に「重点実測」の行も出しています。平均や順位付けはしていません。どれも下の詳細表にある数字をそのまま持ってきたものです。「重点実測」と付いた行は、その帯の代表とは測り方が違います。多く測っている主題を別に出しているもので、代表の行と直接は比べられません(測り方はそれぞれの「測定条件」欄に出ています)。

ローカルLLM(規模帯ごとに 1 モデル+重点実測)
規模帯 測ったもの 機材 測定条件 生成速度
tok/s
初 token
ms
VRAM
MiB
目安スペック
VRAM / RAM
BTO 詳細
〜4B gemma3:4b RTX 5080 単体 量子化 Q4_K_M / context 指定なし / 生成上限 512 token / Ollama 0.30.7 / 6 回 / 最終測定日 2026-07-22 154.0 679 5,963 VRAM 8GB〜RAM 16GB〜 条件でPCを見る 同じ条件の表へ
〜4B gemma3:4b RTX 5060 Ti 16GB 単体 (OCuLink 接続) 量子化 Q4_K_M / context 指定なし / 生成上限 512 token / Ollama 0.30.7 / 3 回 / 最終測定日 2026-06-18 108.7 355 3,998 VRAM 8GB〜RAM 16GB〜 条件でPCを見る 同じ条件の表へ
7〜9B qwen3.5:9b RTX 5080 単体 量子化 Q4_K_M / context 8,192 token / 生成上限 512 token / Ollama 0.32.3 / 3 回 / 最終測定日 2026-09-08 118.0 278 8,362 VRAM 12GB〜RAM 16GB〜 条件でPCを見る 同じ条件の表へ
7〜9B qwen3.5:9b RTX 5060 Ti 16GB 単体 (OCuLink 接続) 量子化 Q4_K_M / context 8,192 token / 生成上限 512 token / Ollama 0.32.3 / 6 回 / 最終測定日 2026-09-08 64.6 563 6,768 VRAM 12GB〜RAM 16GB〜 条件でPCを見る 同じ条件の表へ
7〜9B qwen3.5:9b RTX 4070 SUPER 12GB 単体 (OCuLink 接続) 量子化 Q4_K_M / context 8,192 token / 生成上限 512 token / Ollama 0.32.3 / 3 回 / 最終測定日 2026-09-09 72.2 275 6,824 VRAM 12GB〜RAM 16GB〜 条件でPCを見る 同じ条件の表へ
12〜16B gemma4:12b RTX 5080 単体 量子化 Q4_K_M / context 8,192 token / 生成上限 512 token / Ollama 0.32.3 / 6 回 / 最終測定日 2026-09-08 80.5 369 9,970 VRAM 12GB〜RAM 16GB〜 条件でPCを見る 同じ条件の表へ
12〜16B gemma4:12b RTX 5060 Ti 16GB 単体 (OCuLink 接続) 量子化 Q4_K_M / context 8,192 token / 生成上限 512 token / Ollama 0.32.3 / 15 回 / 最終測定日 2026-09-08 46.4 626 11,3008,542〜14,046 VRAM 12GB〜RAM 16GB〜 条件でPCを見る 同じ条件の表へ
12〜16B gemma4:12b RTX 4070 SUPER 12GB 単体 (OCuLink 接続) 量子化 Q4_K_M / context 8,192 token / 生成上限 512 token / Ollama 0.32.3 / 3 回 / 最終測定日 2026-09-09 47.4 706 8,600 VRAM 12GB〜RAM 16GB〜 条件でPCを見る 同じ条件の表へ
22〜35B qwen3-coder:30bMoE(動くのは総数の一部) RTX 5080 単体 量子化 Q4_K_M / context 8,192 token / 生成上限 512 token / Ollama 0.32.3 / 6 回 / 最終測定日 2026-09-08 76.572.5〜80.6 193 15,346(重みの 74% が GPU) VRAM 32GB〜RAM 64GB〜16GB では不足 条件でPCを見る 同じ条件の表へ
22〜35B qwen3-coder:30bMoE(動くのは総数の一部) RTX 5060 Ti 16GB 単体 (OCuLink 接続) 量子化 Q4_K_M / context 8,192 token / 生成上限 512 token / Ollama 0.32.3 / 12 回 / 最終測定日 2026-09-08 65.8 239 14,248(重みの 75% が GPU) VRAM 32GB〜RAM 64GB〜16GB では不足 条件でPCを見る 同じ条件の表へ
22〜35B qwen3-coder:30bMoE(動くのは総数の一部) RTX 4070 SUPER 12GB 単体 (OCuLink 接続) 量子化 Q4_K_M / context 8,192 token / 生成上限 512 token / Ollama 0.32.3 / 3 回 / 最終測定日 2026-09-09 40.9 273 10,222(重みの 53% が GPU) VRAM 32GB〜RAM 64GB〜16GB では不足 条件でPCを見る 同じ条件の表へ
22〜35B重点実測 Qwen3.8-27B RTX 5080 単体 量子化 UD-IQ4_XS / context 4,096 token / llama.cpp b10356 / 6 回 / 最終測定日 2026-09-08 49.4 108 14,722 VRAM 16GB〜RAM 32GB〜 条件でPCを見る 同じ条件の表へ
22〜35B重点実測 Qwen3.8-27B RTX 5060 Ti 16GB 単体 (OCuLink 接続) 量子化 UD-IQ4_XS / context 4,096 token / llama.cpp b10356 / 6 回 / 最終測定日 2026-09-08 27.5 169 13,398 VRAM 16GB〜RAM 32GB〜 条件でPCを見る 同じ条件の表へ
22〜35B重点実測 Qwen3.8-27B RTX 4070 SUPER 12GB 単体 (OCuLink 接続) 量子化 UD-IQ4_XS / context 4,096 token / llama.cpp b10356 / 3 回 / 最終測定日 2026-09-09 3.1 1,484 11,868 VRAM 16GB〜RAM 32GB〜 条件でPCを見る 同じ条件の表へ
画像・動画生成(ワークフローごと)
測ったもの 機材 測定条件 生成時間
VRAM ピーク
MiB
目安スペック
VRAM / RAM
BTO 詳細
FLUX.2 Klein 9B Q8_0 GGUF RTX 5080 単体 量子化 Q8_0 / 1024×1024 / step 4 / ComfyUI 0.31.1 / 8 回 / 最終測定日 2026-08-23 5.04 14,283 VRAM 16GB〜RAM 32GB〜 条件でPCを見る 同じ条件の表へ
Flux.1 dev FP8 checkpoint RTX 5080 単体 量子化 FP8 / 1024×1024 / step 20 / ComfyUI 0.31.1 / 7 回 / 最終測定日 2026-08-23 21.1618.20〜24.12 15,645 VRAM 16GB〜RAM 32GB〜 条件でPCを見る 同じ条件の表へ
SD 3.5 medium fp8_scaled RTX 5080 単体 量子化 FP8 / 1024×1024 / step 30 / ComfyUI 0.31.1 / 7 回 / 最終測定日 2026-08-23 10.08 14,425 VRAM 16GB〜RAM 32GB〜 条件でPCを見る 同じ条件の表へ
SDXL base 1.0 RTX 5080 単体 量子化なし / 1280×720 / step 30 / ComfyUI 0.31.1 / 23 回 / 最終測定日 2026-09-04 6.566.39〜8.18 11,1059,394〜11,796 VRAM 16GB〜RAM 32GB〜 条件でPCを見る 同じ条件の表へ
SDXL base 1.0 RTX 5060 Ti 16GB 単体 (OCuLink 接続) 量子化なし / 1280×720 / step 30 / ComfyUI 0.31.1 / 23 回 / 最終測定日 2026-09-04 11.48 6,0323,920〜9,252 VRAM 16GB〜RAM 32GB〜 条件でPCを見る 同じ条件の表へ
ESRGAN 4x-UltraSharp RTX 5080 単体 1344×768 192frames / step 記録なし / ComfyUI 0.31.1 / 1 回 / 最終測定日 2026-09-11 718.52(約 3.74 秒/枚) 未測定 目安なし 同じ条件の表へ
LTX-2 19B distilled Q4 RTX 5080 単体 量子化 Q4 / 512×320 41frames / step 20 / ComfyUI 0.31.1 / 6 回 / 最終測定日 2026-09-04 33.77(約 0.82 秒/枚) 15,195 VRAM 16GB〜RAM 32GB〜 条件でPCを見る 同じ条件の表へ
LTX-2 19B distilled Q4 RTX 5060 Ti 16GB 単体 (OCuLink 接続) 量子化 Q4 / 512×320 41frames / step 20 / ComfyUI 0.31.1 / 6 回 / 最終測定日 2026-09-04 52.20(約 1.27 秒/枚) 14,820 VRAM 16GB〜RAM 32GB〜 条件でPCを見る 同じ条件の表へ
LTX-2.5 distilled Q3 RTX 5080 単体 量子化 Q3_K_M / 1216×672 97frames / step 記録なし / ComfyUI 0.34.5 / 40 回 / 最終測定日 2026-09-07 109.1687.73〜230.87(約 1.13 秒/枚) 15,784 VRAM 16GB〜RAM 32GB〜 条件でPCを見る 同じ条件の表へ
LTX-2.5 distilled Q3 RTX 5060 Ti 16GB 単体 (OCuLink 接続) 量子化 Q3_K_M / 1216×672 97frames / step 記録なし / ComfyUI 0.34.5 / 13 回 / 最終測定日 2026-09-07 219.91197.52〜223.49(約 2.27 秒/枚) 16,030 VRAM 16GB〜RAM 32GB〜 条件でPCを見る 同じ条件の表へ
MiniMax H3 (fl2va pruned) RTX 5080 単体 量子化 FP8 / 864×480 56frames / step 4 / ComfyUI 0.31.1 / 3 回 / 最終測定日 2026-09-11 18.22(約 0.33 秒/枚) 15,393 VRAM 16GB〜RAM 32GB〜 条件でPCを見る 同じ条件の表へ
MiniMax H3 (fl2va pruned) RTX 5060 Ti 16GB 単体 (OCuLink 接続) 量子化 FP8 / 864×480 56frames / step 4 / ComfyUI 0.31.1 / 3 回 / 最終測定日 2026-09-09 44.95(約 0.80 秒/枚) 15,524 VRAM 16GB〜RAM 32GB〜 条件でPCを見る 同じ条件の表へ
MiniMax H3 (fl2va pruned) RTX 4070 SUPER 12GB 単体 (OCuLink 接続) 量子化 FP8 / 864×480 72frames / step 4 / ComfyUI 0.31.1 / 1 回 / 最終測定日 2026-09-09 51.07(約 0.71 秒/枚) 11,108 VRAM 16GB〜RAM 32GB〜 条件でPCを見る 同じ条件の表へ
MiniMax H3 (fl2va pruned) + LoRA RTX 5080 単体 量子化 FP8 / 864×480 56frames / step 4 / ComfyUI 0.31.1 / 3 回 / 最終測定日 2026-09-05 38.18(約 0.68 秒/枚) 15,552 VRAM 16GB〜RAM 32GB〜 条件でPCを見る 同じ条件の表へ
MiniMax H3 (fl2va pruned) + LoRA RTX 5060 Ti 16GB 単体 (OCuLink 接続) 量子化 FP8 / 864×480 56frames / step 4 / ComfyUI 0.31.1 / 3 回 / 最終測定日 2026-09-05 64.67(約 1.15 秒/枚) 15,628 VRAM 16GB〜RAM 32GB〜 条件でPCを見る 同じ条件の表へ
MiniMax H3 (refdelta r1024 turbo8) RTX 5080 単体 量子化 INT8 / 864×480 56frames / step 4 / ComfyUI 0.31.1 / 3 回 / 最終測定日 2026-09-05 39.08(約 0.70 秒/枚) 15,651 VRAM 16GB〜RAM 32GB〜 条件でPCを見る 同じ条件の表へ
MiniMax H3 (refdelta r1024 turbo8) RTX 5060 Ti 16GB 単体 (OCuLink 接続) 量子化 INT8 / 864×480 56frames / step 4 / ComfyUI 0.31.1 / 3 回 / 最終測定日 2026-09-05 68.08(約 1.22 秒/枚) 15,556 VRAM 16GB〜RAM 32GB〜 条件でPCを見る 同じ条件の表へ

選び方: まとまりごとに、モデル・測り方・機材以外の条件が同じ測定の組を 1 つ選び、その組の機材ごとの行を出しています。組は機材の数が多い → 条件の記録が揃っている → その測り方で測ったモデルが多い → 合計の測定回数が多い → 測定日が新しい → モデル名の順で選んでいます。機材をまたいで条件を揃えた組だけを並べるので、その組で測っていない機材はここに出ません(詳細表には出ています)。帯の代表は 1 モデルであって、その帯の平均ではありません。規模が名前に書かれていないモデルは帯に入らないため、ここには出ず詳細表にだけ出ます。
「目安スペック」は実測値そのものではありません。購入時に候補を絞るための目安で、実測 VRAM とは別の数字です(実測ピークを超える最小の段。重みの一部が CPU 側へ逃げた条件があるものは、そのカードより上の段にしています)。「条件でPCを見る」は、その目安で BTO の一覧を絞り込んだ状態で開きます。
VRAM は測定した GPU 全体の使用量で、そのとき載っていた他のものを含みます。モデル単体の必要量ではないので、同じモデルでも測った回で動きます。

生成時間の後ろの括弧は、その生成時間を出した枚数で割った計算値です(動画のフレームも 1 枚ずつの絵として数えています)。静止画は 1 枚なので出していません(生成時間がそのまま 1 枚あたり)。枚数の差は外れますが、step 数と解像度の差は残ります。

システムRAMの実測30 件

RAM ピークは VRAM とは別です。VRAM はそのカードにモデルが載るかどうか、RAM はそのPCで足りるかどうかです。16GB の VRAM で動画を回すと、VRAM に収まらないモデルの一部と、出来上がったフレームそのものがホスト側に置かれるので、VRAM が足りていても RAM で詰まります。ここに出しているのは、RAM を記録できた 30 件だけです。

システムRAMを記録できた測定(機材と測り方をまたいだ抜き出し)
機材 モデル 測定条件 RAM ピーク
GiB
1 本目
GiB
確保量
GiB
詳細
RTX 5080 単体 ESRGAN 4x-UltraSharp 1344×768 16frames / step 記録なし / ComfyUI 0.31.1 / 2 回 / 最終測定日 2026-09-11 6.2 未測定 14.6 同じ条件の表へ
RTX 5080 単体 ESRGAN 4x-UltraSharp 864×480 56frames / step 記録なし / ComfyUI 0.31.1 / 2 回 / 最終測定日 2026-09-11 9.6 未測定 16.4 同じ条件の表へ
RTX 5080 単体 ESRGAN 4x-UltraSharp 1344×768 32frames / step 記録なし / ComfyUI 0.31.1 / 2 回 / 最終測定日 2026-09-11 11.8 未測定 20.4 同じ条件の表へ
RTX 5080 単体 ESRGAN 4x-UltraSharp 1344×768 64frames / step 記録なし / ComfyUI 0.31.1 / 2 回 / 最終測定日 2026-09-11 25.3 未測定 33.0 同じ条件の表へ
RTX 5080 単体 ESRGAN 4x-UltraSharp 1344×768 128frames / step 記録なし / ComfyUI 0.31.1 / 2 回 / 最終測定日 2026-09-11 49.6 未測定 58.2 同じ条件の表へ
RTX 5080 単体 ESRGAN 4x-UltraSharp 1344×768 192frames / step 記録なし / ComfyUI 0.31.1 / 1 回 / 最終測定日 2026-09-11 69.2 未測定 83.2 同じ条件の表へ
RTX 5080 単体 LTX-2 19B distilled Q4 量子化 Q4_K_M / 512×320 41frames / step 記録なし / ComfyUI 0.34.5 / 6 回 / 最終測定日 2026-09-07 37.4 37.4 未測定 同じ条件の表へ
RTX 5080 単体 LTX-2 19B distilled Q4 量子化 Q4_K_M / 512×320 41frames / step 記録なし / ComfyUI 0.34.5 / 6 回 / 最終測定日 2026-09-07 54.9 37.6 未測定 同じ条件の表へ
RTX 5080 単体 LTX-2.5 distilled Q3 量子化 Q3_K_M / 512×320 41frames / step 記録なし / ComfyUI 0.34.5 / 6 回 / 最終測定日 2026-09-07 8.1 19.1 未測定 同じ条件の表へ
RTX 5080 単体 LTX-2.5 distilled Q3 量子化 Q3_K_M / 1216×672 97frames / step 記録なし / ComfyUI 0.34.5 / 18 回 / 最終測定日 2026-09-07 23.5 22.4 未測定 同じ条件の表へ
RTX 5080 単体 LTX-2.5 distilled Q3 量子化 Q3_K_M / 1216×672 241frames / step 記録なし / ComfyUI 0.34.5 / 2 回 / 最終測定日 2026-09-07 該当なし 31.325.3〜37.2 未測定 同じ条件の表へ
RTX 5080 単体 LTX-2.5 distilled Q3 量子化 Q3_K_M / 768×512 97frames / step 記録なし / ComfyUI 0.34.5 / 8 回 / 最終測定日 2026-09-07 33.6 19.9 未測定 同じ条件の表へ
RTX 5080 単体 LTX-2.5 distilled Q3 量子化 Q3_K_M / 512×320 41frames / step 記録なし / ComfyUI 0.34.5 / 6 回 / 最終測定日 2026-09-07 34.7 19.1 未測定 同じ条件の表へ
RTX 5080 単体 LTX-2.5 distilled Q3 量子化 Q3_K_M / 1216×672 721frames / step 記録なし / ComfyUI 0.34.5 / 2 回 / 最終測定日 2026-09-07 該当なし 36.2 未測定 同じ条件の表へ
RTX 5080 単体 LTX-2.5 distilled Q3 量子化 Q3_K_M / 1216×672 721frames / step 記録なし / ComfyUI 0.34.5 / 4 回 / 最終測定日 2026-09-07 該当なし 37.036.3〜45.3 未測定 同じ条件の表へ
RTX 5080 単体 LTX-2.5 distilled Q3 量子化 Q3_K_M / 768×512 241frames / step 記録なし / ComfyUI 0.34.5 / 3 回 / 最終測定日 2026-09-06 45.1 21.8 未測定 同じ条件の表へ
RTX 5080 単体 LTX-2.5 distilled Q3 量子化 Q3_K_M / 768×512 721frames / step 記録なし / ComfyUI 0.34.5 / 4 回 / 最終測定日 2026-09-06 47.1 25.6 未測定 同じ条件の表へ
RTX 5080 単体 LTX-2.5 distilled Q3 量子化 Q3_K_M / 1216×672 241frames / step 記録なし / ComfyUI 0.34.5 / 14 回 / 最終測定日 2026-09-07 47.5 24.0 未測定 同じ条件の表へ
RTX 5080 単体 LTX-2.5 distilled Q3 量子化 Q3_K_M / 1216×672 97frames / step 記録なし / ComfyUI 0.34.5 / 40 回 / 最終測定日 2026-09-07 47.633.5〜48.5 22.2 未測定 同じ条件の表へ
RTX 5080 単体 LTX-2.5 distilled Q3 量子化 Q3_K_M / 1280×704 121frames / step 記録なし / ComfyUI 0.34.5 / 6 回 / 最終測定日 2026-09-08 47.9 22.2 未測定 同じ条件の表へ
RTX 5080 単体 LTX-2.5 distilled Q3 量子化 Q3_K_M / 1216×672 721frames / step 記録なし / ComfyUI 0.34.5 / 6 回 / 最終測定日 2026-09-07 50.6 36.6 未測定 同じ条件の表へ
RTX 5080 単体 MiniMax H3 (fl2va pruned) 量子化 FP8 / 864×480 56frames / step 4 / ComfyUI 0.31.1 / 3 回 / 最終測定日 2026-09-11 44.0 44.0 59.3 同じ条件の表へ
RTX 5080 単体 MiniMax H3 (fl2va pruned) 量子化 FP8 / 864×480 56frames / step 8 / ComfyUI 0.31.1 / 5 回 / 最終測定日 2026-09-11 44.1 44.1 59.5 同じ条件の表へ
RTX 5080 単体 MiniMax H3 (fl2va pruned) + LoRA 量子化 FP8 / 864×480 56frames / step 4 / ComfyUI 0.31.1 / 3 回 / 最終測定日 2026-09-11 44.6 44.0 60.4 同じ条件の表へ
RTX 5080 単体 MiniMax H3 (fl2va pruned) + LoRA 量子化 FP8 / 864×480 56frames / step 8 / ComfyUI 0.31.1 / 3 回 / 最終測定日 2026-09-11 44.7 44.2 60.3 同じ条件の表へ
RTX 5060 Ti 16GB 単体 (OCuLink 接続) LTX-2.5 distilled Q3 量子化 Q3_K_M / 768×512 97frames / step 記録なし / ComfyUI 0.34.5 / 2 回 / 最終測定日 2026-09-06 32.2 19.8 未測定 同じ条件の表へ
RTX 5060 Ti 16GB 単体 (OCuLink 接続) LTX-2.5 distilled Q3 量子化 Q3_K_M / 768×512 241frames / step 記録なし / ComfyUI 0.34.5 / 2 回 / 最終測定日 2026-09-06 44.6 20.9 未測定 同じ条件の表へ
RTX 5060 Ti 16GB 単体 (OCuLink 接続) LTX-2.5 distilled Q3 量子化 Q3_K_M / 1216×672 241frames / step 記録なし / ComfyUI 0.34.5 / 3 回 / 最終測定日 2026-09-07 46.1 32.2 未測定 同じ条件の表へ
RTX 5060 Ti 16GB 単体 (OCuLink 接続) LTX-2.5 distilled Q3 量子化 Q3_K_M / 1216×672 97frames / step 記録なし / ComfyUI 0.34.5 / 13 回 / 最終測定日 2026-09-07 46.6 20.7 未測定 同じ条件の表へ
RTX 5060 Ti 16GB 単体 (OCuLink 接続) LTX-2.5 distilled Q3 量子化 Q3_K_M / 1280×704 121frames / step 記録なし / ComfyUI 0.34.5 / 4 回 / 最終測定日 2026-09-07 47.3 21.6 未測定 同じ条件の表へ

RAM ピーク回をまたいだ最大で、中央値ではありません(足りるか足りないかを見る数字なので、半分の回で足りない値は代表にしていません)。1 本目を別に測っている条件では、この列は2 本目以降だけの最大です。1 本目はプロセスを立てて最初に回した 1 本だけの値で、両方ある 21 組のうち 19 組で 1 本目のほうが低く出ています。差がいちばん大きいのは LTX-2.5 distilled Q3(1216×672 97frames)の RTX 5060 Ti 16GB 単体 (OCuLink 接続) で、1 本目 20.7 GiB に対しピーク 46.6 GiB でした。同じプロセスで続けて回すほど積み上がるので、連続で回すならピークのほうを見てくださいRAM はフレーム数で増えます。ESRGAN 4x-UltraSharp の 1344×768 は、同じモデルのままフレーム数だけを変えた測定で、16 フレームで 6.2 GiB、192 フレームで 69.2 GiB(1 フレームあたり 0.3〜0.4 GiB)でした。確保量は確保した量(物理メモリに載っていない分も含む)の最大で、ピークより 6.8〜15.8 GiB 大きく出ています。必要な RAM そのものではありません。単位は GiB(2 の 30 乗)で、PCの「96GB」表記とは直接比べられません(96GB のPCは実測 95.78 GiB)。測定条件の欄にある回数は生成を回した回数で、RAM の値はそのうち記録が残っている回から作っています(一致しないことがあります)。

種類
機材
モデルで絞る

RTX 5080 単体104 件

ローカルLLM41 件

測定条件: RTX 5080 単体 / 最終測定日 2026-09-08測り方: Ollama / 3回計測の IQR 中央値 / 思考モードなし / seed 固定 / VRAM と常駐率も記録
ソフト モデル 量子化 測定条件 生成速度
tok/s
計測 初 token
ms
プロンプト処理
tok/s
VRAM
MiB
消費電力
W
GPU 温度
°C
最終測定日 関連記事
Ollama
0.32.3
qwen3.5:9b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 118.0 3 回 278 1,037 8,362 270 66 記事なし
Ollama
0.32.3
gemma4:12b-it-qat Q4_0 context 8,192 token / 生成上限 512 token / 思考モード なし 84.1 3 回 591 975 9,418 231 53 VRAM 16GBでGemma 4 12Bを動…
Ollama
0.32.3
gemma3:12b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 82.6 3 回 373 977 10,795 264 58 RTX 5080 16GBで12B〜14B級ロ…
Ollama
0.32.3
gemma4:12b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 80.5 6 回 369 926 9,970 264 61 VRAM 16GBでGemma 4 12Bを動…
Ollama
0.32.3
phi4:14b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 80.4 3 回 108 4,613 11,838 317 66 RTX 5080 16GBで12B〜14B級ロ…
Ollama
0.32.3
qwen3:14b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 80.2 3 回 151 3,240 11,625 302 64 RTX 5080 16GBで12B〜14B級ロ…
Ollama
0.32.3
qwen3-coder:30b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 76.572.5〜80.6 6 回 193 1,477796〜2,157 15,346(重みの 74% が GPU) 109 4845〜50 qwen3-coder:30bをローカルで動か…
Ollama
0.32.3
gemma4:26b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 72.0 3 回 393 718 15,395(重みの 73% が GPU) 128 54 RTX 5080でMoEの消費電力が低い理由|…
Ollama
0.32.3
deepseek-coder-v2:16b-lite-instruct-q4_K_M Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 65.2 3 回 224 1,378 13,401 95 44 コーディング用ローカルLLM 5モデルをVRA…
Ollama
0.32.3
qwen3.5:35b-a3b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 65.0 3 回 329 522 15,571(重みの 58% が GPU) 104 48 16GB VRAMで38%あふれる qwen3…
Ollama
0.32.3
qwen3.6:35b-a3b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 55.5 3 回 381 344 15,583(重みの 58% が GPU) 100 48 Qwen3.6-35B-A3B とは?MoE型…
Ollama
0.32.3
qwen3.5:27b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 12.011.1〜12.8 6 回 565 185173〜197 15,669(重みの 78% が GPU) 116 62 RTX 5080 16GB VRAMの壁に関す…
Ollama
0.32.3
qwen3:32b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 6.96.3〜7.4 6 回 431 277239〜315 15,434(重みの 64% が GPU) 84 44 RTX 5080 16GB VRAMの壁に関す…
Ollama
0.32.3
gemma4:31b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 6.86.2〜7.5 6 回 825 114107〜122 15,594(重みの 61% が GPU) 83 5046〜55 記事なし
測定条件: RTX 5080 単体 / 最終測定日 2026-09-10測り方: llama.cpp の llama-server / 生成速度の中央値 / GPU 別の使用量と電力を同時記録
ソフト モデル 量子化 測定条件 生成速度
tok/s
計測 初 token
ms
プロンプト処理
tok/s
VRAM
MiB
消費電力
W
GPU 温度
°C
最終測定日 関連記事
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 4,096 token / 生成上限 記録なし 54.3 6 回 106 244 13,651 299 63 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 4,096 token / 生成上限 128 token 52.7 3 回 105 241 13,447 304 64 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 4,096 token / 生成上限 128 token 49.9 3 回 106 236 14,511 277 62 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 4,096 token / 生成上限 記録なし 49.4 6 回 108 238 14,722 275 60 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q4_K_M context 4,096 token / 生成上限 記録なし 18.715.9〜21.6 6 回 397 6859〜77 15,674 157149〜165 51 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q4_K_M context 4,096 token / 生成上限 128 token 18.6 3 回 379 66 15,679 162 53 Qwen3.8-27BをVRAM 16GBで実…
測定条件: RTX 5080 単体 / 最終測定日 2026-09-08測り方: llama.cpp / マルチトークン予測と KV cache 量子化を振って測る (3 回の中央値)
ソフト モデル 量子化 測定条件 生成速度
tok/s
計測 初 token
ms
プロンプト処理
tok/s
VRAM
MiB
消費電力
W
GPU 温度
°C
最終測定日 関連記事
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 8,192 token / KV cache f16 / MTP あり / 先読み 2 token 83.8 7 回 178 276 15,236 309 61 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 32,768 token / KV cache q4_0 / MTP あり / 先読み 2 token 60.537.5〜83.5 5 回 248 212157〜267 15,344 305 60 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 8,192 token / KV cache f16 / MTP なし 53.4 7 回 165 298 14,524 306 62 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 8,192 token / KV cache f16 / MTP あり / 先読み 2 token 49.923.9〜75.9 7 回 398 17380〜267 15,627 285 62 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 8,192 token / KV cache f16 / MTP なし 35.721.8〜49.6 7 回 366 19386〜301 15,413 301 68 Qwen3.8-27BをVRAM 16GBで実…
測定条件: RTX 5080 単体 / 最終測定日 2026-07-22測り方: Ollama / 3回計測の IQR 中央値 / 思考モードなし / seed の記録なし / VRAM と常駐率も記録
ソフト モデル 量子化 測定条件 生成速度
tok/s
計測 初 token
ms
プロンプト処理
tok/s
VRAM
MiB
消費電力
W
GPU 温度
°C
最終測定日 関連記事
Ollama
0.30.7
llama3.2:3b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 235.1 6 回 335 6,994 5,038 234 61 llama3.2:3bとは?ドラフト生成で最速…
Ollama
0.30.7
phi4-mini:3.8b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 198.3 8 回 351 5,855 5,620 248 64 RTX 5080でTTFTが速いLLM 8モデ…
Ollama
0.30.7
gemma3:4b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 154.0 6 回 679 1,4821,400〜1,564 5,963 199 56 記事なし
Ollama
0.30.7
mistral:7b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 147.5 8 回 74 9,0057,854〜10,157 7,434 275 60 RTX 5080 で測る ローカル LLM の…
Ollama
0.30.7
llama3.1:8b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 132.1 6 回 346 4,305 7,736 265 59 deepseek-r1:8b の TTFT は…
Ollama
0.30.7
gemma4:latest Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 123.7 3 回 748 1,137 6,424 190 55 VRAM 16GBでGemma 4 12Bを動…
Ollama
0.30.7
deepseek-r1:8b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 112.9105.5〜120.3 8 回 300 3,6693,231〜4,107 8,120 249 58 deepseek-r1:8b の TTFT は…
Ollama
0.30.7
qwen3.5:9b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 104.0 6 回 500 1,3781,310〜1,447 8,724 241 58 記事なし
Ollama
0.30.7
phi4:14b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 76.0 6 回 205 4,161 11,650 301 62 RTX 5080 16GBで12B〜14B級ロ…
Ollama
0.30.7
gemma4:12b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 75.9 6 回 510 1,046973〜1,120 9,683 252 6259〜65 VRAM 16GBでGemma 4 12Bを動…
Ollama
0.30.7
qwen3:14b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 75.7 6 回 284 3,005 11,411 284 62 RTX 5080 16GBで12B〜14B級ロ…
Ollama
0.30.7
gemma3:12b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 75.1 6 回 756 1,005 10,688 247 5853〜63 RTX 5080 16GBで12B〜14B級ロ…
Ollama
0.30.7
gemma4:26b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 69.365.6〜73.0 8 回 714 638410〜867 15,806(重みの 73% が GPU) 122 49 RTX 5080でMoEの消費電力が低い理由|…
Ollama
0.30.7
qwen3.6:35b-a3b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 67.7 3 回 579 385 15,799(重みの 62% が GPU) 110 48 Qwen3.6-35B-A3B とは?MoE型…
Ollama
0.30.7
qwen3.5:35b-a3b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 63.5 6 回 565 404 15,770(重みの 58% が GPU) 106 4844〜53 16GB VRAMで38%あふれる qwen3…
Ollama
0.30.7
codestral:22b Q4_0 context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 53.5 3 回 85 3,506 15,021 257 59 コーディング用ローカルLLM 5モデルをVRA…

画像・動画生成63 件

測定条件: RTX 5080 単体 / 最終測定日 2026-08-23測り方: ComfyUI / 精度 (fp16・bf16・fp8) を振って生成時間と VRAM を測る / 各条件 3 回
ソフト モデル 量子化 解像度 測定条件 生成時間
計測 2回目以降
初回
VRAM ピーク
MiB
GPU 温度
°C
最終測定日 関連記事
ComfyUI
0.31.1
FLUX.2 Klein 9B Q8_0 GGUF Q8_0 1024×1024 step 4 / 計算精度 fp16 / sampler euler / scheduler normal 4.05 8 回 4.04 14.1311.18〜17.09 12,968 62 FLUX.2 Klein 9BをVRAM 16…
ComfyUI
0.31.1
FLUX.2 Klein 9B Q8_0 GGUF Q8_0 1024×1024 step 4 / 計算精度 bf16 / sampler euler / scheduler normal 5.04 8 回 5.04 11.12 14,283 50 FLUX.2 Klein 9BをVRAM 16…
ComfyUI
0.31.1
FLUX.2 Klein 9B Q8_0 GGUF Q8_0 1024×1024 step 4 / 計算精度 fp8_e4m3fn / sampler euler / scheduler normal 5.04 8 回 5.04 11.62 14,282 48 FLUX.2 Klein 9BをVRAM 16…
ComfyUI
0.31.1
SDXL base 1.0 なし 1024×1024 step 30 / 計算精度 bf16 / sampler euler / scheduler normal 6.05 8 回 6.05 10.07 10,7149,555〜11,872 5450〜57 ComfyUI用の画像モデルGGUFをgguf…
ComfyUI
0.31.1
SDXL base 1.0 なし 1024×1024 step 30 / 計算精度 fp16 / sampler euler / scheduler normal 6.06 8 回 6.06 10.5910.08〜11.11 10,6649,464〜11,864 50 ComfyUI用の画像モデルGGUFをgguf…
ComfyUI
0.31.1
SDXL base 1.0 なし 1024×1024 step 30 / 計算精度 fp8_e4m3fn / sampler euler / scheduler normal 7.05 8 回 7.04 11.07 7,492 48 ComfyUI用の画像モデルGGUFをgguf…
ComfyUI
0.31.1
SD 3.5 medium fp8_scaled FP8 1024×1024 step 30 / 計算精度 fp16 / sampler euler / scheduler normal 10.06 7 回 9.81 13.58 15,059 55 精度を落とすと何が変わるか|SDXL・Flux…
ComfyUI
0.31.1
SD 3.5 medium fp8_scaled FP8 1024×1024 step 30 / 計算精度 fp8_e4m3fn / sampler euler / scheduler normal 10.07 7 回 10.07 14.12 11,98711,268〜12,706 52 精度を落とすと何が変わるか|SDXL・Flux…
ComfyUI
0.31.1
SD 3.5 medium fp8_scaled FP8 1024×1024 step 30 / 計算精度 bf16 / sampler euler / scheduler normal 10.08 7 回 10.07 13.11 14,425 50 精度を落とすと何が変わるか|SDXL・Flux…
ComfyUI
0.31.1
Flux.1 dev FP8 checkpoint FP8 1024×1024 step 20 / 計算精度 fp8_e4m3fn / sampler euler / scheduler normal 20.3518.08〜22.62 7 回 18.8717.63〜20.11 28.20 15,545 51 精度を落とすと何が変わるか|SDXL・Flux…
ComfyUI
0.31.1
Flux.1 dev FP8 checkpoint FP8 1024×1024 step 20 / 計算精度 bf16 / sampler euler / scheduler normal 21.1618.20〜24.12 7 回 21.6418.16〜25.12 24.7723.12〜26.41 15,645 52 精度を落とすと何が変わるか|SDXL・Flux…
ComfyUI
0.31.1
Flux.1 dev FP8 checkpoint FP8 1024×1024 step 20 / 計算精度 fp16 / sampler euler / scheduler normal 24.1220.11〜28.12 7 回 20.34 32.1629.11〜35.22 15,584 54 精度を落とすと何が変わるか|SDXL・Flux…
測定条件: RTX 5080 単体 / 最終測定日 2026-09-04測り方: ComfyUI / 2 枚同時と単独を比べた測定のうち、単独で走らせた側
ソフト モデル 量子化 解像度 測定条件 生成時間
計測 2回目以降
初回
VRAM ピーク
MiB
GPU 温度
°C
最終測定日 関連記事
ComfyUI
0.31.1
SDXL base 1.0 なし 1280×720 step 30 / 走らせ方 単独 6.566.39〜8.18 23 回 6.566.39〜8.18 12.756.55〜15.02 11,1059,394〜11,796 53 ComfyUI用の画像モデルGGUFをgguf…
測定条件: RTX 5080 単体 / 最終測定日 2026-09-08測り方: ComfyUI / LTX-2.5(音声つき)のモデル入れ替え費用を条件ごとに測る
ソフト モデル 量子化 解像度 測定条件 生成時間
計測 2回目以降
初回
VRAM ピーク
MiB
GPU 温度
°C
最終測定日 関連記事
ComfyUI
0.34.5
LTX-2 19B distilled Q4 Q4_K_M 512×320 41frames プロンプト 固定 / VAE decode plain 22.92(約 0.56 秒/枚) 6 回 22.84 64.44 15,708 未測定 LTX 1 を 16GB VRAM で量産する…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 512×320 41frames プロンプト 固定 / VAE decode tiled 29.84(約 0.73 秒/枚) 6 回 29.77 45.79 15,750 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2 19B distilled Q4 Q4_K_M 512×320 41frames プロンプト 回ごとに変える / VAE decode plain 31.99(約 0.78 秒/枚) 6 回 31.88 53.17 15,669 未測定 LTX 1 を 16GB VRAM で量産する…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 512×320 41frames プロンプト 回ごとに変える / VAE decode tiled 36.25(約 0.88 秒/枚) 6 回 36.23 45.47 15,768 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 768×512 97frames プロンプト 回ごとに変える / VAE decode tiled 56.5055.36〜70.35(約 0.58 秒/枚) 8 回 55.63 67.7959.58〜85.07 15,848 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 768×512 145frames プロンプト 回ごとに変える / VAE decode tiled 86.01(約 0.59 秒/枚) 1 回 該当なし 86.01 15,886 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 768×512 193frames プロンプト 回ごとに変える / VAE decode tiled 93.12(約 0.48 秒/枚) 1 回 該当なし 93.12 15,763 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 768×512 241frames プロンプト 回ごとに変える / VAE decode tiled 104.4398.23〜110.64(約 0.43 秒/枚) 3 回 88.41 109.34 15,770 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 1216×672 97frames プロンプト 固定 / VAE decode tiled 105.0588.24〜107.85(約 1.08 秒/枚) 18 回 105.0087.74〜115.79 109.6499.91〜119.09 15,795 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 1216×672 97frames プロンプト 回ごとに変える / VAE decode tiled 109.1687.73〜230.87(約 1.13 秒/枚) 40 回 103.8087.59〜195.52 120.0195.28〜316.79 15,784 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 1280×704 121frames プロンプト 回ごとに変える / VAE decode tiled 110.45(約 0.91 秒/枚) 6 回 111.90 109.00 15,899 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 768×512 337frames プロンプト 回ごとに変える / VAE decode tiled 152.09(約 0.45 秒/枚) 1 回 該当なし 152.09 15,884 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 768×512 721frames プロンプト 回ごとに変える / VAE decode tiled 272.80267.56〜308.04(約 0.38 秒/枚) 4 回 263.63 272.80271.49〜308.04 15,413 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 1216×672 241frames プロンプト 回ごとに変える / VAE decode tiled 288.50272.95〜304.55(約 1.20 秒/枚) 14 回 279.03271.92〜312.14 295.49 15,830 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 1216×672 241frames プロンプト 固定 / VAE tile 上書きあり / VAE decode tiled 322.85292.39〜353.31(約 1.34 秒/枚) 2 回 該当なし 322.85292.39〜353.31 15,680 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 768×512 481frames プロンプト 回ごとに変える / VAE decode tiled 354.16300.01〜408.31(約 0.74 秒/枚) 2 回 該当なし 354.16300.01〜408.31 15,852 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 768×512 577frames プロンプト 回ごとに変える / VAE decode tiled 517.57(約 0.90 秒/枚) 1 回 該当なし 517.57 15,955 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 1216×672 721frames プロンプト 回ごとに変える / VAE decode tiled 716.57(約 0.99 秒/枚) 6 回 707.79 724.89 15,175 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 1216×672 721frames プロンプト 固定 / VAE decode tiled 773.88(約 1.07 秒/枚) 2 回 該当なし 773.88 15,756 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 1216×672 721frames プロンプト 固定 / VAE tile 上書きあり / VAE decode tiled 858.38826.68〜1,002.75(約 1.19 秒/枚) 4 回 該当なし 858.38826.68〜1,002.75 15,512 未測定 LTX 2.5 を 16GB VRAM で回す…
測定条件: RTX 5080 単体 / 最終測定日 2026-09-11測り方: ComfyUI / MiniMax H3 を、LoRA・読み込み・条件付け・step 数を振って測る
ソフト モデル 量子化 解像度 測定条件 生成時間
計測 2回目以降
初回
VRAM ピーク
MiB
GPU 温度
°C
最終測定日 関連記事
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 20 / 条件付け 保存 / sampler res_multistep / scheduler 記録なし 4.69(約 0.08 秒/枚) 1 回 該当なし 4.69 14,667 記録なし MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 4 / LoRA なし / sampler res_multistep / scheduler simple / 起動 続けて 18.22(約 0.33 秒/枚) 3 回 該当なし 該当なし 15,393 67 MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) + LoRA FP8 864×480 56frames step 4 / LoRA あり / sampler res_multistep / scheduler simple / 起動 続けて 24.33(約 0.43 秒/枚) 3 回 該当なし 該当なし 15,643 69 MiniMax H3 Turbo LoRAは何…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 4 / LoRA なし / sampler res_multistep / scheduler 記録なし / 起動 1 本ごと 26.85(約 0.48 秒/枚) 3 回 該当なし 26.85 15,502 記録なし MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 8 / LoRA なし / sampler res_multistep / scheduler simple / 起動 続けて 33.0226.73〜39.31(約 0.59 秒/枚) 5 回 該当なし 該当なし 15,381 72 MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) + LoRA FP8 864×480 56frames step 4 / LoRA あり / sampler res_multistep / scheduler 記録なし / 起動 1 本ごと 38.18(約 0.68 秒/枚) 3 回 該当なし 38.18 15,552 記録なし MiniMax H3 Turbo LoRAは何…
ComfyUI
0.31.1
MiniMax H3 (refdelta r1024 turbo8) INT8 864×480 56frames step 4 / LoRA 焼き込み / sampler res_multistep / scheduler 記録なし / 起動 1 本ごと 39.08(約 0.70 秒/枚) 3 回 該当なし 39.08 15,651 記録なし MiniMax H3 Turbo LoRAは何…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) INT8 864×480 56frames step 4 / LoRA なし / sampler res_multistep / scheduler 記録なし / 起動 1 本ごと 42.04(約 0.75 秒/枚) 3 回 該当なし 42.04 15,646 記録なし MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) + LoRA INT8 864×480 56frames step 4 / LoRA あり / sampler res_multistep / scheduler 記録なし / 起動 1 本ごと 43.78(約 0.78 秒/枚) 3 回 該当なし 43.78 15,582 記録なし MiniMax H3 Turbo LoRAは何…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 8 / LoRA なし / sampler res_multistep / scheduler 記録なし / 起動 1 本ごと 44.50(約 0.79 秒/枚) 3 回 該当なし 44.50 15,612 記録なし MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) + LoRA FP8 864×480 56frames step 8 / LoRA あり / sampler res_multistep / scheduler simple / 起動 続けて 45.15(約 0.81 秒/枚) 3 回 該当なし 該当なし 15,434 70 MiniMax H3 Turbo LoRAは何…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) + LoRA FP8 864×480 56frames step 8 / LoRA あり / sampler res_multistep / scheduler 記録なし / 起動 1 本ごと 58.26(約 1.04 秒/枚) 3 回 該当なし 58.26 15,221 記録なし MiniMax H3 Turbo LoRAは何…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 20 / 読み込み 済み / 条件付け 再利用 / sampler res_multistep / scheduler 記録なし 60.5360.26〜69.14(約 1.08 秒/枚) 13 回 該当なし 該当なし 15,642 記録なし MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) INT8 864×480 56frames step 8 / LoRA なし / sampler res_multistep / scheduler 記録なし / 起動 1 本ごと 61.13(約 1.09 秒/枚) 3 回 該当なし 61.13 15,677 記録なし MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 20 / 読み込み 済み / 条件付け 毎回作る / sampler res_multistep / scheduler 記録なし 64.1463.56〜103.74(約 1.15 秒/枚) 13 回 該当なし 該当なし 15,643 記録なし MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 20 / 読み込み 含む / 条件付け 再利用 / sampler res_multistep / scheduler 記録なし 64.22(約 1.15 秒/枚) 7 回 該当なし 65.50 15,589 記録なし MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (refdelta r1024 turbo8) INT8 864×480 56frames step 8 / LoRA 焼き込み / sampler res_multistep / scheduler 記録なし / 起動 1 本ごと 65.31(約 1.17 秒/枚) 3 回 該当なし 65.31 15,590 記録なし MiniMax H3 Turbo LoRAは何…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) + LoRA INT8 864×480 56frames step 8 / LoRA あり / sampler res_multistep / scheduler 記録なし / 起動 1 本ごと 70.42(約 1.26 秒/枚) 3 回 該当なし 70.42 15,493 記録なし MiniMax H3 Turbo LoRAは何…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 20 / 読み込み 含む / 条件付け 毎回作る / sampler res_multistep / scheduler 記録なし 71.21(約 1.27 秒/枚) 7 回 該当なし 70.78 15,599 記録なし MiniMax H3をVRAM 16GBで動か…
測定条件: RTX 5080 単体 / 最終測定日 2026-09-11測り方: ComfyUI で動画を ESRGAN 系アップスケーラに通したときの所要 RAM と時間
ソフト モデル 量子化 解像度 測定条件 生成時間
計測 2回目以降
初回
VRAM ピーク
MiB
GPU 温度
°C
最終測定日 関連記事
ComfyUI
0.31.1
ESRGAN 4x-UltraSharp 1344×768 16frames アップスケーラ 4x-UltraSharp / 倍率 4x 57.92(約 3.62 秒/枚) 2 回 未測定 未測定 未測定 未測定 記事なし
ComfyUI
0.31.1
ESRGAN 4x-UltraSharp 864×480 56frames アップスケーラ 4x-UltraSharp / 倍率 4x 73.14(約 1.31 秒/枚) 2 回 未測定 未測定 未測定 未測定 記事なし
ComfyUI
0.31.1
ESRGAN 4x-UltraSharp 1344×768 32frames アップスケーラ 4x-UltraSharp / 倍率 4x 112.12(約 3.50 秒/枚) 2 回 未測定 未測定 未測定 未測定 記事なし
ComfyUI
0.31.1
ESRGAN 4x-UltraSharp 1344×768 64frames アップスケーラ 4x-UltraSharp / 倍率 4x 219.87(約 3.44 秒/枚) 2 回 未測定 未測定 未測定 未測定 記事なし
ComfyUI
0.31.1
ESRGAN 4x-UltraSharp 1344×768 128frames アップスケーラ 4x-UltraSharp / 倍率 4x 436.29(約 3.41 秒/枚) 2 回 未測定 未測定 未測定 未測定 記事なし
ComfyUI
0.31.1
ESRGAN 4x-UltraSharp 1344×768 192frames アップスケーラ 4x-UltraSharp / 倍率 4x 718.52(約 3.74 秒/枚) 1 回 未測定 未測定 未測定 未測定 記事なし
測定条件: RTX 5080 単体 / 最終測定日 2026-08-23測り方: ComfyUI / 精度 (fp16・bf16・fp8) を振って生成時間と VRAM を測る / 各条件 3 回
ソフト モデル 量子化 解像度 測定条件 生成時間
計測 2回目以降
初回
VRAM ピーク
MiB
GPU 温度
°C
最終測定日 関連記事
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 step 20 / 計算精度 fp8_e4m3fn / sampler euler / scheduler normal 65.3760.35〜70.38 7 回 64.8259.33〜70.32 77.88 15,526 55 MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 step 20 / 計算精度 fp16 / sampler euler / scheduler normal 66.85 7 回 62.3659.37〜65.36 87.0473.38〜100.70 15,572 54 MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 step 20 / 計算精度 bf16 / sampler euler / scheduler normal 69.86 7 回 66.13 77.4073.39〜81.41 15,541 56 MiniMax H3をVRAM 16GBで動か…
測定条件: RTX 5080 単体 / 最終測定日 2026-09-04測り方: ComfyUI / 0.25 秒間隔で完了を見て生成時間を測る / VRAM は nvidia-smi のピーク
ソフト モデル 量子化 解像度 測定条件 生成時間
計測 2回目以降
初回
VRAM ピーク
MiB
GPU 温度
°C
最終測定日 関連記事
ComfyUI
0.31.1
LTX-2 19B distilled Q4 Q4_K_M 512×320 41frames step 20 / sampler euler / scheduler 記録なし 45.7541.31〜50.18(約 1.12 秒/枚) 13 回 34.72 95.75 15,545 50 LTX 1 を 16GB VRAM で量産する…
測定条件: RTX 5080 単体 / 最終測定日 2026-09-04測り方: ComfyUI / 2 枚同時と単独を比べた測定のうち、単独で走らせた側
ソフト モデル 量子化 解像度 測定条件 生成時間
計測 2回目以降
初回
VRAM ピーク
MiB
GPU 温度
°C
最終測定日 関連記事
ComfyUI
0.31.1
LTX-2 19B distilled Q4 Q4_K_M 512×320 41frames step 20 / 走らせ方 単独 33.77(約 0.82 秒/枚) 6 回 33.77 105.1697.23〜113.09 15,195 50 LTX 1 を 16GB VRAM で量産する…

RTX 5060 Ti 16GB 単体 (OCuLink 接続)88 件

ローカルLLM60 件

測定条件: RTX 5060 Ti 16GB 単体 (OCuLink 接続) / 最終測定日 2026-09-08測り方: llama.cpp / マルチトークン予測と KV cache 量子化を振って測る (3 回の中央値)
ソフト モデル 量子化 測定条件 生成速度
tok/s
計測 初 token
ms
プロンプト処理
tok/s
VRAM
MiB
消費電力
W
GPU 温度
°C
最終測定日 関連記事
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 8,192 token / KV cache f16 / MTP あり / 先読み 4 token 48.1 6 回 269 183169〜197 14,768 180 68 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 32,768 token / KV cache q4_0 / MTP あり / 先読み 2 token 47.6 6 回 278 178164〜191 14,738 179 68 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 8,192 token / KV cache f16 / MTP あり / 先読み 3 token 47.5 6 回 264 186176〜197 14,618 180 68 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 32,768 token / KV cache q4_0 / MTP あり / 先読み 3 token 47.0 5 回 282 175159〜191 13,832 180 68 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 8,192 token / KV cache f16 / MTP あり / 先読み 2 token 47.0 6 回 272 182164〜199 13,412 179 69 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 32,768 token / KV cache q8_0 / MTP あり / 先読み 2 token 46.9 6 回 270 182 15,250 179 68 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 8,192 token / KV cache q8_0 / MTP あり / 先読み 2 token 46.2 6 回 269 182 14,228 179 68 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 8,192 token / KV cache f16 / MTP あり / 先読み 2 token 46.1 6 回 306 162146〜177 14,468 175 67 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 94,208 token / KV cache q4_0 / MTP あり / 先読み 2 token 45.3 5 回 268 183173〜194 15,332 177 67 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 32,768 token / KV cache f16 / MTP あり / 先読み 2 token 44.1 6 回 273 180166〜195 15,996 172 66 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q4_K_M context 8,192 token / KV cache q4_0 / MTP あり / 先読み 2 token 43.3 7 回 263 188173〜202 16,012 180 68 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 94,208 token / KV cache q4_0 / MTP あり / 先読み 2 token 42.3 5 回 283 175157〜194 16,038 165 66 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 8,192 token / KV cache f16 / MTP なし 28.9 6 回 257 190 12,608 176 68 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 8,192 token / KV cache f16 / MTP なし 27.1 6 回 258 190 13,664 164 66 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 8,192 token / KV cache q8_0 / MTP なし 26.9 6 回 274 180168〜192 13,424 163 66 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q4_K_M context 8,192 token / KV cache f16 / MTP なし 24.5 4 回 228 215 15,612 165 66 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q4_K_M context 8,192 token / KV cache q4_0 / MTP なし 24.3 6 回 222 222207〜237 15,244 162 64 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q4_K_M context 8,192 token / KV cache f16 / MTP あり / 先読み 2 token 8.5 7 回 1,845 27 16,032 66 47 Qwen3.8-27BをVRAM 16GBで実…
測定条件: RTX 5060 Ti 16GB 単体 (OCuLink 接続) / 最終測定日 2026-09-10測り方: llama.cpp の llama-server / 生成速度の中央値 / GPU 別の使用量と電力を同時記録
ソフト モデル 量子化 測定条件 生成速度
tok/s
計測 初 token
ms
プロンプト処理
tok/s
VRAM
MiB
消費電力
W
GPU 温度
°C
最終測定日 関連記事
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 4,096 token / 生成上限 128 token 29.1 3 回 166 156 12,342 173 67 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 32,768 token / 生成上限 128 token 29.1 3 回 167 157 14,162 173 66 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 4,096 token / 生成上限 記録なし 29.0 6 回 198 133110〜155 12,342 174 70 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 32,768 token / 生成上限 記録なし 28.9 6 回 167 154 14,162 172 68 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 4,096 token / 生成上限 128 token 27.5 3 回 163 158 13,398 163 61 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 16,384 token / 生成上限 128 token 27.5 3 回 166 159 14,178 164 63 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 8,192 token / 生成上限 128 token 27.5 3 回 165 152 13,658 163 62 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 4,096 token / 生成上限 記録なし 27.5 6 回 169 154 13,398 165 66 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 16,384 token / 生成上限 記録なし 27.5 9 回 168 151122〜154 14,178 163 66 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 24,576 token / 生成上限 128 token 27.4 3 回 168 153 14,698 164 64 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 24,576 token / 生成上限 記録なし 27.4 9 回 166 156 14,698 163 66 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 8,192 token / 生成上限 記録なし 27.4 9 回 168 149109〜156 13,658 161 66 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q4_K_M context 4,096 token / 生成上限 記録なし 24.5 6 回 165 154 15,346 163 66 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q4_K_M context 4,096 token / 生成上限 128 token 24.5 3 回 172 149 15,346 162 63 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 65,536 token / 生成上限 128 token 8.3 3 回 1,124 23 16,030 75 48 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 65,536 token / 生成上限 記録なし 7.7 6 回 1,167 22 16,012 72 50 Qwen3.8-27BをVRAM 16GBで実…
測定条件: RTX 5060 Ti 16GB 単体 (OCuLink 接続) / 最終測定日 2026-09-08測り方: Ollama / 3回計測の IQR 中央値 / 思考モードなし / seed 固定 / VRAM と常駐率も記録
ソフト モデル 量子化 測定条件 生成速度
tok/s
計測 初 token
ms
プロンプト処理
tok/s
VRAM
MiB
消費電力
W
GPU 温度
°C
最終測定日 関連記事
Ollama
0.32.3
qwen3-coder:30b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 65.8 12 回 239 1,834718〜1,904 14,248(重みの 75% が GPU) 74 4845〜51 qwen3-coder:30bをローカルで動か…
Ollama
0.32.3
qwen3.5:9b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 64.6 6 回 563 588 6,768 145 62 記事なし
Ollama
0.32.3
gemma4:26b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 58.6 6 回 709 525 14,252(重みの 74% が GPU) 86 52 RTX 5080でMoEの消費電力が低い理由|…
Ollama
0.32.3
qwen3.5:35b-a3b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 54.3 6 回 566 415 14,600(重みの 59% が GPU) 67 46 16GB VRAMで38%あふれる qwen3…
Ollama
0.32.3
qwen3.6:35b-a3b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 49.9 3 回 417 255 14,612(重みの 59% が GPU) 64 47 Qwen3.6-35B-A3B とは?MoE型…
Ollama
0.32.3
gemma4:12b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 46.4 15 回 626 565494〜591 11,3008,542〜14,046 155 66 VRAM 16GBでGemma 4 12Bを動…
Ollama
0.32.3
gemma3:12b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 45.6 6 回 770 531 9,430 150 63 RTX 5080 16GBで12B〜14B級ロ…
Ollama
0.32.3
phi4:14b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 44.1 12 回 134 2,658 15,98710,368〜16,011 175 7068〜77 RTX 5080 16GBで12B〜14B級ロ…
Ollama
0.30.7
phi4:14b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし 44.0 3 回 該当なし 2,656 12,666 175 72 RTX 5080 16GBで12B〜14B級ロ…
Ollama
0.32.3
qwen3:14b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 43.6 9 回 163 1,947 15,63410,142〜15,634 165 68 RTX 5080 16GBで12B〜14B級ロ…
Ollama
0.30.7
qwen3:14b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし 43.5 3 回 該当なし 1,966 12,440 166 70 RTX 5080 16GBで12B〜14B級ロ…
Ollama
0.30.7
deepseek-coder-v2:16b-lite-instruct-q4_K_M Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし 29.8 3 回 該当なし 2,932 14,464 43 41 コーディング用ローカルLLM 5モデルをVRA…
Ollama
0.30.7
qwen3-coder:30b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし 14.3 3 回 該当なし 655 15,988(重みの 75% が GPU) 42 42 qwen3-coder:30bをローカルで動か…
Ollama
0.30.7
codestral:22b-v0.1-q4_K_M Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし 13.7 3 回 該当なし 1,127 15,998(重みの 95% が GPU) 87 55 コーディング用ローカルLLM 5モデルをVRA…
測定条件: RTX 5060 Ti 16GB 単体 (OCuLink 接続) / 最終測定日 2026-06-18測り方: Ollama / 3回計測の IQR 中央値 / 思考モードなし / seed の記録なし / VRAM と常駐率も記録
ソフト モデル 量子化 測定条件 生成速度
tok/s
計測 初 token
ms
プロンプト処理
tok/s
VRAM
MiB
消費電力
W
GPU 温度
°C
最終測定日 関連記事
Ollama
0.30.7
llama3.2:3b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 151.7 3 回 171 5,764 3,098 145 61 llama3.2:3bとは?ドラフト生成で最速…
Ollama
0.30.7
phi4-mini:3.8b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 125.0 3 回 208 3,967 3,664 151 63 RTX 5080でTTFTが速いLLM 8モデ…
Ollama
0.30.7
gemma3:4b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 108.7 3 回 355 1,309 3,998 132 59 記事なし
Ollama
0.30.7
mistral:7b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 86.1 3 回 44 4,936 5,488 161 64 RTX 5080 で測る ローカル LLM の…
Ollama
0.30.7
gemma4:latest Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 84.7 3 回 668 835 4,578 123 58 VRAM 16GBでGemma 4 12Bを動…
Ollama
0.30.7
llama3.1:8b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 75.1 3 回 338 2,717 5,794 153 64 deepseek-r1:8b の TTFT は…
Ollama
0.30.7
deepseek-r1:8b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 70.6 3 回 317 2,352 6,148 150 64 deepseek-r1:8b の TTFT は…
Ollama
0.30.7
qwen3.5:9b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 67.0 3 回 273 1,118 6,768 152 64 記事なし
Ollama
0.30.7
gemma3:12b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 47.8 3 回 386 723 9,430 156 65 RTX 5080 16GBで12B〜14B級ロ…
Ollama
0.30.7
gemma4:12b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 44.5 3 回 394 704 8,542 149 65 VRAM 16GBでGemma 4 12Bを動…
Ollama
0.30.7
phi4:14b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 44.3 3 回 117 2,646 10,358 173 69 RTX 5080 16GBで12B〜14B級ロ…
Ollama
0.30.7
qwen3:14b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 43.6 3 回 156 1,938 10,130 165 68 RTX 5080 16GBで12B〜14B級ロ…

画像・動画生成28 件

測定条件: RTX 5060 Ti 16GB 単体 (OCuLink 接続) / 最終測定日 2026-09-04測り方: ComfyUI / 0.25 秒間隔で完了を見て生成時間を測る / VRAM は nvidia-smi のピーク
ソフト モデル 量子化 解像度 測定条件 生成時間
計測 2回目以降
初回
VRAM ピーク
MiB
GPU 温度
°C
最終測定日 関連記事
ComfyUI
0.31.1
SDXL base 1.0 なし 2048×1408 step 30 / 計算精度 bf16 / sampler euler / scheduler normal 37.6537.20〜43.03 37 回 36.55 42.87 14,40411,140〜14,404 5147〜53 ComfyUI用の画像モデルGGUFをgguf…
測定条件: RTX 5060 Ti 16GB 単体 (OCuLink 接続) / 最終測定日 2026-09-04測り方: ComfyUI / 2 枚同時と単独を比べた測定のうち、単独で走らせた側
ソフト モデル 量子化 解像度 測定条件 生成時間
計測 2回目以降
初回
VRAM ピーク
MiB
GPU 温度
°C
最終測定日 関連記事
ComfyUI
0.31.1
SDXL base 1.0 なし 1280×720 step 30 / 計算精度 bf16 / 走らせ方 単独 11.48 23 回 11.48 17.3911.41〜17.66 6,0323,920〜9,252 4947〜52 ComfyUI用の画像モデルGGUFをgguf…
測定条件: RTX 5060 Ti 16GB 単体 (OCuLink 接続) / 最終測定日 2026-09-09測り方: ComfyUI / MiniMax H3 を、LoRA・読み込み・条件付け・step 数を振って測る
ソフト モデル 量子化 解像度 測定条件 生成時間
計測 2回目以降
初回
VRAM ピーク
MiB
GPU 温度
°C
最終測定日 関連記事
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 20 / 条件付け 保存 / sampler res_multistep / scheduler 記録なし 5.05(約 0.09 秒/枚) 1 回 該当なし 5.05 15,330 記録なし MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 4 / LoRA なし / sampler res_multistep / scheduler simple / 起動 1 本ごと 44.95(約 0.80 秒/枚) 3 回 該当なし 44.95 15,524 75 MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 4 / LoRA なし / sampler res_multistep / scheduler 記録なし / 起動 1 本ごと 46.84(約 0.84 秒/枚) 3 回 該当なし 46.84 15,492 記録なし MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) + LoRA FP8 864×480 56frames step 4 / LoRA あり / sampler res_multistep / scheduler 記録なし / 起動 1 本ごと 64.67(約 1.15 秒/枚) 3 回 該当なし 64.67 15,628 記録なし MiniMax H3 Turbo LoRAは何…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) INT8 864×480 56frames step 4 / LoRA なし / sampler res_multistep / scheduler simple / 起動 1 本ごと 65.78(約 1.17 秒/枚) 3 回 該当なし 65.78 15,588 74 MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (refdelta r1024 turbo8) INT8 864×480 56frames step 4 / LoRA 焼き込み / sampler res_multistep / scheduler 記録なし / 起動 1 本ごと 68.08(約 1.22 秒/枚) 3 回 該当なし 68.08 15,556 記録なし MiniMax H3 Turbo LoRAは何…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) INT8 864×480 56frames step 4 / LoRA なし / sampler res_multistep / scheduler 記録なし / 起動 1 本ごと 68.22(約 1.22 秒/枚) 3 回 該当なし 68.22 15,492 記録なし MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 8 / LoRA なし / sampler res_multistep / scheduler simple / 起動 1 本ごと 70.19(約 1.25 秒/枚) 3 回 該当なし 70.19 15,556 74 MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 8 / LoRA なし / sampler res_multistep / scheduler 記録なし / 起動 1 本ごと 71.88(約 1.28 秒/枚) 3 回 該当なし 71.88 15,428 記録なし MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) + LoRA INT8 864×480 56frames step 4 / LoRA あり / sampler res_multistep / scheduler 記録なし / 起動 1 本ごと 80.18(約 1.43 秒/枚) 3 回 該当なし 80.18 15,844 記録なし MiniMax H3 Turbo LoRAは何…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) + LoRA FP8 864×480 56frames step 8 / LoRA あり / sampler euler / scheduler beta / 起動 続けて 97.86(約 1.75 秒/枚) 2 回 該当なし 該当なし 15,253 記録なし MiniMax H3 Turbo LoRAは何…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) + LoRA FP8 864×480 56frames step 8 / LoRA あり / sampler res_multistep / scheduler 記録なし / 起動 1 本ごと 103.39(約 1.85 秒/枚) 3 回 該当なし 103.39 15,492 記録なし MiniMax H3 Turbo LoRAは何…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) INT8 864×480 56frames step 8 / LoRA なし / sampler res_multistep / scheduler simple / 起動 1 本ごと 108.93(約 1.95 秒/枚) 3 回 該当なし 108.93 15,588 75 MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (refdelta r1024 turbo8) INT8 864×480 56frames step 8 / LoRA 焼き込み / sampler res_multistep / scheduler 記録なし / 起動 1 本ごと 109.66(約 1.96 秒/枚) 3 回 該当なし 109.66 15,460 記録なし MiniMax H3 Turbo LoRAは何…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) INT8 864×480 56frames step 8 / LoRA なし / sampler res_multistep / scheduler 記録なし / 起動 1 本ごと 110.50(約 1.97 秒/枚) 3 回 該当なし 110.50 15,492 記録なし MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 20 / 読み込み 済み / 条件付け 再利用 / sampler res_multistep / scheduler 記録なし 132.71(約 2.37 秒/枚) 3 回 記録なし 記録なし 15,236 記録なし MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 20 / 読み込み 済み / 条件付け 毎回作る / sampler res_multistep / scheduler 記録なし 132.89(約 2.37 秒/枚) 3 回 記録なし 記録なし 15,302 記録なし MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 20 / 読み込み 含む / 条件付け 再利用 / sampler res_multistep / scheduler 記録なし 134.87(約 2.41 秒/枚) 4 回 該当なし 134.89 15,460 記録なし MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) + LoRA INT8 864×480 56frames step 8 / LoRA あり / sampler res_multistep / scheduler 記録なし / 起動 1 本ごと 137.03129.94〜144.13(約 2.45 秒/枚) 4 回 該当なし 137.03129.94〜144.13 15,596 記録なし MiniMax H3 Turbo LoRAは何…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 20 / 読み込み 含む / 条件付け 毎回作る / sampler res_multistep / scheduler 記録なし 141.63(約 2.53 秒/枚) 3 回 記録なし 記録なし 15,556 記録なし MiniMax H3をVRAM 16GBで動か…
測定条件: RTX 5060 Ti 16GB 単体 (OCuLink 接続) / 最終測定日 2026-09-07測り方: ComfyUI / LTX-2.5(音声つき)のモデル入れ替え費用を条件ごとに測る
ソフト モデル 量子化 解像度 測定条件 生成時間
計測 2回目以降
初回
VRAM ピーク
MiB
GPU 温度
°C
最終測定日 関連記事
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 768×512 97frames プロンプト 回ごとに変える / VAE decode tiled 137.15(約 1.41 秒/枚) 2 回 132.19 142.10 15,972 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 1216×672 97frames プロンプト 回ごとに変える / VAE decode tiled 219.91197.52〜223.49(約 2.27 秒/枚) 13 回 219.45171.66〜223.27 228.03206.90〜247.01 16,030 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 768×512 241frames プロンプト 回ごとに変える / VAE decode tiled 263.70(約 1.09 秒/枚) 2 回 259.24 268.16 16,021 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 1280×704 121frames プロンプト 回ごとに変える / VAE decode tiled 294.44(約 2.43 秒/枚) 4 回 294.50 280.93 15,930 未測定 LTX 2.5 を 16GB VRAM で回す…
ComfyUI
0.34.5
LTX-2.5 distilled Q3 Q3_K_M 1216×672 241frames プロンプト 回ごとに変える / VAE decode tiled 670.12(約 2.78 秒/枚) 3 回 517.21 4,144.69 15,998 未測定 LTX 2.5 を 16GB VRAM で回す…
測定条件: RTX 5060 Ti 16GB 単体 (OCuLink 接続) / 最終測定日 2026-09-04測り方: ComfyUI / 2 枚同時と単独を比べた測定のうち、単独で走らせた側
ソフト モデル 量子化 解像度 測定条件 生成時間
計測 2回目以降
初回
VRAM ピーク
MiB
GPU 温度
°C
最終測定日 関連記事
ComfyUI
0.31.1
LTX-2 19B distilled Q4 Q4_K_M 512×320 41frames step 20 / 走らせ方 単独 52.20(約 1.27 秒/枚) 6 回 52.20 119.25 14,820 46 LTX 1 を 16GB VRAM で量産する…

RTX 4070 SUPER 12GB 単体 (OCuLink 接続)51 件

ローカルLLM40 件

測定条件: RTX 4070 SUPER 12GB 単体 (OCuLink 接続) / 最終測定日 2026-09-09測り方: llama.cpp の llama-server / 生成速度の中央値 / GPU 別の使用量と電力を同時記録
ソフト モデル 量子化 測定条件 生成速度
tok/s
計測 初 token
ms
プロンプト処理
tok/s
VRAM
MiB
消費電力
W
GPU 温度
°C
最終測定日 関連記事
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 4,096 token / 生成上限 記録なし 7.3 3 回 1,072 24 11,892 87 61 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 131,072 token / 生成上限 記録なし 7.1 3 回 1,090 24 11,894 83 50 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 49,152 token / 生成上限 記録なし 7.1 3 回 1,076 24 11,894 83 50 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 65,536 token / 生成上限 記録なし 7.1 3 回 1,082 24 11,894 82 50 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 32,768 token / 生成上限 記録なし 7.1 3 回 1,096 24 11,922 82 48 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-IQ4_XS context 4,096 token / 生成上限 記録なし 3.1 3 回 1,484 17 11,868 62 47 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q4_K_M context 4,096 token / 生成上限 記録なし 1.4 3 回 2,282 11 11,888 55 44 Qwen3.8-27BをVRAM 16GBで実…
測定条件: RTX 4070 SUPER 12GB 単体 (OCuLink 接続) / 最終測定日 2026-09-09測り方: Ollama / 3回計測の IQR 中央値 / 思考モードなし / seed 固定 / VRAM と常駐率も記録
ソフト モデル 量子化 測定条件 生成速度
tok/s
計測 初 token
ms
プロンプト処理
tok/s
VRAM
MiB
消費電力
W
GPU 温度
°C
最終測定日 関連記事
Ollama
0.32.3
llama3.2:3b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 165.5 3 回 165 6,609 3,317 178 65 llama3.2:3bとは?ドラフト生成で最速…
Ollama
0.32.3
phi4-mini:3.8b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 134.1 3 回 176 4,602 3,883 182 64 RTX 5080でTTFTが速いLLM 8モデ…
Ollama
0.32.3
gemma3:4b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 117.6 3 回 341 1,185 4,056 162 63 記事なし
Ollama
0.32.3
gemma4:latest Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 96.4 3 回 352 968 4,454 157 64 VRAM 16GBでGemma 4 12Bを動…
Ollama
0.32.3
mistral:7b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 93.7 3 回 39 5,944 5,548 197 69 RTX 5080 で測る ローカル LLM の…
Ollama
0.32.3
llama3.1:8b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 84.8 3 回 177 3,351 5,852 195 70 deepseek-r1:8b の TTFT は…
Ollama
0.32.3
deepseek-r1:8b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 78.9 5 回 142 2,660 6,210 190 69 deepseek-r1:8b の TTFT は…
Ollama
0.32.3
qwen3.5:9b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 72.2 3 回 275 693 6,824 184 68 記事なし
Ollama
0.32.3
Ornith-1.0-9B (Q4_K_M) Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 67.2 3 回 454 731 5,512 180 70 記事なし
Ollama
0.32.3
Ornith-1.0-35B (Q4_K_M) Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 54.1 6 回 482 413 10,092(重みの 48% が GPU) 7470〜77 4743〜51 Ornith-1.0をローカルで動かすには?9…
Ollama
0.32.3
gemma3:12b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 48.9 3 回 715 626 9,206 187 79 RTX 5080 16GBで12B〜14B級ロ…
Ollama
0.32.3
gemma4:12b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 47.4 3 回 706 572 8,600 176 65 VRAM 16GBでGemma 4 12Bを動…
Ollama
0.32.3
qwen3:14b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 47.1 3 回 301 2,113 10,050 201 72 RTX 5080 16GBで12B〜14B級ロ…
Ollama
0.32.3
qwen3.6:35b-a3b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 45.9 3 回 564 402 10,482(重みの 41% が GPU) 55 45 Qwen3.6-35B-A3B とは?MoE型…
Ollama
0.32.3
qwen3.5:35b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 45.8 3 回 525 395 10,482(重みの 41% が GPU) 52 42 16GB VRAMで38%あふれる qwen3…
Ollama
0.32.3
gemma4:26b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 45.4 6 回 618 423398〜447 10,368(重みの 51% が GPU) 77 48 RTX 5080でMoEの消費電力が低い理由|…
Ollama
0.32.3
qwen3.5:35b-a3b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 44.7 3 回 359 395 10,482(重みの 41% が GPU) 49 47 16GB VRAMで38%あふれる qwen3…
Ollama
0.32.3
phi4:14b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 41.8 3 回 177 2,585 10,142(重みの 95% が GPU) 185 71 RTX 5080 16GBで12B〜14B級ロ…
Ollama
0.32.3
qwen3-coder:30b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 40.9 3 回 273 1,277 10,222(重みの 53% が GPU) 36 41 qwen3-coder:30bをローカルで動か…
Ollama
0.32.3
deepseek-coder-v2:16b-lite-instruct-q4_K_M Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 26.9 6 回 188 2,557 10,186(重みの 81% が GPU) 50 4643〜49 コーディング用ローカルLLM 5モデルをVRA…
Ollama
0.32.3
qwen3:14b Q4_K_M context 18,432 token / 生成上限 512 token / 思考モード なし 25.6 3 回 287 1,172 10,048(重みの 82% が GPU) 109 54 RTX 5080 16GBで12B〜14B級ロ…
Ollama
0.32.3
phi4:14b Q4_K_M context 16,384 token / 生成上限 512 token / 思考モード なし 24.9 6 回 198 1,537 9,978(重みの 81% が GPU) 106 57 RTX 5080 16GBで12B〜14B級ロ…
Ollama
0.32.3
deepseek-coder-v2:16b-lite-instruct-q4_K_M Q4_K_M context 16,384 token / 生成上限 512 token / 思考モード なし 24.0 3 回 189 2,322 10,128(重みの 68% が GPU) 49 52 コーディング用ローカルLLM 5モデルをVRA…
Ollama
0.32.3
qwen3:14b Q4_K_M context 32,768 token / 生成上限 512 token / 思考モード なし 16.5 3 回 294 858 10,100(重みの 69% が GPU) 58 44 RTX 5080 16GBで12B〜14B級ロ…
Ollama
0.32.3
qwen3:14b Q4_K_M context 40,960 token / 生成上限 512 token / 思考モード なし 12.9 3 回 298 643 9,996(重みの 63% が GPU) 37 39 RTX 5080 16GBで12B〜14B級ロ…
Ollama
0.32.3
codestral:22b Q4_0 context 8,192 token / 生成上限 512 token / 思考モード なし 11.9 3 回 142 817 10,180(重みの 71% が GPU) 50 46 コーディング用ローカルLLM 5モデルをVRA…
Ollama
0.32.3
codestral:22b-v0.1-q4_K_M Q4_K_M context 4,096 token / 生成上限 512 token / 思考モード なし 11.3 3 回 132 907 10,026(重みの 71% が GPU) 60 59 コーディング用ローカルLLM 5モデルをVRA…
Ollama
0.32.3
codestral:22b-v0.1-q4_K_M Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 10.0 6 回 150 771710〜832 10,172(重みの 68% が GPU) 52 4942〜56 コーディング用ローカルLLM 5モデルをVRA…
Ollama
0.32.3
codestral:22b-v0.1-q4_K_M Q4_K_M context 16,384 token / 生成上限 512 token / 思考モード なし 8.1 3 回 168 616 10,026(重みの 59% が GPU) 34 62 コーディング用ローカルLLM 5モデルをVRA…
Ollama
0.32.3
codestral:22b-v0.1-q4_K_M Q4_K_M context 32,768 token / 生成上限 512 token / 思考モード なし 6.9 3 回 191 531 10,096(重みの 49% が GPU) 28 45 コーディング用ローカルLLM 5モデルをVRA…
Ollama
0.32.3
qwen3.5:27b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 4.9 6 回 778 9489〜99 10,386(重みの 54% が GPU) 28 4840〜56 RTX 5080 16GB VRAMの壁に関す…
Ollama
0.32.3
qwen3:32b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 4.1 6 回 508 200 10,230(重みの 47% が GPU) 28 5449〜59 RTX 5080 16GB VRAMの壁に関す…
Ollama
0.32.3
gemma4:31b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 3.9 3 回 1,182 59 10,238(重みの 42% が GPU) 26 59 記事なし

画像・動画生成11 件

測定条件: RTX 4070 SUPER 12GB 単体 (OCuLink 接続) / 最終測定日 2026-09-09測り方: ComfyUI / MiniMax H3 を、LoRA・読み込み・条件付け・step 数を振って測る
ソフト モデル 量子化 解像度 測定条件 生成時間
計測 2回目以降
初回
VRAM ピーク
MiB
GPU 温度
°C
最終測定日 関連記事
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 4 / LoRA なし / sampler res_multistep / scheduler simple / 起動 1 本ごと 40.62(約 0.73 秒/枚) 3 回 該当なし 40.62 11,268 75 MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 1024×576 56frames step 4 / LoRA なし / sampler res_multistep / scheduler simple / 起動 1 本ごと 45.29(約 0.81 秒/枚) 1 回 該当なし 45.29 11,532 75 MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 72frames step 4 / LoRA なし / sampler res_multistep / scheduler simple / 起動 1 本ごと 51.07(約 0.71 秒/枚) 1 回 該当なし 51.07 11,108 76 MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) INT8 864×480 56frames step 4 / LoRA なし / sampler res_multistep / scheduler simple / 起動 1 本ごと 55.08(約 0.98 秒/枚) 3 回 該当なし 55.08 11,468 77 MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 88frames step 4 / LoRA なし / sampler res_multistep / scheduler simple / 起動 1 本ごと 57.08(約 0.65 秒/枚) 1 回 該当なし 57.08 11,756 78 MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 8 / LoRA なし / sampler res_multistep / scheduler simple / 起動 1 本ごと 57.61(約 1.03 秒/枚) 3 回 該当なし 57.61 11,300 78 MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 104frames step 4 / LoRA なし / sampler res_multistep / scheduler simple / 起動 1 本ごと 70.90(約 0.68 秒/枚) 1 回 該当なし 70.90 11,660 79 MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 1280×720 56frames step 4 / LoRA なし / sampler res_multistep / scheduler simple / 起動 1 本ごと 75.26(約 1.34 秒/枚) 1 回 該当なし 75.26 11,564 79 MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) INT8 864×480 56frames step 8 / LoRA なし / sampler res_multistep / scheduler simple / 起動 1 本ごと 89.82(約 1.60 秒/枚) 3 回 該当なし 89.82 11,500 78 MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 136frames step 4 / LoRA なし / sampler res_multistep / scheduler simple / 起動 1 本ごと 90.34(約 0.66 秒/枚) 1 回 該当なし 90.34 11,564 80 MiniMax H3をVRAM 16GBで動か…
ComfyUI
0.31.1
MiniMax H3 (fl2va pruned) FP8 864×480 56frames step 20 / LoRA なし / sampler res_multistep / scheduler simple / 起動 1 本ごと 107.77(約 1.92 秒/枚) 3 回 該当なし 107.77 11,350 80 MiniMax H3をVRAM 16GBで動か…

デュアルGPU(RTX 5080 × RTX 5060 Ti)23 件

ローカルLLM23 件

測定条件: デュアルGPU(RTX 5080 × RTX 5060 Ti) / 最終測定日 2026-09-08測り方: Ollama / 3回計測の IQR 中央値 / 思考モードなし / seed 固定 / VRAM と常駐率も記録
ソフト モデル 量子化 測定条件 生成速度
tok/s
計測 初 token
ms
プロンプト処理
tok/s
VRAM
MiB
消費電力
W
GPU 温度
°C
最終測定日 関連記事
Ollama
0.32.3
qwen3-coder:30b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 158.2 6 回 152 2,8392,670〜3,008 25,192 100 52 qwen3-coder:30bをローカルで動か…
Ollama
0.32.3
qwen3.6:35b-a3b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 128.5 6 回 327 594 29,804 94 52 Qwen3.6-35B-A3B とは?MoE型…
Ollama
0.32.3
qwen3.5:27b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 30.3 6 回 408 316 19,532 133 56 RTX 5080 16GB VRAMの壁に関す…
Ollama
0.32.3
qwen3:32b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 25.9 6 回 186 1,192 23,728 145 5854〜63 RTX 5080 16GB VRAMの壁に関す…
Ollama
0.32.3
gemma4:31b Q4_K_M context 8,192 token / 生成上限 512 token / 思考モード なし 25.9 6 回 484 361 24,108 139 62 記事なし
測定条件: デュアルGPU(RTX 5080 × RTX 5060 Ti) / 最終測定日 2026-09-10測り方: llama.cpp の llama-server / 生成速度の中央値 / GPU 別の使用量と電力を同時記録
ソフト モデル 量子化 測定条件 生成速度
tok/s
計測 初 token
ms
プロンプト処理
tok/s
VRAM
MiB
消費電力
W
GPU 温度
°C
最終測定日 関連記事
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 262,144 token / 生成上限 128 token 36.4 3 回 134 189 30,175 257 57 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 131,072 token / 生成上限 128 token 36.4 3 回 135 193 22,576 257 56 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 131,072 token / 生成上限 記録なし 35.9 6 回 157 169144〜195 23,184 250 56 Qwen3.8-27BをVRAM 16GBで実…
llama.cpp
b10356
Qwen3.8-27B UD-Q3_K_XL context 262,144 token / 生成上限 記録なし 35.8 6 回 161 181161〜201 30,592 253 56 Qwen3.8-27BをVRAM 16GBで実…
測定条件: デュアルGPU(RTX 5080 × RTX 5060 Ti) / 最終測定日 2026-07-05測り方: Ollama / 3回計測の IQR 中央値 / 思考モードなし / seed の記録なし / VRAM と常駐率も記録
ソフト モデル 量子化 測定条件 生成速度
tok/s
計測 初 token
ms
プロンプト処理
tok/s
VRAM
MiB
消費電力
W
GPU 温度
°C
最終測定日 関連記事
Ollama
0.30.7
qwen3-coder:30b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 145.3 3 回 273 2,318 記録なし 111 55 qwen3-coder:30bをローカルで動か…
Ollama
0.30.7
Ornith-1.0-35B (Q4_K_M) Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 125.9 3 回 248 1,086 記録なし 105 58 Ornith-1.0をローカルで動かすには?9…
Ollama
0.30.7
qwen3.6:35b-a3b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 123.8 3 回 272 1,013 記録なし 104 54 Qwen3.6-35B-A3B とは?MoE型…
Ollama
0.30.7
qwen3.5:35b-a3b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 122.4 3 回 408 950 記録なし 107 59 16GB VRAMで38%あふれる qwen3…
Ollama
0.30.7
qwen3.5:35b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 120.2 3 回 494 945 記録なし 104 55 16GB VRAMで38%あふれる qwen3…
Ollama
0.30.7
gemma4:26b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 101.3 3 回 690 1,015 記録なし 104 54 RTX 5080でMoEの消費電力が低い理由|…
Ollama
0.30.7
codestral:22b Q4_0 context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 40.2 3 回 57 2,699 記録なし 131 54 コーディング用ローカルLLM 5モデルをVRA…
Ollama
0.30.7
qwen3.5:27b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 29.2 3 回 318 523 記録なし 134 61 RTX 5080 16GB VRAMの壁に関す…
Ollama
0.30.7
qwen3:32b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 26.0 3 回 172 1,213 記録なし 142 61 RTX 5080 16GB VRAMの壁に関す…
Ollama
0.30.7
gemma4:31b Q4_K_M context 指定なし / 生成上限 512 token / 思考モード なし / 初 token の基準 記録なし 25.7 3 回 414 515 記録なし 138 60 記事なし
測定条件: デュアルGPU(RTX 5080 × RTX 5060 Ti) / 最終測定日 2026-09-09測り方: llama-bench / 2 枚への分け方 (レイヤー分割・テンソル並列) を比べる
ソフト モデル 量子化 測定条件 生成速度
tok/s
計測 初 token
ms
プロンプト処理
tok/s
VRAM
MiB
消費電力
W
GPU 温度
°C
最終測定日 関連記事
llama.cpp
b10092
Qwen3.6-35B-A3B-UD-Q4_K_XL UD-Q4_K_XL context 指定なし / split mode layer 118.2 6 回 未測定 3,354 24,166(最大) 84 56 Qwen3.6-35B-A3B とは?MoE型…
llama.cpp
b10092
Qwen3.6-35B-A3B-UD-Q4_K_XL UD-Q4_K_XL context 指定なし / split mode tensor 113.7 6 回 未測定 2,907 24,961(最大) 86 56 Qwen3.6-35B-A3B とは?MoE型…
llama.cpp
b10092
Qwen3-32B Q4_K_M Q4_K_M context 指定なし / split mode tensor 33.8 6 回 未測定 1,003 22,029(最大) 89 57 記事なし
llama.cpp
b10092
Qwen3-32B Q4_K_M Q4_K_M context 指定なし / split mode layer 25.6 6 回 未測定 1,182 21,874(最大) 225 56 記事なし

測定方法と、表の読み方

  • 値に幅が併記されている所は、まとめた測定の間で値にばらつきがあった所です。
  • 「計測」の列は、同じ条件で何回測ったかです。
  • 量子化は、その回のモデル実体の記録から取っています(計測時の記録、記録済みダイジェストとの照合、モデル名・タグ・重みファイル名の表記の順)。「なし」は、量子化していない重みをそのまま読んだ回です(読み込んだファイル名が記録に在り、そこに量子化の表記が無い回)。計算精度(bf16 など)は量子化とは別のもので、表の見出しの条件に書いています。
  • ソフトは、その値を出したソフトと Ver です。
  • 初 token までは、読み込み済みの回と未読み込みからの初回で桁が変わるため、同じ列に混ぜていません。両方が混ざる表では読み込み済みの回だけを出し、どちらの回か記録していない測定は、測定条件の列に「初 token の基準 記録なし」と書いています。
  • VRAM は測定した GPU 全体の使用量(常駐分を含む)。VRAM の後ろに(重みの ○% が GPU)と付いている所は、モデルの重みの一部が GPU に載らず CPU 側へ逃げた状態です。この数字は Ollama で測った回にしかありません(Ollama が返す値で、KV cache や、ドライバが専用 VRAM から共有メモリへ逃がした分は含みません)。llama.cpp や ComfyUI で測った回には同じ意味の値が無いため、付いていないことは「載りきった」という意味ではありません
  • 2 枚とも使える状態で測っても、モデルが 1 枚に収まれば実際には片方しか動きません。その回は GPU ごとの消費電力と VRAM の記録から判定して、そのカード 1 枚の表に入れています。2 枚に分かれて動いた回だけを「デュアルGPU」の表にしています(その表の VRAM は 2 枚の合計です)。
  • 生成時間の後ろの括弧(約 ○ 秒/枚)は、その生成時間を出した枚数で割った計算値です(動画のフレームも 1 枚ずつの絵として数えています)。静止画は 1 枚なので出していません。枚数の差は外れますが、step 数と解像度の差は残ります。フレーム数を記録していない回にも出していません(1 枚と見なすと 56 倍に化けるため)。
  • 画像・動画の表は生成 1 回にかかった秒数で、数字が小さいほど速いという読み方になります(LLM の表とは逆)。「初回」はモデルの読み込みを含む 1 回目です。
  • 同じ条件を何度か測っている所は、その全部を畳んだ 1 行にしています。古い測定も捨てていないので、行の数字はいちばん新しい回の値とは限りません。測定日には最後に測った日を書いています。
  • ソフトの Ver は測定時に動かしていた Ver です。同じモデル・同じ機材でも Ver によって速度が動くため、Ver が違う所の差は Ver の差を含みます。Ver を記録していない測定はこのページに載せていません。
  • 関連記事はそのモデルを扱った記事へのリンクで、その測定をそのまま解説しているとは限りません。
  • 値が入っていない項目は 3 つに書き分けています。未測定=その測り方がその指標を取っていない(例: llama-bench は初 token までを返さない)。記録なし=その測り方では取れている指標だが、この行の記録に値が無い。該当なし=その条件では成り立たない(例: 毎回モデルを読み込み直した条件に「2 回目以降」は無い)。カーソルを合わせるとその項目の詳しい理由が出ます。どれも 0 という意味ではありません。
  • 測定日はそれぞれ別に出しています。機材の構成は検証環境にまとめています。
この表で測っていないこと

  • 特定の 1 台での値です。同じ型番でも冷却・電源・ドライバの Ver で動きます。「この GPU の上限」ではありません。
  • 速度と使用量だけで、出力の品質は測っていません。
  • 同じタグでも配布側が中身を差し替えると値は変わります。測定日より後に更新されたモデルについては古い中身の値です。
  • 1 度に複数の依頼を投げたとき(同時実行)は範囲外です。どの測定も 1 本ずつ投げています。
タイトルとURLをコピーしました