1本の記事では比べられないもの——VRAMピークの読み方、システムRAMの増え方、機材を変えたときの差——をここに置いています。モデルごとの手順や条件を変えた測定は個別の記事にあります。画像生成は要件の決まり方が違うため ローカル画像生成のハード要件ガイド に分けました。
| 部品 | 決めるもの |
|---|---|
| VRAM | モデルが乗るかどうか |
| システムRAM | 出力物の大きさ(と、モデル一式の置き場) |
| GPUの速さ | 出来上がるまでの時間 |
重い動画ワークフローでは、VRAMピークが機材の天井近くまで張り付く
MiniMax H3の同じワークフロー(864×480・56フレーム)を、VRAM容量の違う3枚で測りました。
| GPU | VRAM容量 | ピーク中央値 | 容量に対して | 測定回数 |
|---|---|---|---|---|
| RTX 4070 SUPER | 12GB | 11.1 GiB | 92% | 5 |
| RTX 5060 Ti | 16GB | 15.1 GiB | 95% | 13 |
| RTX 5080 | 16GB | 15.2 GiB | 95% | 11 |
3枚とも完走しています(この3枚は接続の仕方も違うので、所要の比較には使えません。詳しくは後半)。同じワークフローなのにピークが4GiB違うのは、ComfyUIが空きVRAMがあればモデルを追加でVRAMへ載せ、必要に応じて一部をCPU側へオフロードする作りで、加えてPyTorchが確保した領域をすぐには返さないからです。足りなければ重みを部分的にだけ載せ、残りはCPU側へオフロードして、必要に応じてVRAMへロードします。
つまり「ピークが15GiBだったから16GB必要」とは読めません。かといって「12GBで足りる」と一般化もできず、これは1つのワークフローで確かめた結果です。12GB機は載せきれない分を都度送る形になりますが、この3枚はGPU世代・性能・接続条件が混在しているので、ここから遅くなる量は読めません。同じGPUで使えるVRAMだけを絞った実測は ComfyUIで使えるVRAMを絞ると画像・動画生成は遅くなるか にあります。
動画側で測った全体でも同じ傾向で、16GB機のピークは中央値95%・幅14.3〜15.7GiB(測定72件)に収まります。いっぽう画像生成は同じ16GB機でも中央値79%・幅7.3〜15.3GiBと散らばります(⚠この幅の一部は測定計画によるものです——画像側にはVRAMを下げる目的で精度フラグを変えた条件が入っていて、下限の7.3GiBはそのfp8条件の値)。少なくとも動画側のように容量の95%へ張り付く傾向は、画像側では見られません。最も重いFlux.1 devだけは16GB機のピークと同じ水準まで行くので、分かれ目は「動画だから」ではなく、モデル一式が容量に対してどれだけ大きいかのほうです。あふれた先で何が起きるかは VRAM 12GBの壁はどこにあるか にまとめました。
システムRAMが何で増えるかは、生成とアップスケールで違う
VRAMで見分けがつかない分、機材選びで詰まるのはシステムRAM側です。同じワークフローの中で生成からアップスケールまで通す場合、生成側のメモリ負担に、アップスケール側のフレーム保持が重なることがあります。
生成中のRAMは、フレーム数より固定的な負担のほうが大きかった
LTX 2.5のQ3量子化ビルド(1216×672)をRTX 5080で回したときのRAMピークです。
| フレーム数 | RAMピーク(中央値) | セッション間の幅 | セッション数 |
|---|---|---|---|
| 97 | 47.6 GiB | 33.5〜48.5 GiB | 8 |
| 241 | 47.5 GiB | 45.9〜48.0 GiB | 4 |
| 721 | 50.6 GiB | 50.6〜50.7 GiB | 3 |
今回の1216×672の測定では、97フレームと241フレームでRAMピークの差が付かず、7倍以上に延ばした721フレームでも約3GiB高いだけでした。少なくともこの条件では、フレーム数そのものより固定的なメモリ負担のほうが大きく出ています。
LTX 2.5は22Bで、公式のbf16一式(HuggingFaceのファイル一覧で本体42GB+Gemma 4 12Bのテキストエンコーダ26.3GB、ほかにVAE)は70GB近くあります。ここで回しているのはQ3量子化ビルドで、使ったファイル一式は合計28.06GiB。それでも16GBのVRAMには全構成要素を同時に載せられないので、段ごとの載せ替えや一部ウェイトのCPU側オフロードを使いながら動きます。
97→721フレームで増えたRAMは約3.0GiB、1フレームあたり約4.9MiBでした。47〜51GiB規模のRAMピーク全体に対する増加は小さく、増分の内訳は切り分けていません。尺を延ばして増えるのは主に時間のほうです。所要の実測値と、この挙動の詳細は LTX 2.5を16GB VRAMで回す|モデル一式28GiBが収まらない状態の所要・RAM・2段構成を実測 で扱っています。
アップスケールのRAMは、出力解像度 × フレーム数にほぼ比例した
生成済みの動画をESRGANで4倍に上げる工程は、逆にフレーム数がそのまま乗ります。1344×768を4x-UltraSharpで上げたときのRAMピークです。
| フレーム数 | RAMピーク |
|---|---|
| 16 | 6.2 GiB |
| 32 | 11.8 GiB |
| 64 | 25.3 GiB |
| 128 | 49.6 GiB |
| 192 | 69.2 GiB |
1フレームあたり約0.37GiBで、ほぼ直線に乗ります。これは出力解像度のfloat32 RGBフレーム2枚分を計算した約0.37GiBと数値上ほぼ一致します(1344×768の4倍=5376×3072なら1枚0.18GiB)。ただし実際のRAM内訳までは切り分けていません。
裏を返せば、搭載RAMから一度に上げられるフレーム数の目安を先に概算できます(OSやComfyUI自身の固定消費があるので、RAM容量÷0.37GiBを上限とはできません)。全フレームを抱えずに固定長のキューで1枚ずつ処理する実装をComfyUIの外で走らせたときは、RAMが1.4GBまで下がりました。容量を積む前にワークフロー側を見直す手もあります(ComfyUIのアップスケールはRAMを67GB食う|ComfyUI外でESRGANを動かしRAM1.4GB・2倍速にする方法)。ワークフロー別のRAMピークをひと通り並べたものは 画像・動画生成でシステムRAMは何GB要るか にあります。
同じ16GBでも、カードが違うと1.6〜2.7倍変わる
RTX 5080とRTX 5060 Ti(どちらもVRAM 16GB)を同じ条件で比べられた組が21あります。5060 Ti側の所要は5080の1.62〜2.67倍、中央値1.99倍でした。
--reserve-vram が付いていた回は、機材の差ではなく設定の差を測ることになるので外しています。| モデル・条件 | RTX 5080 | RTX 5060 Ti | 倍率 |
|---|---|---|---|
| MiniMax H3/864×480・56フレーム(8ステップ) | 44.5秒 | 71.9秒 | 1.62倍 |
| MiniMax H3/864×480・56フレーム(同じモデルで4ステップ) | 18.2秒 | 45.0秒 | 2.47倍 |
| LTX-2.5 Q3/1216×672・241フレーム | 288.5秒 | 670.1秒 | 2.32倍 |
| LTX-2.5 Q3/1280×704・121フレーム | 110.5秒 | 294.4秒 | 2.67倍 |
表の1行目と2行目は、同じモデル・同じ解像度・同じフレーム数で、ステップ数だけが違う条件です(8ステップと4ステップ)。それだけで1.62倍と2.47倍に分かれます。ステップを削って計算そのものが短くなるほど、モデルの出し入れのような固定の待ちが占める割合が増えた可能性と整合します(内訳は測っていません)。MiniMax H3系だけを取り出しても16条件が1.62〜2.47倍に散らばります。
つまり「解像度が高いほど」「尺が長いほど」開くという読み方は、この21条件では成り立ちません。表の3行目と4行目がそれで、241フレームのほうが重い(5080で288.5秒 対 110.5秒)のに、倍率は2.32倍と2.67倍で逆になっています。
実際に判断を分けるのは倍率よりも、使うモデル一式が16GBに収まるかどうかです。
なお動画は1本が長いので「2枚で分担して速くならないか」と考えたくなります。ComfyUI本体には1回の生成を2枚へ分割するMultiGPU CFG Splitがあり、公式は最大1.95倍としていますが、同じGPUを2枚かつcfgが1を超えるワークフローが条件です。ここで扱っている蒸留モデルはcfg=1で回すため高速化せず、当サイトは異種構成なので対象外でした(ComfyUI マルチGPU運用ガイド)。v0.34以降のWindowsで既定が変わった件は ComfyUIで使うGPUを指定する にあります。
どのカードにするか決めるなら同じ容量でも出来上がるまでの時間は型番で変わります。売っているグラフィックボードを、ケースに収まる厚みと補助電源の形から絞り込めます。
モデル別の詳細
MiniMax H3
LTX
機材を決める前に見ておくところ
動画生成を前提にPCを組むなら、順番は「使うモデル一式のサイズ → それがVRAMに収まるか → システムRAM → GPU」になります。VRAMピークの数字から必要量は読めませんが、それは容量が関係しないという意味ではありません。一式が収まらない条件では所要が大きく落ちるので、見るべきは「ピークの値」ではなく「収まるかどうか」のほうです。
システムRAMは、今回のLTX 2.5構成ではピーク47〜51GiBに達しました。アップスケールで69.2GiBに達したのはComfyUI内で回した場合の値なので、そこを理由にRAMを積む前に、ComfyUIの外で処理する選択肢を先に検討してください。
PCごと用意するならVRAM容量で絞り込めば、その条件で販売中のBTOパソコンだけが残ります。載せているのは各社の公式サイトで実際に買える構成だけです。