ローカル動画生成のハード要件ガイド|VRAM・システムRAM・GPUの見方

ComfyUIで動画を回すかぎり、VRAMのピーク使用量を見ても必要なVRAM容量は分かりません。
MiniMax H3の同じワークフローを回すと、12GBのカードでは11.1GiB、16GBのカードでは15.2GiBまで使い、どちらも完走しました。ピークは「最小必要量」ではなく、その構成でComfyUIとPyTorchが実際に確保・使用した量です。ただしどのモデルでも12GBで回るという話ではなく、今回使ったQ3量子化版のLTX 2.5一式は28.06GiBあり、16GBにも収まりません。

1本の記事では比べられないもの——VRAMピークの読み方、システムRAMの増え方、機材を変えたときの差——をここに置いています。モデルごとの手順や条件を変えた測定は個別の記事にあります。画像生成は要件の決まり方が違うため ローカル画像生成のハード要件ガイド に分けました。

部品 決めるもの
VRAM モデルが乗るかどうか
システムRAM 出力物の大きさ(と、モデル一式の置き場)
GPUの速さ 出来上がるまでの時間

重い動画ワークフローでは、VRAMピークが機材の天井近くまで張り付く

MiniMax H3の同じワークフロー(864×480・56フレーム)を、VRAM容量の違う3枚で測りました。

GPU VRAM容量 ピーク中央値 容量に対して 測定回数
RTX 4070 SUPER 12GB 11.1 GiB 92% 5
RTX 5060 Ti 16GB 15.1 GiB 95% 13
RTX 5080 16GB 15.2 GiB 95% 11

3枚とも完走しています(この3枚は接続の仕方も違うので、所要の比較には使えません。詳しくは後半)。同じワークフローなのにピークが4GiB違うのは、ComfyUIが空きVRAMがあればモデルを追加でVRAMへ載せ、必要に応じて一部をCPU側へオフロードする作りで、加えてPyTorchが確保した領域をすぐには返さないからです。足りなければ重みを部分的にだけ載せ、残りはCPU側へオフロードして、必要に応じてVRAMへロードします。

つまり「ピークが15GiBだったから16GB必要」とは読めません。かといって「12GBで足りる」と一般化もできず、これは1つのワークフローで確かめた結果です。12GB機は載せきれない分を都度送る形になりますが、この3枚はGPU世代・性能・接続条件が混在しているので、ここから遅くなる量は読めません。同じGPUで使えるVRAMだけを絞った実測は ComfyUIで使えるVRAMを絞ると画像・動画生成は遅くなるか にあります。

動画側で測った全体でも同じ傾向で、16GB機のピークは中央値95%・幅14.3〜15.7GiB(測定72件)に収まります。いっぽう画像生成は同じ16GB機でも中央値79%・幅7.3〜15.3GiBと散らばります(⚠この幅の一部は測定計画によるものです——画像側にはVRAMを下げる目的で精度フラグを変えた条件が入っていて、下限の7.3GiBはそのfp8条件の値)。少なくとも動画側のように容量の95%へ張り付く傾向は、画像側では見られません。最も重いFlux.1 devだけは16GB機のピークと同じ水準まで行くので、分かれ目は「動画だから」ではなく、モデル一式が容量に対してどれだけ大きいかのほうです。あふれた先で何が起きるかは VRAM 12GBの壁はどこにあるか にまとめました。

システムRAMが何で増えるかは、生成とアップスケールで違う

VRAMで見分けがつかない分、機材選びで詰まるのはシステムRAM側です。同じワークフローの中で生成からアップスケールまで通す場合、生成側のメモリ負担に、アップスケール側のフレーム保持が重なることがあります。

生成中のRAMは、フレーム数より固定的な負担のほうが大きかった

LTX 2.5のQ3量子化ビルド(1216×672)をRTX 5080で回したときのRAMピークです。

フレーム数 RAMピーク(中央値) セッション間の幅 セッション数
97 47.6 GiB 33.5〜48.5 GiB 8
241 47.5 GiB 45.9〜48.0 GiB 4
721 50.6 GiB 50.6〜50.7 GiB 3
97と241は「241のほうが少ない」ではありません。中央値の差は0.1GiB(0.16%)ですが、同じ97フレームの条件でもセッションごとに33.5〜48.5GiBとばらついています。差より幅のほうがはるかに大きいので、この2つは区別が付かなかったと読むのが正確です。いっぽう721フレームは3セッションとも50.5GiBを超えており、97・241の全セッション(最大48.5GiB)と重なりません。ここは差として読めます。

今回の1216×672の測定では、97フレームと241フレームでRAMピークの差が付かず、7倍以上に延ばした721フレームでも約3GiB高いだけでした。少なくともこの条件では、フレーム数そのものより固定的なメモリ負担のほうが大きく出ています。

LTX 2.5は22Bで、公式のbf16一式(HuggingFaceのファイル一覧で本体42GB+Gemma 4 12Bのテキストエンコーダ26.3GB、ほかにVAE)は70GB近くあります。ここで回しているのはQ3量子化ビルドで、使ったファイル一式は合計28.06GiB。それでも16GBのVRAMには全構成要素を同時に載せられないので、段ごとの載せ替えや一部ウェイトのCPU側オフロードを使いながら動きます。

内訳は分けていません。RAMピーク47〜51GiBのうち何GiBがモデル本体・pinned memory・実行時バッファに当たるかは切り分けていません。ファイル合計の28.06GiBを引いて残りを実行時バッファと読むこともできません。同じ1216×672・97フレームでも、プロンプトの経路によってRAMが23.7GBと47.8GBに分かれ、pinned memoryを無効にすると48.5GBから33.5GBまで下がりました(LTX 2.5を16GB VRAMで回す)。

97→721フレームで増えたRAMは約3.0GiB、1フレームあたり約4.9MiBでした。47〜51GiB規模のRAMピーク全体に対する増加は小さく、増分の内訳は切り分けていません。尺を延ばして増えるのは主に時間のほうです。所要の実測値と、この挙動の詳細は LTX 2.5を16GB VRAMで回す|モデル一式28GiBが収まらない状態の所要・RAM・2段構成を実測 で扱っています。

アップスケールのRAMは、出力解像度 × フレーム数にほぼ比例した

生成済みの動画をESRGANで4倍に上げる工程は、逆にフレーム数がそのまま乗ります。1344×768を4x-UltraSharpで上げたときのRAMピークです。

フレーム数 RAMピーク
16 6.2 GiB
32 11.8 GiB
64 25.3 GiB
128 49.6 GiB
192 69.2 GiB

1フレームあたり約0.37GiBで、ほぼ直線に乗ります。これは出力解像度のfloat32 RGBフレーム2枚分を計算した約0.37GiBと数値上ほぼ一致します(1344×768の4倍=5376×3072なら1枚0.18GiB)。ただし実際のRAM内訳までは切り分けていません。

フレーム数だけでは決まりません。同じ4倍でも、864×480を上げたときは1フレームあたり0.17GiBでした(56フレームで9.6GiB)。今回の構成ではおおむね出力解像度×フレーム数に比例するので、別の解像度に0.37GiBをそのまま当てはめると外します。

裏を返せば、搭載RAMから一度に上げられるフレーム数の目安を先に概算できます(OSやComfyUI自身の固定消費があるので、RAM容量÷0.37GiBを上限とはできません)。全フレームを抱えずに固定長のキューで1枚ずつ処理する実装をComfyUIの外で走らせたときは、RAMが1.4GBまで下がりました。容量を積む前にワークフロー側を見直す手もあります(ComfyUIのアップスケールはRAMを67GB食う|ComfyUI外でESRGANを動かしRAM1.4GB・2倍速にする方法)。ワークフロー別のRAMピークをひと通り並べたものは 画像・動画生成でシステムRAMは何GB要るか にあります。

同じ16GBでも、カードが違うと1.6〜2.7倍変わる

RTX 5080とRTX 5060 Ti(どちらもVRAM 16GB)を同じ条件で比べられた組が21あります。5060 Ti側の所要は5080の1.62〜2.67倍、中央値1.99倍でした。

数えた条件について:この21条件は、両側の起動オプションがそろっている回だけです。片側にだけ --reserve-vram が付いていた回は、機材の差ではなく設定の差を測ることになるので外しています。
モデル・条件 RTX 5080 RTX 5060 Ti 倍率
MiniMax H3/864×480・56フレーム(8ステップ) 44.5秒 71.9秒 1.62倍
MiniMax H3/864×480・56フレーム(同じモデルで4ステップ) 18.2秒 45.0秒 2.47倍
LTX-2.5 Q3/1216×672・241フレーム 288.5秒 670.1秒 2.32倍
LTX-2.5 Q3/1280×704・121フレーム 110.5秒 294.4秒 2.67倍

表の1行目と2行目は、同じモデル・同じ解像度・同じフレーム数で、ステップ数だけが違う条件です(8ステップと4ステップ)。それだけで1.62倍と2.47倍に分かれます。ステップを削って計算そのものが短くなるほど、モデルの出し入れのような固定の待ちが占める割合が増えた可能性と整合します(内訳は測っていません)。MiniMax H3系だけを取り出しても16条件が1.62〜2.47倍に散らばります。

つまり「解像度が高いほど」「尺が長いほど」開くという読み方は、この21条件では成り立ちません。表の3行目と4行目がそれで、241フレームのほうが重い(5080で288.5秒 対 110.5秒)のに、倍率は2.32倍と2.67倍で逆になっています。

この倍率は、ほかの環境にそのまま当てはめられません。当サイトの検証機はRTX 5080がマザーボード直結のPCIe 5.0 x16、RTX 5060 TiはOculink経由のPCIe 4.0 x4です。片方向の理論帯域にはおよそ8倍の差があります。VRAM内に主要なワーキングセットを保持できる条件ではホスト転送の影響が小さくなり、差はGPU側の性能差に近づくと考えられます。いっぽうモデル一式が収まらない条件では重みの出し入れがこのホストリンクを通るため、2.3〜2.7倍にはGPU自体の差と接続の差が同居していて、分離できていません。5060 Tiをマザーボードへ直結した読者の環境では、重い条件の差はこれより小さくなる可能性があります。

実際に判断を分けるのは倍率よりも、使うモデル一式が16GBに収まるかどうかです。

なお動画は1本が長いので「2枚で分担して速くならないか」と考えたくなります。ComfyUI本体には1回の生成を2枚へ分割するMultiGPU CFG Splitがあり、公式は最大1.95倍としていますが、同じGPUを2枚かつcfgが1を超えるワークフローが条件です。ここで扱っている蒸留モデルはcfg=1で回すため高速化せず、当サイトは異種構成なので対象外でした(ComfyUI マルチGPU運用ガイド)。v0.34以降のWindowsで既定が変わった件は ComfyUIで使うGPUを指定する にあります。

どのカードにするか決めるなら同じ容量でも出来上がるまでの時間は型番で変わります。売っているグラフィックボードを、ケースに収まる厚みと補助電源の形から絞り込めます。

GPU選びを開く →

モデル別の詳細

機材を決める前に見ておくところ

動画生成を前提にPCを組むなら、順番は「使うモデル一式のサイズ → それがVRAMに収まるか → システムRAM → GPU」になります。VRAMピークの数字から必要量は読めませんが、それは容量が関係しないという意味ではありません。一式が収まらない条件では所要が大きく落ちるので、見るべきは「ピークの値」ではなく「収まるかどうか」のほうです。

システムRAMは、今回のLTX 2.5構成ではピーク47〜51GiBに達しました。アップスケールで69.2GiBに達したのはComfyUI内で回した場合の値なので、そこを理由にRAMを積む前に、ComfyUIの外で処理する選択肢を先に検討してください。

PCごと用意するならVRAM容量で絞り込めば、その条件で販売中のBTOパソコンだけが残ります。載せているのは各社の公式サイトで実際に買える構成だけです。

BTO選びを開く →

関連ガイド

本ページの数値は当サイトの検証機材による実測です:Intel Core i7-14700F/96GB DDR5/RTX 5080(16GB・マザーボード直結)+RTX 5060 Ti(16GB・Oculink DEG1接続)/RTX 4070 SUPER(12GB・Oculink接続)。各値は同じ条件で測った回の中央値で、測定回数を併記しています。VRAMピークは生成中に nvidia-smi の memory.used をサンプルした最大値で、他アプリとPyTorchが確保したまま保持している分を含みます(5080は画面出力も兼ねています)。測定条件の詳細は 検証環境ページ、1行ずつの生の値は 実測データベース をご覧ください。

タイトルとURLをコピーしました