Wan Animate 2をVRAM 16GBで動かす|PyTorchのバージョンとキャッシュの置き場で所要が変わる実測

Wan Animate 2に関する記事のアイキャッチ画像 - Wan Animate 2をVRAM 16GBで動かす AI動画生成

要点

試した二枚の GPU はどちらも、公式テンプレートどおりの解像度と長さで生成まで通った。解像度を上げた設定は、README の手順で入れたものとは別のバージョンの PyTorch を使ったときに片方のカードで通ったが、一本に長い時間がかかった。

所要を最も大きく変えたのは PyTorch の CUDA 版で、ComfyUI の README が求めるバージョンに満たない PyTorch では、同じワークフローでも所要が大きく延びた。どちらかは起動ログのバージョン表示で見分けられる。

キャッシュの置き場は、README の求める CUDA 版なら CPU (RAM) に置くとキャッシュなしより短くなり、テンプレート既定の GPU 置きでも CPU 置きと大きくは変わらなかった。CUDA のバージョンが満たない環境では、GPU 置きが極端に遅くなった。

16GB の GPU で Wan Animate 2 は動くか

Wan Animate 2 は、公式モデルカードの説明によると、駆動動画をそのまま受け取るエンドツーエンドのキャラクターアニメーション用フレームワークで、参照画像のキャラクターに駆動動画の動きを移す。ComfyUI には公式のワークフローテンプレートが用意されている。この記事ではそのテンプレートと同じ結線・同じ入力素材を使い、どちらも VRAM 16GB の RTX 5080 と RTX 5060 Ti で、所要とメモリを測った。

PyTorch 2.14.0+cu130 の環境では、480×848・81フレームの出力が2枚とも、試した設定のすべてで生成まで通った。試したのは標準版と distill 版のそれぞれでキャッシュなし・CPU 置き、標準版ではテンプレート既定の GPU 置きも加えた組み合わせだ。公式テンプレートでは、標準版を LoRA と組み合わせて6ステップ、distill 版を LoRA なしの10ステップで回す設定になっており、この記事もその設定で測った。キャッシュはテンプレートにある WanAnimate2Cache ノードの設定で、テンプレートの既定は GPU 置きだ。どちらも後の節で詳しく扱う。1本の所要 (2回目以降の中央値) は、RTX 5080 が 119.2秒から 281.0秒、RTX 5060 Ti が 248.4秒から 380.6秒だった。RTX 5060 Ti の distill 版・キャッシュなしは3本の所要が揃わなかったため、この範囲には入れていない。

GPU モデル キャッシュ 1本 (2回目以降の中央値) 2回目以降の範囲 1ステップ (中央値) ホストRAMのピーク (中央値) VRAMのピーク (最大)
RTX 5080 標準版 (int8_convrot + LoRA・6ステップ) キャッシュなし 172.0秒 171.2〜172.9秒 27.4秒 18.2GiB 15,558MiB
RTX 5080 標準版 (int8_convrot + LoRA・6ステップ) CPU (RAM) に int8 で置く 119.2秒 118.2〜120.2秒 16.2秒 24.5GiB 15,563MiB
RTX 5080 標準版 (int8_convrot + LoRA・6ステップ) GPU (VRAM) に int8 で置く (テンプレート既定) — (1本のみ。読み込み込みで 138.2秒) — 17.1秒 23.9GiB 15,609MiB
RTX 5080 distill版 (10ステップ) キャッシュなし 281.0秒 280.5〜281.4秒 26.9秒 17.8GiB 15,591MiB
RTX 5080 distill版 (10ステップ) CPU (RAM) に int8 で置く 184.6秒 182.6〜186.6秒 16.1秒 23.7GiB 15,581MiB
RTX 5060 Ti 標準版 (int8_convrot + LoRA・6ステップ) キャッシュなし 370.8秒 370.8〜370.9秒 59.3秒 17.4GiB 14,926MiB
RTX 5060 Ti 標準版 (int8_convrot + LoRA・6ステップ) CPU (RAM) に int8 で置く 248.4秒 248.3〜248.6秒 34.5秒 23.6GiB 14,926MiB
RTX 5060 Ti 標準版 (int8_convrot + LoRA・6ステップ) GPU (VRAM) に int8 で置く (テンプレート既定) — (1本のみ。読み込み込みで 268.2秒) — 34.1秒 23.1GiB 14,922MiB
RTX 5060 Ti distill版 (10ステップ) キャッシュなし 代表値にしない (1本目は読み込み込みで 1131.9秒、2回目以降も 800.8秒 → 644.3秒 と揃わなかった) — 77.7秒 25.0GiB 16,013MiB
RTX 5060 Ti distill版 (10ステップ) CPU (RAM) に int8 で置く 380.6秒 380.6〜380.6秒 34.0秒 23.0GiB 14,908MiB

出力は 480×848・81フレーム、PyTorch 2.14.0+cu130。所要は ComfyUI の実行開始から終了までで、モデルの読み込みは1本目だけに入る。GPU に置いた条件は各1本しか回しておらず、その値は読み込みを含む。ホストRAMは ComfyUI のプロセスが使った量のピーク、VRAM は nvidia-smi の値で、画面出力などほかの用途の分を含む。RTX 5060 Ti は OCuLink 接続のため、2枚の差を GPU の性能差だけに帰すことはできない。RTX 5060 Ti の distill 版・キャッシュなしは3本の所要が揃わず、VRAM のピークもカードの容量近くまで上がった。原因は切り分けていない。

16GB の VRAM で動画生成モデルを回した別の例として、LTX を 16GB の VRAM で回した実測もある。

配布されているファイルと公式テンプレートの既定

ComfyUI の公式ブログによると、ComfyUI は2026年8月8日に Wan Animate 2 へのネイティブ対応を告知しており、ComfyUI 向けの重みは Hugging Face の Comfy-Org/Wan-Animate-2 に置かれている。モデルのライセンスは、公式モデルカードの記載で Apache License 2.0 だ。

このリポジトリにある主なファイルと、Hugging Face が返すファイルサイズは次のとおり (2026年9月24日時点)。

役割 ファイル 実サイズ
拡散モデル (標準版) wan_animate_2_int8_convrot.safetensors 16,653,175,528バイト (15.51GiB)
拡散モデル (distill版) wan_animate_2_distill_int8_convrot.safetensors 16,653,175,528バイト (15.51GiB)
拡散モデル (標準版・bf16) wan_animate_2_bf16.safetensors 32,789,894,104バイト (30.54GiB)
LoRA (標準版で使う) lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors 738,005,744バイト (0.69GiB)
テキストエンコーダ umt5_xxl_fp8_e4m3fn_scaled.safetensors 6,735,906,897バイト (6.27GiB)
CLIP Vision clip_vision_h.safetensors 1,264,219,396バイト (1.18GiB)
VAE Wan2_1_VAE_bf16.safetensors 253,806,278バイト (0.24GiB)

この記事で使ったのは int8_convrot の2種と LoRA・テキストエンコーダ・CLIP Vision・VAE で、bf16 の重みは測っていない。

ComfyUI が起動時に表示した VRAM の総量は、RTX 5080 が 16,303MB、RTX 5060 Ti が 16,311MB だった。表示の単位は MB だが 1024 基準の値で、GiB に直すとどちらも約15.9GiB になる。int8_convrot の拡散モデルは1ファイルで 15.51GiB あり、それだけでカードの容量に近い。LoRA やテキストエンコーダなどを足したファイルの合計は、VRAM の総量を上回る。

公式モデルカードには、リポジトリの既定設定は A800 を8枚使う前提で 720P の生成に合わせてあり、480P は A800 2枚で試したと書かれている。16GB のカード1枚は、公式リポジトリが想定する構成から大きく離れている。

公式テンプレートの既定値

ComfyUI の公式テンプレート「Wan Animate 2: Motion Transfer」の JSON を2026年9月24日に取得したときの既定値は次のとおり。

項目 既定値
拡散モデル int8_convrot 版
LoRA lightx2v
サンプラー lcm・6ステップ・cfg 1・shift 5
長さ 81フレーム
WanAnimate2Cache GPU に int8 で置く
駆動動画 482×854 に縮小してから使う

distill 版のテンプレート (video_wan_animate2_distilled.json) は LoRA を使わずに10ステップで回す設定で、キャッシュは標準版と同じく GPU に int8 で置く。

キャッシュの置き場は、ノードの説明が勧める安全側とテンプレートの既定値が異なる

WanAnimate2Cache ノードの説明 (ComfyUI 0.37.1 の comfy_extras/nodes_wan.py) は、キャッシュの置き場について次のように書いている。

cpu (RAM) is the safe choice, the cache will not fit in VRAM alongside the model at typical sizes. gpu (VRAM) can be faster if it fits.

CPU (RAM) に置くのが安全で、典型的なサイズではモデルと一緒に VRAM には収まらない、GPU は収まれば速くなりうる、という内容だ。同じ説明文は、キャッシュの代償を 480×832・81フレーム・bf16 でシステムRAM 約12.5GB (説明文の表記のまま) とし、解像度と長さに比例するとしている。int8 にするとキャッシュは半分になる。

一方、テンプレートの JSON では、このノードの値が次のようになっている。

"WanAnimate2Cache" ... ["gpu", "int8"]

ノードの説明は CPU を安全な選択としているのに、テンプレートの既定は GPU 置きになっている。16GB のカードでそれぞれの置き場にどれだけかかったかは、後の「キャッシュを GPU と CPU のどちらに置くか」の節で示す。

検証環境と測り方

項目 内容
GPU RTX 5080 16GB (画面出力にも使用・PCIe 5.0 x16) / RTX 5060 Ti 16GB (画面出力なし・OCuLink の PCIe 4.0 x4)
システムRAM 96GB
ComfyUI 0.37.1 を既存のインストールと分けた環境で起動
PyTorch 表ごとに記載。主な表は 2.14.0+cu130、CUDA 版の比較は 2.9.1 の cu128 版と cu130 版、720×1280 は 2.9.1+cu130
ワークフロー 公式テンプレートと同じ結線
入力素材 参照画像 pink_hair_mech_arms_ref.png・駆動動画 street_dance_drive.mp4 (テンプレートと同じ)
出力 480×848・81フレーム (720×1280 の節のみ 720×1280・81フレーム)
回し方 条件ごとに ComfyUI を起動し直し、2回目以降は seed だけ変えて3本
所要 ComfyUI の実行開始から終了まで (モデルの読み込みは1本目だけに入る)
ホストRAM ComfyUI のプロセスが使った量のピーク (GiB、ワーキングセット)
VRAM nvidia-smi の値 (MiB)。画面出力などほかの用途の分を含む

ComfyUI 0.37.1 は、2026年9月22日に公開されたバージョンだ。PyTorch は ComfyUI の README の手順どおり、cu130 の配布元 (download.pytorch.org/whl/cu130) から torch・torchvision・torchaudio を入れた。この環境で2026年9月25日にこの手順を実行したところ、torch 2.14.0・torchvision 0.29.0・torchaudio 2.11.0 の組み合わせになった。入る組み合わせは日が経つと変わる。この記事の主な表は、この組み合わせで測った。

測定は2026年9月、ComfyUI 0.37.1 で実施した。主な表は PyTorch 2.14.0+cu130、CUDA 版の比較は PyTorch 2.9.1 の cu128 版と cu130 版で測った。

GPU に置いた条件は各1本だけで、読み込みを含む。GPU 置きの複数本の振れは測っていない。

PyTorch の CUDA 版で所要が2倍前後変わる

PyTorch 本体を 2.9.1 にそろえ、cu128 版と cu130 版だけを入れ替えて測った。2枚のカード、標準版と distill 版、キャッシュなしと CPU 置きのどの組み合わせでも cu128 版のほうが長くかかり、比は 1.81倍から 2.25倍だった。テンプレート既定の GPU 置きは、後の節のとおり cu128 で差がさらに大きく開いたため、この比には入れていない。

GPU モデル キャッシュ cu128 cu130 cu128 ÷ cu130
RTX 5080 標準版 (int8_convrot + LoRA・6ステップ) キャッシュなし 347.9秒 154.6秒 2.25倍
RTX 5080 標準版 (int8_convrot + LoRA・6ステップ) CPU (RAM) に int8 で置く 219.2秒 105.5秒 2.08倍
RTX 5080 distill版 (10ステップ) キャッシュなし 502.5秒 247.8秒 2.03倍
RTX 5080 distill版 (10ステップ) CPU (RAM) に int8 で置く 328.2秒 155.7秒 2.11倍
RTX 5060 Ti 標準版 (int8_convrot + LoRA・6ステップ) キャッシュなし 679.0秒 362.7秒 1.87倍
RTX 5060 Ti 標準版 (int8_convrot + LoRA・6ステップ) CPU (RAM) に int8 で置く 454.6秒 239.4秒 1.90倍
RTX 5060 Ti distill版 (10ステップ) キャッシュなし 1058.5秒 586.4秒 1.81倍
RTX 5060 Ti distill版 (10ステップ) CPU (RAM) に int8 で置く 681.0秒 366.6秒 1.86倍

出力は 480×848・81フレーム。PyTorch の CUDA 版だけを変えた比較で、値は2回目以降の中央値 (各3本)。PyTorch と一緒に CUDA のライブラリも替わるため、差のすべてを1つの処理に帰すことはできない。

ComfyUI 側の仕組み

ComfyUI 0.37.1 の comfy/quant_ops.py は、PyTorch の CUDA 版が13未満だと comfy-kitchen の cuda バックエンドを無効にし、起動時に次の警告を出す。

WARNING: You need pytorch with cu130 or higher to use optimized CUDA operations.

テンプレート既定の int8_convrot の量子化処理には、comfy-kitchen の CUDA 実装が用意されている (起動ログの cuda バックエンドの機能一覧に、int8_convrot の重みの量子化・逆量子化の処理が並ぶ)。ComfyUI 0.37.1 の README も、NVIDIA の20シリーズ以降では cu130 以上の PyTorch が必要と書いている。cu128 版で所要が延びたのはこの仕組みと矛盾しない結果だが、上の注記のとおり、差がこの処理だけから来ているとまでは言えない。

画像生成モデルでも、PyTorch の CUDA 版の違いで量子化版の速さが入れ替わった例がある。詳しくはQwen-Image を VRAM 16GB で動かした実測を参照。

手元の CUDA 版の確かめ方

ComfyUI は起動時のログに、使っている PyTorch のバージョンを次の形で出す。

pytorch version: 2.14.0+cu130

末尾の cu に続く数字が CUDA 版だ。cu128 のときは、前述の警告も同じ起動ログに出る。ComfyUI 0.37.1 の起動ログで確かめた表示で、ワークフローを開く前に判別できる。

PyTorch 本体のバージョンでも差が出た

CUDA 版を cu130 にそろえたまま、PyTorch 本体を 2.9.1 から 2.14.0 に替えて RTX 5080 で測ると、どの条件でも 2.14.0 のほうが長くかかった。比は 1.11倍から 1.19倍で、CUDA 版の違いよりは小さい。

モデル キャッシュ torch 2.9.1+cu130 torch 2.14.0+cu130 2.14 ÷ 2.9.1
標準版 (int8_convrot + LoRA・6ステップ) キャッシュなし 154.6秒 172.0秒 1.11倍
標準版 (int8_convrot + LoRA・6ステップ) CPU (RAM) に int8 で置く 105.5秒 119.2秒 1.13倍
distill版 (10ステップ) キャッシュなし 247.8秒 281.0秒 1.13倍
distill版 (10ステップ) CPU (RAM) に int8 で置く 155.7秒 184.6秒 1.19倍

RTX 5080、出力は 480×848・81フレーム。CUDA 版は同じ cu130 で、PyTorch 本体のバージョンだけが違う。差の原因は切り分けていない。最初の表と CUDA 版比較の表の cu130 の値は、PyTorch 本体のバージョン (2.14.0 と 2.9.1) が違う別々の測定から取ったもので、同じ条件の値ではない。RTX 5060 Ti で2つの表の cu130 の値を並べると、2.14.0 のほうが 1.02倍から 1.04倍長く、RTX 5080 より差は小さかった (distill 版・キャッシュなしは揃わなかったため除く)。README の手順で2026年9月25日に入れたときは 2.14.0 のほうになった。この記事の条件では 2.9.1+cu130 のほうが短く、720×1280 も 2.9.1+cu130 でしか最後まで通っていない。ただし 2.9.1 を指定して入れるのは README の手順から外れる選び方で、2.14.0 で 720×1280 が進まなかった原因も切り分けていない。

キャッシュを GPU と CPU のどちらに置くか

WanAnimate2Cache について、ComfyUI の公式ブログは、ポーズ側の計算をサンプリングのステップ間で使い回し、システムメモリと引き換えに生成時間をおよそ半分にすると説明している。PyTorch 2.14.0+cu130 での1ステップの時間を、置き場ごとに並べると次のようになる。

GPU・モデル キャッシュなし CPU (RAM) に int8 で置く GPU (VRAM) に int8 で置く (テンプレート既定)
RTX 5080・標準版 27.4秒 16.2秒 17.1秒
RTX 5080・distill版 26.9秒 16.1秒 —
RTX 5060 Ti・標準版 59.3秒 34.5秒 34.1秒
RTX 5060 Ti・distill版 77.7秒 (3本が揃わなかった条件・比較に使わない) 34.0秒 —

値は1ステップの中央値で、最初の表から抜き出したもの。出力は 480×848・81フレーム。PyTorch 2.14.0+cu130 では GPU 置きは標準版だけを各1本測り、distill 版の GPU 置き (—) は測っていない。

CPU に置くと、キャッシュなしより1本・1ステップとも短くなった。ただし1本の所要で比べると、RTX 5080 の標準版が 172.0秒から 119.2秒、distill 版が 281.0秒から 184.6秒、RTX 5060 Ti の標準版が 370.8秒から 248.4秒で、比べられる3組のどれもおよそ半分までは縮んでいない。RTX 5060 Ti の distill 版は1ステップでの差がさらに大きく出たが、キャッシュなしの3本が揃わなかった条件のため、この比較からは外した。

その代わりにホストRAMが増える。キャッシュなしから CPU 置きにすると、ホストRAMのピークは RTX 5080 の標準版で 18.2GiB から 24.5GiB、RTX 5060 Ti の標準版で 17.4GiB から 23.6GiB に上がった。GPU 置きでもホストRAMのピークは 23.9GiB と 23.1GiB で、CPU 置きと近い値だった。

cu130 の環境では、テンプレート既定の GPU 置きと CPU 置きの差は小さかった。1ステップは RTX 5080 で 17.1秒と 16.2秒、RTX 5060 Ti で 34.1秒と 34.5秒で、VRAM のピークも 15,609MiB と 15,563MiB、14,922MiB と 14,926MiB と大きくは変わらない。GPU 置きの1本の所要 (138.2秒・268.2秒) はモデルの読み込みを含む1本だけの値で、2回目以降の中央値とは並べられない。集計に使った GPU 置きの回は、cu130・cu128 のどちらも、投入直前にほかの用途が使っていた VRAM が RTX 5080 で画面出力などの約1,170〜1,350MiB、RTX 5060 Ti で約110MiB の状態だった。ほかのアプリや別のプロセスが VRAM をもっと使っている状態は、条件をそろえては測っていない。手がかりは集計から外した回にある。別のプロセスが RTX 5080 に残っていた時間帯 (PyTorch 2.9.1+cu130・標準版) には、GPU 置きの1本 (投入直前の使用量 3,460MiB) が読み込み込みで 527.6秒かかり、同じ時間帯の CPU 置きの1本目 (読み込み込みで 126.1秒) の4倍を超えた。一方、投入直前に RTX 5060 Ti の使用量が 12,907MiB あった回 (PyTorch 2.14.0+cu130・標準版) では、CPU 置きでも1本目が 1298.0秒かかった (取り直した1本目は 275.8秒)。GPU 置きのほうが大きく崩れた回と、CPU 置きでも大きく遅れた回の両方があり、どちらも1本だけで、何が VRAM を使っていたかを含めて原因は切り分けていない。

VRAM の空きと所要の関係は、ComfyUI で使える VRAM を絞ったときの生成時間の実測で別の切り口から測っている。

cu128 では GPU 置きが極端に遅くなった

テンプレート既定のまま (キャッシュを GPU に int8 で置く)、PyTorch 2.9.1+cu128 で回した結果は次のとおり。

GPU モデル cu128 で GPU に置いた場合
RTX 5080 標準版 (int8_convrot + LoRA・6ステップ) 1295.0秒 (1本)
RTX 5060 Ti 標準版 (int8_convrot + LoRA・6ステップ) 1,500秒で打ち切り (完了せず)
RTX 5060 Ti distill版 (10ステップ) 1,500秒で打ち切り (完了せず)

出力は 480×848・81フレーム。各1本。打ち切りは運用上の判断で、その後に完了したかは確かめていない。

RTX 5080 の 1295.0秒は読み込みを含む1本だけの値で、2回目以降の中央値とは並べられない。同じ cu128 版で CPU に置いた標準版の1本目 (読み込み込みで 245.0秒) と比べても、5倍を超える。RTX 5060 Ti は標準版・distill 版とも、1,500秒の時点で終わっていなかったため打ち切った。cu130 版 (PyTorch 2.14.0 で測った最初の表) では GPU 置きが CPU 置きと大きく変わらなかったのに対し、cu128 版 (2.9.1) では置き場の違いがそのまま所要の大差になって表れた。PyTorch 本体を 2.9.1 にそろえた cu130 版でも、RTX 5080 の標準版で GPU 置きの1ステップは 13.9秒と、CPU 置きの 14.8秒に近かった。

標準版と distill 版

distill 版は、公式モデルカードでは10ステップ・CFG なしの設定とされている。ComfyUI のテンプレートでは、標準版が LoRA (lightx2v) を併用して6ステップ、distill 版が LoRA なしの10ステップという組み立てになっている。

PyTorch 2.14.0+cu130 の実測では、RTX 5060 Ti のキャッシュなし (distill 版の3本が揃わなかった条件) を除くと、1ステップの時間は標準版と distill 版でほぼ同じだった。RTX 5080 のキャッシュなしで標準版 27.4秒・distill 版 26.9秒、CPU 置きで 16.2秒・16.1秒、RTX 5060 Ti の CPU 置きで 34.5秒・34.0秒。そのため1本の所要はステップ数が多いぶんだけ distill 版が長くなり、CPU 置きでは RTX 5080 で標準版 119.2秒・distill 版 184.6秒、RTX 5060 Ti で 248.4秒・380.6秒だった。1本の所要の大半は、1ステップの時間とステップ数の積で説明がつく。

画質・動きの自然さ・キャラクターの似せ方は比べていない。標準版と distill 版の違いについてこの記事が示せるのは、所要とメモリの範囲に限られる。

720×1280 に上げると

出力を 720×1280・81フレームに上げ、RTX 5060 Ti で PyTorch 2.9.1+cu130 を使って測った。

PyTorch キャッシュ 1本 本数 ホストRAMのピーク VRAMのピーク (最大)
torch 2.9.1+cu130 CPU (RAM) に int8 で置く 1417.3秒 (約24分・2回目以降の中央値) 3本 42.7GiB 15,920MiB
torch 2.9.1+cu130 キャッシュなし 3424.2秒 (約57分・1本のみ・読み込み込み) 1本 26.4GiB 15,998MiB

RTX 5060 Ti、720×1280・81フレーム。表の値は PyTorch 2.9.1+cu130 で測ったもの。2.14.0+cu130 では、同じ条件の1本目が初期化の段階から16分を超えても最初のステップに入らず、打ち切った。1回だけの結果で、原因は切り分けていない。RTX 5080 の 720×1280 は、別のプロセスが VRAM を使っていた回しか取れておらず、この記事には載せていない。

RTX 5060 Ti では 720×1280 も生成まで通ったが、CPU に置いた条件でも1本に20分以上かかった。キャッシュなしは読み込みを含む1本だけで 3424.2秒かかり、CPU 置きの1本目 (読み込み込みで 1396.9秒) の2倍を超えた。480×848 のときより、キャッシュの有無による差が大きく開いた。ただしキャッシュなしは1本だけで、振れは測っていない。

ホストRAMのピークは、CPU 置きで 42.7GiB まで上がった。キャッシュなしとの差で見ると、PyTorch 2.9.1+cu130 の RTX 5060 Ti 標準版では、480×848 で約6GiB、720×1280 で約14GiB (どちらも1本目どうしで、17.1GiB から 23.1GiB、26.4GiB から 40.8GiB) に広がり、キャッシュの代償が解像度に応じて増えるというノードの説明と同じ方向の結果になった。長さは81フレームのまま変えていない。VRAM のピークは 15,920MiB と 15,998MiB で、どちらもカードの容量近くまで上がった。

2枚のカードの差

PyTorch 2.14.0+cu130 の表では、どの条件でも RTX 5060 Ti のほうが RTX 5080 より長くかかった。1本の所要で並べると、標準版・キャッシュなしで 370.8秒と 172.0秒、標準版・CPU 置きで 248.4秒と 119.2秒、distill 版・CPU 置きで 380.6秒と 184.6秒で、2倍前後の開きになる。

ただし2枚は接続が違う。RTX 5080 は PCIe 5.0 x16 で画面出力にも使っており、RTX 5060 Ti は画面出力なしで OCuLink の PCIe 4.0 x4 につないでいる。接続の違いが所要にどれだけ効いているかは切り分けていないため、この開きを GPU の性能差だけに帰すことはできない。VRAM のピークは、3本が揃わなかった RTX 5060 Ti の distill 版・キャッシュなし (16,013MiB) を除くと RTX 5080 のほうが高く出ているが、nvidia-smi の値は画面出力などほかの用途の分も含んでいる。

この記事が測っていないこと

次の項目は測っていない。本文の数値から推して書くこともしていない。

  • 画質・動きの自然さ・キャラクターの似せ方 (所要とメモリしか測っていない)
  • Wan Animate 2 Lite
  • context windows を使った長い動画
  • bf16 の重み (wan_animate_2_bf16.safetensors)
  • RTX 5080・RTX 5060 Ti 以外のカード (VRAM 容量の違うカードでの可否や所要)
  • マザーボードの PCIe スロットに直接挿した RTX 5060 Ti での所要 (この記事の RTX 5060 Ti は OCuLink の PCIe 4.0 x4 接続)
  • VRAM をこの記事の集計時より多く使っている状態での、条件をそろえた所要 (集計から外した回に、投入直前の VRAM 使用量が多い状態で GPU 置き・CPU 置きのどちらも大きく遅れた1本がある)
  • RTX 5080 での 720×1280
  • GPU 置きの複数本の振れ (各1本しか回していない)
  • PyTorch 2.14.0+cu130 での 720×1280 の所要 (1回、初期化の段階から16分を超えて進まず打ち切った)
  • PyTorch 2.9.1 と 2.14.0 の差の原因、RTX 5060 Ti の distill 版・キャッシュなしで3本の所要が揃わなかった原因

まとめ

RTX 5080 と RTX 5060 Ti の2枚、ComfyUI 0.37.1 で 480×848・81フレームを回した範囲では、この記事で直接比べた条件では、所要の差が大きかった順に PyTorch の CUDA 版、キャッシュの有無、PyTorch 本体のバージョンとなり、cu130 の環境では、VRAM をほかの用途が画面出力の分ほどしか使っていない状態で、キャッシュの置き場 (CPU か GPU か) の差がいちばん小さかった (GPU 置きは各1本)。ただし置き場による差の大きさは CUDA 版で変わり、cu128 の環境ではテンプレート既定の GPU 置きが所要を最も大きく延ばす設定になった。

設定を見直す順序も、この大きさの順に沿う。起動ログの pytorch version の行で CUDA 版を見て、cu130 で動いていることを確かめてから、キャッシュの有無と置き場を決める。PyTorch 2.14.0+cu130 でキャッシュを CPU に置いた条件では、480×848・81フレームの1本 (2回目以降の中央値) が RTX 5080 で 119.2秒 (標準版) と 184.6秒 (distill 版)、RTX 5060 Ti で 248.4秒と 380.6秒だった。720×1280 は、PyTorch 2.9.1+cu130 でキャッシュを CPU に置いた RTX 5060 Ti でも1本に20分以上かかり、ホストRAMのピークも 480×848 のときを大きく上回った。README の手順で入れた 2.14.0+cu130 では、同じ条件を1回試して、最初のステップに入る前に打ち切っている。

よくある質問

ホストRAM (システムRAM) はどれくらい使う?

システムRAM 96GB の環境で ComfyUI のプロセスが使った量のピークは、PyTorch 2.14.0+cu130・480×848・81フレームの条件ごとの中央値で 17.4GiB から 25.0GiB、キャッシュを CPU に置いた条件では 23.0GiB から 24.5GiB だった。1本ずつ見ると 28.4GiB まで上がった回がある。cu128 版の PyTorch でキャッシュを CPU に置いた条件では、中央値で 27.2GiB から 28.7GiB だった。720×1280 で CPU に置いた条件 (PyTorch 2.9.1+cu130) では 42.7GiB まで上がった。この値は実際に RAM 上にあった量 (ワーキングセット) で、プロセスが確保した量 (コミット) はさらに大きい。PyTorch 2.14.0+cu130・480×848 の条件ごとの中央値で、キャッシュなしが 33.0GiB から 33.9GiB、CPU 置きが 40.4GiB から 41.2GiB、720×1280 の CPU 置き (PyTorch 2.9.1+cu130) では 60.7GiB だった。どちらも OS やほかのアプリの分は含まない。キャッシュなしは、3本の所要が揃わなかった RTX 5060 Ti の distill 版 (ワーキングセットの中央値 25.0GiB、1本ずつで最大 28.4GiB。上に挙げた範囲の上限もこの条件の値) を除けば、どちらの量も CPU 置きより少なく、そのぶん所要は延びる。96GB より少ない RAM の環境で同じように動くかは測っていない。

手元の PyTorch の CUDA 版はどう確かめる?

ComfyUI を起動したときのログにある pytorch version の行を見る。末尾が cu130 なら ComfyUI 0.37.1 の README が NVIDIA の20シリーズ以降に求める条件を満たしており、cu128 なら「WARNING: You need pytorch with cu130 or higher」で始まる警告も同じログに出る。cu130 版の PyTorch は CUDA 13 に対応した NVIDIA ドライバを前提にしている (README も、ポータブル版の説明で、起動しないときはドライバを更新するよう書いている)。以下の pip は手動で入れた ComfyUI の Python 環境 (venv など) のものだ。README によると、いま配布されている NVIDIA 20シリーズ以降向けのポータブル版は CUDA 13.0 の PyTorch を同梱している。以前に入れたポータブル版は、同梱のバージョンを起動ログの pytorch version で確かめる。入れ替えるときは、いま入っている torch・torchvision・torchaudio を pip uninstall で外してから、README の手順どおり cu130 の配布元から3つをまとめて入れ直す。すでに入っている環境に pip install を重ねるだけでは、入っているバージョンがそのまま残る。入れ直したら、起動ログの pytorch version が cu130 になったかを確かめる。2026年9月25日にこの手順で入れたときは torch 2.14.0 になり、480×848 では RTX 5080 で 2.9.1+cu130 の 1.11倍から 1.19倍の所要になった。720×1280 は 2.14.0+cu130 で1回試し、最初のステップに入る前に打ち切っている (原因は切り分けていない)。

キャッシュはテンプレート既定の GPU 置きのままでよい?

cu130 の環境なら、この記事の条件 (480×848・81フレーム、int8_convrot の標準版) では、GPU 置きの1ステップの時間は CPU 置きとほぼ同じだった。これは VRAM をほかの用途が画面出力の分ほどしか使っていない状態の結果で、VRAM をほかの用途が画面出力の分より多く使っている状態は、条件をそろえて測っていない。集計から外した回には、投入直前の使用量が 3,460MiB だった RTX 5080 で GPU 置きが同じ時間帯の CPU 置きより大きく遅れた1本と、12,907MiB だった RTX 5060 Ti で CPU 置きでも大きく遅れた1本がある (何が VRAM を使っていたかは確かめていない。本文参照)。ただし GPU 置きは各1本しか測っておらず、振れはわからない。cu128 の環境では GPU 置きで RTX 5080 が読み込みを含む1本で 1295.0秒かかり、RTX 5060 Ti は 1,500秒で打ち切った。ノードの説明は CPU (RAM) を安全な選択としている。CUDA 版を確かめる前であれば、CPU 置きにしておくと、この記事で極端に遅くなった組み合わせ (cu128 と GPU 置き) には当たらない。

参考資料

タイトルとURLをコピーしました