AI動画生成

MiniMax H3の条件付けを使い回すと速くなるか|VRAM 16GB実測、縮むのはプロセスを立て直したときだけ

MiniMax H3の条件付けをディスクに保存して使い回すと所要時間がどう変わるかを、RTX 5080とRTX 5060 Tiで実測。同じカードで作った条件付けなら出力は1フレームも変わらないが、別のカードのものを読ませると全フレームが変わった。
ComfyUI

ComfyUIで使うGPUを指定する|v0.34以降のWindowsは既定で1枚しか使わない

ComfyUIはv0.34以降のWindowsで、GPUを指定しないと1枚しか見えない。警告も出ない。見えている枚数の数え方、2枚とも見せる3通りの書き方、見せても1本の生成は速くならないこと、ComfyUIを2つ起動して枚数を配ったときの実測をまとめた。
AI画像生成

Krea 2 Turboの4ステップ蒸留LoRAをVRAM 16GBで実測|RTX 5080・5060 Tiで1.5〜1.8倍速くなる

Krea 2 Turboの4ステップ蒸留LoRAをVRAM 16GBで実測。公式推奨の8ステップより、RTX 5080で1.51倍、RTX 5060 Tiで1.84倍速い。PyTorch cu130版では1.79倍・1.95倍に伸び、LoRAによる遅れもほぼ出なかった。
ローカルLLM

Qwen3.8-27BのMTPは16GBで速くなるか|有効化で増えるVRAMと、速くならない条件を実測

Qwen3.8-27BのMTP(マルチトークン予測)を16GBのGPU1枚で実測。有効化でのGPU使用量の増分と速度変化は対応したが、開始時の空きと実配置も同時に違うため、増分が原因とは判定できない。KVキャッシュの型を落とすと結果が変わる例も測った。
ローカルAI環境

AIは民主化するのか|モデルが無料になっても、計算資源は無料にならない

オープンウェイトモデルの性能が上がっても、AIが誰にでも開かれるとは限りません。753B級のGLM-5.2はUnsloth配布のUD-IQ1_Sでも約217GBあり、家庭向けGPUのVRAMとは桁が違います。広がるのは性能の差ではなく、選べる手段の差です。実測をもとに整理します。
ComfyUI

ComfyUIで使えるVRAMを絞ると画像・動画生成は遅くなるか|ピークは測った全74組で下がるが、時間が増えたと言えたのは判定できた6構成のうち1つだけ

ComfyUI の --reserve-vram を 1.5GB→12GB に増やし、画像・動画7構成を RTX 5080 16GB で実測。ピークは全74組で下がったが、生成時間の増加を検出できたのは判定できた6構成のうち1つだけ。
GPU・グラフィックボード

OpenCode 推奨スペック|公式のターミナル版前提に数値要件はなく、VRAMが要るのはローカルモデルをGPUで動かすとき

OpenCodeに必要なスペックは構成で二分される。外部プロバイダを挿すならGPUは要らず、ローカルモデルをGPUで動かす場合だけVRAMが論点になる。必要な長さは公式間で16k〜32kと64k以上に割れており、RTX 5060 Ti 16GBでモデル別に実測した。
GPU・グラフィックボード

複数GPUが認識されても使われない時の切り分け|Windows+OCuLinkで2枚目が使われる条件

nvidia-smiには2枚映るのに、推論中は片方の使用率もVRAM占有も0%のまま。故障でも設定ミスでもなく「分割する必要がないだけ」のことがあります。OS・ドライバ層/ランタイムの候補選定層/モデル配置層の3段で切り分ける手順と、RTX 5080+RTX 5060 Ti(OCuLink)でどのサイズから2枚に分かれたかのGPU別実測内訳。
ComfyUI

ComfyUIの起動オプション実測ガイド|dynamic VRAM時代のVRAM設定

ComfyUIの起動オプションは、dynamic VRAMが既定で有効な現行のNVIDIA環境では無指定が出発点になる。OOMが出たときに試す順序と、--reserve-vramを段階的に変えて測った専用VRAMの変化を、公式の定義と当サイトの実測に分けてまとめた。
GPU・グラフィックボード

VRAMに収まらないMoEモデルのデコードが約2倍になった|FreeTokenとOllamaをRTX 5080で実測比較

VRAM 16GBに収まらない35B級のMoEモデルを、推論エンジンをFreeTokenに替えて実測した。デコードは約2倍になる一方で最初のトークンまでは遅く、約44〜50トークンで総時間が逆転する。RTX 5080での実測値と導入の条件をまとめた。