VRAM 16GB

AI動画生成

Wan Animate 2をVRAM 16GBで動かす|PyTorchのバージョンとキャッシュの置き場で所要が変わる実測

Wan Animate 2 を VRAM 16GB の RTX 5080・5060 Ti で動かした実測。480×848・81フレームはどの設定でも生成でき、所要を最も大きく変えたのは PyTorch の CUDA 版だった。キャッシュの置き場ごとの所要とホストRAMもまとめた。
AI画像生成

Qwen-Image-2.1をVRAM 16GBで動かす|30GiBのbf16も動く、量子化版はPyTorch cu130なら速い実測

Qwen-Image-2.1 のファイル一式は組み合わせで13.27〜30.21GiB。合計30.21GiB の bf16 同士も16GBのカードで生成できた。PyTorch cu130 版では量子化版が bf16 同士より1.7〜2.3倍速く、cu128 版では逆に遅かった理由もまとめた。
GPU・グラフィックボード

Bonsai 2 27BはVRAM 16GBで動くか|公称5.9GBの中身と、専用ビルドが要る理由を実測

PrismML が公開した Bonsai 2 27B を RTX 5080 16GB 単体で実測。標準の llama.cpp では読み込めず専用ビルドが要ること、配布される PTQ1_0 と PQ2_0 でプロンプト処理と生成の差の出方が変わること、公称5.9GBがどのファイルの値かを整理した。
AI画像生成

Anima 3.8BをVRAM 16GBで動かす|52ブロックへの拡張で増えた分と、一式15GBが収まる理由を実測

Anima 3.8B を VRAM 16GB の RTX 5080・5060 Ti で実測した。ファイル合計 15.03GB でもピークは 12,918MiB に収まる。52 ブロックへの拡張で生成時間・VRAM・RAM がどれだけ増えるか、導入に要る 4 ファイルとノードもまとめた。
ローカルLLM

指定できる文脈長と使える文脈長は違う|Qwen3.8-27B を VRAM 16GB で実測

Qwen3.8-27B を VRAM 16GB 1枚で動かし、指定した文脈長が実際に使えるかを実測した。測った枠のうち 196,608 までは読み込みも生成も落ちず、262,144 だけが読み込みの途中で打ち切りになった。境目は専用VRAMの値には出ず、共有GPUメモリ側の増加として現れる。
AI動画生成

MiniMax H3の条件付けを使い回すと速くなるか|VRAM 16GB実測、縮むのはプロセスを立て直したときだけ

MiniMax H3の条件付けをディスクに保存して使い回すと所要時間がどう変わるかを、RTX 5080とRTX 5060 Tiで実測。同じカードで作った条件付けなら出力は1フレームも変わらないが、別のカードのものを読ませると全フレームが変わった。
AI画像生成

Krea 2 Turboの4ステップ蒸留LoRAをVRAM 16GBで実測|RTX 5080・5060 Tiで1.5〜1.8倍速くなる

Krea 2 Turboの4ステップ蒸留LoRAをVRAM 16GBで実測。公式推奨の8ステップより、RTX 5080で1.51倍、RTX 5060 Tiで1.84倍速い。PyTorch cu130版では1.79倍・1.95倍に伸び、LoRAによる遅れもほぼ出なかった。
ローカルLLM

Qwen3.8-27BのMTPは16GBで速くなるか|有効化で増えるVRAMと、速くならない条件を実測

Qwen3.8-27BのMTP(マルチトークン予測)を16GBのGPU1枚で実測。有効化でのGPU使用量の増分と速度変化は対応したが、開始時の空きと実配置も同時に違うため、増分が原因とは判定できない。KVキャッシュの型を落とすと結果が変わる例も測った。
ローカルLLM

「Qwen3.8-4B」は使えるか|土台のQwen3.5-4Bと同条件でRTX 5080/5060 Ti実測

「Qwen3.8-4B」は公式のQwen3.8ではなくQwen3.5-4Bを土台にした第三者蒸留。RTX 5080と5060 Tiで土台と同条件比較すると、生成速度も必要VRAMもほぼ同じで、短答では思考トークンが中央値で約10分の1から30分の1だった。
ローカルLLM

Qwen3.8-27BをVRAM 16GBで実測|量子化3種の必要VRAMと起動オプションの差

Qwen3.8-27B の必要VRAMを、重み・KVキャッシュ・線形アテンション状態・計算バッファの内訳まで実測。量子化3種を16GBで動かし、起動オプションひとつで必要量が449MiB動くこと、載ったかどうかは生成速度と消費電力の組でしか判別できなかったことを RTX 5060 Ti・5080 で確かめた。