ローカルAI環境

GPU・グラフィックボード

OpenCode 推奨スペック|公式のターミナル版前提に数値要件はなく、VRAMが要るのはローカルモデルをGPUで動かすとき

OpenCodeに必要なスペックは構成で二分される。外部プロバイダを挿すならGPUは要らず、ローカルモデルをGPUで動かす場合だけVRAMが論点になる。必要な長さは公式間で16k〜32kと64k以上に割れており、RTX 5060 Ti 16GBでモデル別に実測した。
GPU・グラフィックボード

複数GPUが認識されても使われない時の切り分け|Windows+OCuLinkで2枚目が使われる条件

nvidia-smiには2枚映るのに、推論中は片方の使用率もVRAM占有も0%のまま。故障でも設定ミスでもなく「分割する必要がないだけ」のことがあります。OS・ドライバ層/ランタイムの候補選定層/モデル配置層の3段で切り分ける手順と、RTX 5080+RTX 5060 Ti(OCuLink)でどのサイズから2枚に分かれたかのGPU別実測内訳。
ComfyUI

ComfyUIの起動オプション実測ガイド|dynamic VRAM時代のVRAM設定

ComfyUIの起動オプションは、dynamic VRAMが既定で有効な現行のNVIDIA環境では無指定が出発点になる。OOMが出たときに試す順序と、--reserve-vramを段階的に変えて測った専用VRAMの変化を、公式の定義と当サイトの実測に分けてまとめた。
GPU・グラフィックボード

NVIDIA DGX Sparkは買いか|16GB GPUを実測し公開ベンチと突き合わせて見えた、128GBが効く条件

DGX Spark(GB10)とRTX 5080/5060 Tiを同一のllama-bench条件で実測。VRAMに収まる範囲と収まらない範囲で優劣がどう変わるか、dense/MoEで結論が分かれる理由を実測値で示す。
AI音楽・音声

MiniMax Music 3をVRAM 16GBで動かす|RTX 5080実測、ピークVRAMは必要量ではない

MiniMax Music 3をRTX 5080 16GBのComfyUI構成で実測。4条件はいずれも60秒指定の生成を完走したが、観測されたピークVRAMは必要量ではない。使えるVRAMを削る掃引、1曲の所要時間の内訳、日本語ボーカルの歌詞追従までを測定値で示す。
GPU・グラフィックボード

GPUがSSDを直接読む仕組み|cuFileオープンソース化とローカルAIでモデルロードが速くなる条件

cuFileとは、GPUがストレージを直接読み書きするAPIである。「GPUがSSDを直接読む」と聞けば、ローカルLLMの起動が速くなるのでは、と期待したくなるところ。この記事の要点 cuFileはCPUのシステムメモリを介さずGPUメモリとストレージを直結させるAPI。
AI動画生成

MiniMax H3 Turbo LoRA(step600 EMA)とは|ComfyUIの置き場所・推奨ステップ数と速さをRTX 5080/5060 Tiで実測

MiniMax H3のTurbo LoRA(ComfyUI変換版 v4 step600 EMA)の置き場所と推奨ステップ数を整理し、RTX 5080・5060 Tiで総時間と画質を実測。配布元の約5倍はサンプリング部分の話で、RTX 5080の総時間では条件しだいで1.47〜4.18倍。ライセンスの地域制限も確認する。
AI動画生成

MiniMax H3をVRAM 16GBで動かす|ComfyUIでの導入手順とRTX 5080・5060 Ti実測

MiniMax H3をVRAM 16GBのRTX 5080・5060 Tiで実測。864×480・2.33秒が約66秒、1344×768の8秒動画は約21分30秒(0.37.1では約20分)。ComfyUIでの導入手順とノード構成、PyTorchの版で逆転するFP8とINT8の速度差、ComfyUIプロセスのメモリが0.31.1で約44GiB、0.37.1で約13〜24GiB(解像度と長さによる)だった点までまとめた。
GPU・グラフィックボード

GPUのコア数はAI性能にどこまで効くか|演算精度とメモリ帯域で変わる速度の出方

CUDAコア数が多いGPUほどAIが速いとは限りません。RTX 5080がRTX 4090に迫った実測を起点に、コア数・演算精度・メモリ帯域のどれがどのフェーズの速度を決めるのかを公式仕様と自前計測で切り分けます。VRAM容量は速度の目盛りではなく、載るか否かのゲートとして扱います。
AI音楽・音声

ローカルLLM常駐中にWhisperで文字起こしを回すと何が詰まるか|VRAMは足りてもGPU計算の取り合いで遅くなる

ローカルLLMを常駐させたままWhisperで文字起こしを同時に回すと、VRAMは足りてもGPU計算の取り合いで両方が遅くなる仕組みを、RTX 5080の単体実測とGPUの時分割から整理。画像生成との詰まり方の違い、KVキャッシュ、turboとint8、GPU分離、確認の手順まで解説する。