VRAM 16GB

PC構成

Muse Glimmer 30BをVRAM 16GBで動かす|全52層が載る条件とDFlashの効き方をRTX 5080・5060 Tiで実測

Meta の Muse Glimmer 30B を VRAM 16GB クラスで実測。公式想定は24GBだが、表示に使っていない16GB 1枚では全層を載せる指定で毎秒24.61トークン。層数・総コンテキスト指定・DFlash の効き方を llama.cpp b10356 で測った記録。
ベンチマーク

MiniMax H3 Turbo LoRAは何倍速い?|ComfyUIで4〜8ステップ・RTX 5080/5060 Ti実測

MiniMax H3のTurbo LoRAをVRAM 16GBで実測。配布元の約5倍はサンプリング部分の話で、総時間では1.47倍〜4.18倍と条件で動く。同じステップ数ではLoRAありが遅く、上乗せは設定が重いほど薄まる。RTX 5080と5060 Tiの差、画質が分かれる4ステップ、ライセンス条件まで。
ComfyUI

MiniMax H3をVRAM 16GBで動かす|ComfyUIでの導入手順とRTX 5080・5060 Ti実測

MiniMax H3をVRAM 16GBのRTX 5080・5060 Tiで実測。864×480・2.33秒が約66秒、1344×768の8秒動画は約21分30秒。ComfyUIでの導入手順とノード構成、FP8とINT8の速度差、システムRAMが約44GiB必要になる点までまとめた。
ComfyUI

Ideogram 4.0をローカルで動かす要件とライセンス|9.3BオープンウェイトをComfyUIで実行する

Ideogram 4.0は9.3Bのオープンウェイト画像モデル。FP8構成は合計約30GB前後で、VRAM 16GBでも動く範囲にある。ただし重みは非商用ライセンスで、収益化サイトへの生成画像の利用は別途許諾が要る。ローカル実行の構成とライセンスの線引きを配布元の条文に沿って整理する。
GPU・グラフィックボード

VRAM 16GBで動かすローカルLLM完全ガイド|モデル別の早見表と「収まる・あふれる」の境界を実測で解説

VRAM 16GBのGPUで動くローカルLLMを、モデル別の早見表で整理。量子化を前提にすれば7B〜14B級は快適、32B級は条件次第、70B級は16GB単体では厳しい。RTX 5080実機の実測値をもとに、収まる・あふれる・動かないの境界を解説します。
GPU・グラフィックボード

VRAM 16GB:RTX 5080 VRAM不足でLLMが起動しないエラーの解決法|原因と対処法を徹底解説

RTX 5080(VRAM 16GB)でモデルが載らない・極端に遅いときの切り分け方。Ollamaの配置は100% GPU/100% CPU/CPU・GPU混在/ロード失敗の4つに分かれ、ollama psとsize_vramで判定できる。gemma4:26bは27%、qwen3.5:35b-a3bは42%がCPU側に置かれた実測とあわせて、対処の優先順位を整理した。