RTX 5080

PC構成

Muse Glimmer 30BをVRAM 16GBで動かす|全52層が載る条件とDFlashの効き方をRTX 5080・5060 Tiで実測

Meta の Muse Glimmer 30B を VRAM 16GB クラスで実測。公式想定は24GBだが、表示に使っていない16GB 1枚では全層を載せる指定で毎秒24.61トークン。層数・総コンテキスト指定・DFlash の効き方を llama.cpp b10356 で測った記録。
ベンチマーク

MiniMax H3 Turbo LoRAは何倍速い?|ComfyUIで4〜8ステップ・RTX 5080/5060 Ti実測

MiniMax H3のTurbo LoRAをVRAM 16GBで実測。配布元の約5倍はサンプリング部分の話で、総時間では1.47倍〜4.18倍と条件で動く。同じステップ数ではLoRAありが遅く、上乗せは設定が重いほど薄まる。RTX 5080と5060 Tiの差、画質が分かれる4ステップ、ライセンス条件まで。
ComfyUI

MiniMax H3をVRAM 16GBで動かす|ComfyUIでの導入手順とRTX 5080・5060 Ti実測

MiniMax H3をVRAM 16GBのRTX 5080・5060 Tiで実測。864×480・2.33秒が約66秒、1344×768の8秒動画は約21分30秒。ComfyUIでの導入手順とノード構成、FP8とINT8の速度差、システムRAMが約44GiB必要になる点までまとめた。
GPU・グラフィックボード

MTP(マルチトークン予測)でローカルLLMは本当に速くなるか|RTX 5080実測、非MoEで1.69倍・MoEは1.0〜1.4倍と構成次第

MTP(マルチトークン予測)でローカルLLMが何倍速くなるかをRTX 5080で実測。非MoEのgemma-4-12bは1.69倍、MoEは1.0〜1.4倍と量子化・GPU構成で振れる。効きを分けるのは1順伝播あたりのボトルネック(帯域/GPU間の受け渡し待ち)をMTPが薄められるか。llama.cppの実測で解説。
GPU・グラフィックボード

AIコーディング用ローカルLLMの必要スペック|RTX 5080実機で7B〜14B級のVRAMと速度を実測

AI支援コーディング向けPCはクラウドAPI型とローカルLLM型で要件が分かれます。Claude Code等はGPU不要でCPU・RAM・SSDが効き、ローカル併用はVRAM容量が律速。RTX 5080 16GB実機で7B〜14B級を実測し、用途・予算別の実用スペックを整理しました。
GPU・グラフィックボード

RTX 5080 16GB VRAMの壁に関するよくある疑問7選|27B・32Bは起動するが6〜10 tok/sまで落ちる

RTX 5080 16GBでQwen3.5 27B・Gemma 4 31B・Qwen3 32Bを実測。既定タグでは全レイヤーが載らずCPU側へ回り6.2〜10.3 tok/sまで低下する一方、14Bクラスは75〜77 tok/s。MoEのGemma 4 26B A4Bは58.6 tok/sを維持した。
ローカルAI環境

RTX 5080で最初に入れる7-8BローカルLLMはどれか

7-8BローカルLLMとは、パラメータ数70億〜80億級の中型言語モデルのこと。 phi4-miniやllama3.2:3bでOllamaの動作確認は済んだ。次は少し大きい7-8Bクラスを試したい。ただ、Ollamaライブラリで「7B」「8...
GPU・グラフィックボード

VRAM 16GB:RTX 5080 VRAM不足でLLMが起動しないエラーの解決法|原因と対処法を徹底解説

RTX 5080(VRAM 16GB)でモデルが載らない・極端に遅いときの切り分け方。Ollamaの配置は100% GPU/100% CPU/CPU・GPU混在/ロード失敗の4つに分かれ、ollama psとsize_vramで判定できる。gemma4:26bは27%、qwen3.5:35b-a3bは42%がCPU側に置かれた実測とあわせて、対処の優先順位を整理した。