ローカルLLM

LLMを手元のPCで動かすためのモデル選び、必要メモリ、速度の目安をまとめます。

複数のGPU・量子化条件による実測から、動く構成と実用速度を確認できます。

PC構成

Threadripper Halo Stationの2.6TBは1つのメモリではない|576GB HBM3eと2TB RDIMMを分けて読む

HBM3e最大576GB(144GB×4枚)とRDIMM最大2TBで合計2.6TB。帯域は16TB/sと410GB/sに分かれ、HBMに収まらない分の扱いは未公表。AMDがIFA 2026で公開したプロトタイプの公称値を、VRAM 16GBの手元から読む。
GPU・グラフィックボード

VRAM 12GBの壁はどこにあるか|context・動画フレーム数・あふれた後の分かれ目を実測

VRAM 12GB のGPUでローカルLLMと動画生成をどこまで回せるかを実測。収まるのは14Bクラスまでで、収まらなくなった後の速度はdenseとMoEで約8〜14倍割れる。コンテキストの上限はKVキャッシュの量子化でほぼ倍ずつ伸び、動画はフレーム数を168まで伸ばした条件で失敗した。
GPU・グラフィックボード

VRAM 32GBで何が変わるか|16GBであふれる27〜35B級をカード2枚で全部載せて実測

27〜35B級の5モデルをQ4_K_M・コンテキスト8192で測ると、RTX 5080 16GBには収まらなかった。16GBのカード2枚で32GB分にして全部載せたときの速度と必要だった容量を実測し、単体32GBはRTX 5090の公称値だけを整理する。
GPU・グラフィックボード

VRAMに収まらないMoEモデルのデコードが約2倍になった|FreeTokenとOllamaをRTX 5080で実測比較

VRAM 16GBに収まらない35B級のMoEモデルを、推論エンジンをFreeTokenに替えて実測した。デコードは約2倍になる一方で最初のトークンまでは遅く、約44〜50トークンで総時間が逆転する。RTX 5080での実測値と導入の条件をまとめた。
ローカルLLM

「Qwen3.8-4B」は使えるか|土台のQwen3.5-4Bと同条件でRTX 5080/5060 Ti実測

「Qwen3.8-4B」は公式のQwen3.8ではなくQwen3.5-4Bを土台にした第三者蒸留。RTX 5080と5060 Tiで土台と同条件比較すると、生成速度も必要VRAMもほぼ同じで、短答では思考トークンが中央値で約10分の1から30分の1だった。
ローカルLLM

Qwen3.8-27BをVRAM 16GBで実測|量子化3種の必要VRAMと起動オプションの差

Qwen3.8-27B の必要VRAMを、重み・KVキャッシュ・線形アテンション状態・計算バッファの内訳まで実測。量子化3種を16GBで動かし、起動オプションひとつで必要量が449MiB動くこと、載ったかどうかは生成速度と消費電力の組でしか判別できなかったことを RTX 5060 Ti・5080 で確かめた。
GPU・グラフィックボード

ローカルLLMを2枚のGPUのVRAMプールで動かす|OCuLink接続の帯域ボトルネックを見極める

1枚に載らないローカルLLMを2枚のGPUで動かすとき、OCuLink接続では分割方式で速度が変わる。RTX 5080+5060 Ti(OCuLink)の実測では、単一生成でテンソル並列がレイヤー分割より速い場面があり、プロンプト処理では逆に遅かった。実機ベンチをもとに分割方式の選び方を解説する。
GPU・グラフィックボード

Nemotron 3 EmbedをVRAM 16GBで動かす|RTX 5080実測の必要VRAM・速度・NVFP4

Nemotron 3 EmbedをRTX 5080(16GB)で実測。1B-BF16はロード約2.2GBで快適、8B-BF16単体は約15.7GB使用で大量処理には不向き。5080+5060 Tiのデュアルで短文は現実的、NVFP4は約1GBでロード可だが推論は不安定。
GPU・グラフィックボード

ローカルVLMでPDF・画像をJSON化|オープンウェイトモデル/OSSツールの選び方と必要VRAM

ローカルVLMでPDF・画像をJSON化する方法を実行経路ごとに整理。Datalab lift等のオープンウェイトモデルとMarker/Docling等のOSSツールの選び方、4bit量子化で16GB GPUに収まるかを、公式lift-pdf経路とコミュニティGGUF経路を分けて解説します。
GPU・グラフィックボード

Ornith-1.0をローカルで動かすには?9B〜397Bの必要VRAMとGPU選び【Dense/MoE別】

Ornith-1.0(DeepReinforce製、MITライセンス)を手元のGPUで動かす方法を解説。9B/31B Dense・35B/397B MoEのサイズ別メモリ目安を整理し、9B/35Bは当サイトのRTX 5080環境で実測。GPU選びとOllama起動手順も紹介します。