ローカルAI環境

GPU・グラフィックボード

ローカルLLM常駐時のVRAM配分|他のAI作業と同時に回すと重みとKVキャッシュで詰まる

ローカルLLMのVRAM配分とは、重み・KVキャッシュ・一時確保の3枠に容量を割り振る設計。それなのに、常駐させたまま画像生成を回した瞬間に生成が始まらなくなる。この症状の原因は「VRAMが足りない」ではなく「配分を決めていない」ことにあります。
PC構成

GPUなしでローカルLLMは実用になるか|CPUのみ推論をi7実機で検証

GPUを使わずCPUだけでローカルLLMを動かし、1B〜35Bの生成速度・プロンプト処理時間・Ollama報告サイズをCore i7-14700F実機で実測。3〜8B級は実用域、27Bは2.97トークン/秒、MoEの35Bは14Bより速く、連続負荷では1〜2割落ちた。
GPU・グラフィックボード

Nemotron-3-Puzzle 75B-A9Bは手元のGPUで動かせるか

Nemotron-3-Puzzle 75B-A9Bとは、NVIDIAが圧縮したハイブリッドMoEの大規模言語モデル。「アクティブが9.3Bなら、手元の16GB GPUでも動くのでは」——そう考えて検索した人ほど、答えは期待とずれます。結論を先に置くと、このモデルを手元で気軽に動かすのは現時点で難しいです。
GPU・グラフィックボード

量子化で27B級LLMはVRAM 16GBに載るか|1bit・Ternary圧縮の実力と精度の代償

27B級LLMは1bit・Ternary(三値)の極低ビット量子化なら、重みを約3.8〜7.2GBまで圧縮してVRAM 16GBに載せられます。ただし精度はFP16比で約9割前後に低下し、長文ではKVキャッシュ量が可否を左右するため、理想サイズと実行時ピークメモリの区別が要点になります。
GPU・グラフィックボード

Radeon RX 7900 XTX 24GBでローカルAIは実用になるか|新品で買える24GBとCUDA非対応の現実(ROCm・ZLUDA)

Radeon RX 7900 XTX 24GBでローカルAIは実用になるか。新品で買える24GBの強みと、CUDA非対応の手間を正直に整理。ROCm 7.2系でOllama・ComfyUIは動くがWindowsは経路が分かれ、NVIDIAの手軽さには届かない。同じ24GBの中古RTX 3090とも比較。
GPU・グラフィックボード

Nemotron 3 EmbedをVRAM 16GBで動かす|RTX 5080実測の必要VRAM・速度・NVFP4

Nemotron 3 EmbedをRTX 5080(16GB)で実測。1B-BF16はロード約2.2GBで快適、8B-BF16単体は約15.7GB使用で大量処理には不向き。5080+5060 Tiのデュアルで短文は現実的、NVFP4は約1GBでロード可だが推論は不安定。
GPU・グラフィックボード

ローカルVLMでPDF・画像をJSON化|オープンウェイトモデル/OSSツールの選び方と必要VRAM

ローカルVLMでPDF・画像をJSON化する方法を実行経路ごとに整理。Datalab lift等のオープンウェイトモデルとMarker/Docling等のOSSツールの選び方、4bit量子化で16GB GPUに収まるかを、公式lift-pdf経路とコミュニティGGUF経路を分けて解説します。
GPU・グラフィックボード

AI用途にGPUは2枚必要か|RTX 5080 + 5060 Ti + OCuLink外付けで2枚目の効果を実測

AI用途の2枚目GPUとは、速度でなくVRAM容量と同時実行を増やす手段である。基礎知識から接続構成、推論エンジンごとの帯域の効き方、そして実測データまで、AI用途でGPUを2枚にすべきか迷っている人が自分の用途で判断できるところまで一本で扱います。
GPU・グラフィックボード

手元のGPUでローカルLLMをファインチューニングできるか

VRAM 16GBのGPUでローカルLLMをファインチューニングできるか。フル微調整・LoRA・QLoRAの必要VRAMの違いから、16GBで狙えるモデルサイズ・学習時間・Unslothの使いどころまで整理します。
GPU・グラフィックボード

ローカルLLMで長文を扱うとVRAMはどれだけ増えるか|16GBでKVキャッシュ膨張を実測し、あふれない設定を探る

KVキャッシュとは、LLMが処理済みトークンの中間状態を保持する作業メモリである。対応するマザーボードやGPUがあれば、ローカルAI環境は数分で立ち上がるところまで来ました。導入のハードルが下がった一方で、長い仕様書やソースコードを丸ごと貼り付けた瞬間に「VRAMが足りません」と落ちる。