ローカルLLM

GPU・グラフィックボード

ローカルLLMを2枚のGPUのVRAMプールで動かす|OCuLink接続の帯域ボトルネックを見極める

1枚に載らないローカルLLMを2枚のGPUで動かすとき、OCuLink接続では分割方式で速度が変わる。RTX 5080+5060 Ti(OCuLink)の実測では、単一生成でテンソル並列がレイヤー分割より速い場面があり、プロンプト処理では逆に遅かった。実機ベンチをもとに分割方式の選び方を解説する。
GPU・グラフィックボード

Nemotron 3 EmbedをVRAM 16GBで動かす|RTX 5080実測の必要VRAM・速度・NVFP4

Nemotron 3 EmbedをRTX 5080(16GB)で実測。1B-BF16はロード約2.2GBで快適、8B-BF16単体は約15.7GB使用で大量処理には不向き。5080+5060 Tiのデュアルで短文は現実的、NVFP4は約1GBでロード可だが推論は不安定。
GPU・グラフィックボード

ローカルVLMでPDF・画像をJSON化|オープンウェイトモデル/OSSツールの選び方と必要VRAM

ローカルVLMでPDF・画像をJSON化する方法を実行経路ごとに整理。Datalab lift等のオープンウェイトモデルとMarker/Docling等のOSSツールの選び方、4bit量子化で16GB GPUに収まるかを、公式lift-pdf経路とコミュニティGGUF経路を分けて解説します。
GPU・グラフィックボード

Ornith-1.0をローカルで動かすには?9B〜397Bの必要VRAMとGPU選び【Dense/MoE別】

Ornith-1.0(DeepReinforce製、MITライセンス)を手元のGPUで動かす方法を解説。9B/31B Dense・35B/397B MoEのサイズ別メモリ目安を整理し、9B/35Bは当サイトのRTX 5080環境で実測。GPU選びとOllama起動手順も紹介します。
ローカルAI環境

ローカルLLMでゲームやコードは自作できるか|完全オフライン・反復前提で27〜30B級モデルが到達できる範囲

完全オフラインのローカルLLMでゲームやコードは自作できるのか?Redditで話題になった27B級モデルの想定を踏まえつつ、Qwen3-Coder-30B-A3Bを例に、反復とタスク分解を前提とした開発手法の可能性と、RTX 5080など最新GPUのVRAM要件(量子化)を、海外コミュニティの議論を交えて解説します。
ローカルAI環境

ローカルVLMでデスクトップ操作を自動化|OmniParser前処理で視覚トークン負荷を抑える

ローカルVLMでデスクトップを自動化する際、スクショ直渡しでは視覚トークンが膨らみ処理が重くなります。OmniParser型の前処理でUI要素を構造化すれば視覚トークンを大きく減らせ、未検証のコミュニティ報告では5〜10倍とも(削減幅は実装しだい)。ローカルでGUI操作を自動化するヒントを解説します。
ローカルLLM

Apple Core AIとは|Core MLとは別に登場したオンデバイス推論基盤とMLX・ANEの関係

WWDC 2026で発表されたApple Core AIは、Core MLとは別に用意された生成AI・大規模モデル向けのオンデバイス推論基盤。Foundation Modelsでの位置づけ、MLX・ANEとの役割分担、M4 Max/iPhoneの公開ベンチ、Ollama/RTX勢のローカルLLM実行を整理する。
ローカルLLM

巨大オープンモデルは手元で動くのか比較|GLM-5.2・Kimi K2.6・Qwen3.5 122Bの必要メモリ早見表

GLM-5.2・Kimi K2.6・MiniMax M2.7・Qwen3.5 122Bといった巨大オープンモデルは自宅PCで動くのか。総パラメータでなく量子化後の必要メモリで見ると、122B約77GBから1T約340GBまで段差がある。家庭用GPUの限界と、現実的な消費者向けルートを早見表で整理します。
ローカルLLM

GLM-5.2をローカルで動かせるか|約750B級オープンウェイトに必要なメモリと、消費者向け単体マシンの限界

GLM-5.2は、2026年6月にMITライセンスでフルウェイトが公開されたオープンウェイトのコーディング向けモデル。長期のコーディングやエージェント用途で注目を集め、「重みが公開された=自分のPCで動かせる」と受け取られがちです。ただ、こ...
ローカルLLM

ローカルLLMのベンチマーク数値の読み取り方|その「毎秒○トークン」は自分のPCでも出るのか

ローカルLLMをどれにするか選ぶとき、レビューやベンチ記事で見る「毎秒○トークン」「VRAM○GB」という数字が判断材料になる。ただ、その数字が手元のパソコンでそのまま出るとは限らない。実測では、同じモデルが16GBのGPU1枚で毎秒19ト...