ローカルAI環境

GPU・グラフィックボード

RTX 5080 16GB VRAMの壁に関するよくある疑問7選|27B・32Bは起動するが6〜10 tok/sまで落ちる

RTX 5080 16GBでQwen3.5 27B・Gemma 4 31B・Qwen3 32Bを実測。既定タグでは全レイヤーが載らずCPU側へ回り6.2〜10.3 tok/sまで低下する一方、14Bクラスは75〜77 tok/s。MoEのGemma 4 26B A4Bは58.6 tok/sを維持した。
ローカルAI環境

RTX 5080 16GBで12B〜14B級ローカルLLMを比較|4モデルのVRAM・速度・ピーク電力実測

RTX 5080 16GBとRTX 5060 Ti 16GBで、Gemma 3/4 12B・Phi-4 14B・Qwen3 14BのQ4_K_Mを同条件実測。VRAM常駐、生成速度、生成中ピークボード電力を比較し、16GB GPUで選ぶ際の注意点を整理します。
PC構成

HP OmniBook 5 16-afに関するよくある疑問7選

HP OmniBook 5 16-afとは、Core Ultra 5搭載のAI対応16インチノートPCである。 Amazonで割引中のHP「OmniBook 5 16-af(BF8H9PA-AAAA)」をチェックしていて、「Core Ult...
ローカルAI環境

RTX 4060 8GBでQwen3.6 35B MoEを動かす

Qwen3.6-35B-A3Bとは、Alibabaが2026年4月に公開したMoE型の大規模言語モデル。 海外のRedditコミュニティ(r/LocalLLaMA)で、RTX 4060 Laptop(VRAM 8GB)+RAM 96GBの構...
ローカルAI環境

RTX 5080で最初に入れる7-8BローカルLLMはどれか

7-8BローカルLLMとは、パラメータ数70億〜80億級の中型言語モデルのこと。 phi4-miniやllama3.2:3bでOllamaの動作確認は済んだ。次は少し大きい7-8Bクラスを試したい。ただ、Ollamaライブラリで「7B」「8...
PC構成

AI用PCの最低スペックガイド|RTX 5060 Ti+RAM 32GBで始めるローカルAI環境

ローカルLLMを自宅で動かすなら、VRAM(GPUに搭載された専用メモリ)16GBが実用ラインです。タイトルにある「最低スペック」は「これ未満では動かない」という意味ではありません。VRAM 8GBでも7B級は動きますし、12GBなら14B...
ローカルAI環境

翻訳用ローカルLLMをRTX 5080で実測

翻訳用ローカルLLMとは、PC上で動かし翻訳用途に使えるオープンソースの汎用言語モデルである(翻訳に特化した派生モデルもあるが、本記事では汎用モデルを翻訳タスクで比較する)。 結論から書きます。翻訳用途で「Gemma 3 4Bが最強」という...
ローカルAI環境

コーディング用ローカルLLM 5モデルをVRAM 16GBで比較|日本語長文生成で速度・VRAMを実測

コーディング用ローカルLLMとは、IDEから呼び出してコード補完や生成に使う自前推論の言語モデルのこと。 VRAM 16GBクラスのGPU(本記事は主にRTX 5080で計測し、同じ16GBで下位クラスのRTX 5060 Ti 16GBの実...
GPU・グラフィックボード

VRAM 16GB:RTX 5080 VRAM不足でLLMが起動しないエラーの解決法|原因と対処法を徹底解説

RTX 5080(VRAM 16GB)でモデルが載らない・極端に遅いときの切り分け方。Ollamaの配置は100% GPU/100% CPU/CPU・GPU混在/ロード失敗の4つに分かれ、ollama psとsize_vramで判定できる。gemma4:26bは27%、qwen3.5:35b-a3bは42%がCPU側に置かれた実測とあわせて、対処の優先順位を整理した。
ローカルAI環境

RTX 5080でMoEの消費電力が低い理由|Ollamaで16GBに載りきらないgemma4:26b・qwen3.5:35b-a3b実測

RTX 5080でLLM 12モデル・アイドル・画像生成の消費電力をOllamaで実測。アイドル55W、推論104〜296W、画像生成230〜279W(定常区間の中央値)。16GBに載りきらないMoEの低電力は、Dense型を同じようにオフロードしても再現された。