ローカルAI環境

GPU・グラフィックボード

llama.cpp b9145解説|Intel ArcのSYCLメモリ二重消費を約9分の1に削減

llama.cpp b9145とは、SYCLバックエンドのメモリ二重消費を解消した修正リリース。 Intel Arc GPUでローカルLLMを動かすと、VRAMに余裕があるはずなのにシステムRAMが先に枯渇してOOMで落ちる。この奇妙な現象に2026年5月14日、ggml-org/llama.cppリリース「b914…
ローカルAI環境

MacBook Air M5でローカルLLM 21モデル比較|コーディング性能と速度を実測したベンチマーク総括

ローカルLLMとは、自分のPC上でクローズドに推論を動かす大規模言語モデルのこと。 「印象論ではなくデータで比較したい」——海外のRedditコミュニティ(r/LocalLLaMA)で、MacBook Air M5を使って21個のローカルLLMをコーディング性能(HumanEval+)と推論速度で一斉検証した投稿が話…
ローカルAI環境

推論モデルとは|deepseek-r1とqwen3 thinkingのRTX 5080実測VRAM消費とtokens/sec差を解説

推論モデルは回答前にthinking連鎖を内部展開するLLM群である。RTX 5080実測でdeepseek-r1:8bはVRAM 10.1GB・約104 tok/s、qwen3:14b thinkingは10.2GB・約74 tok/sを記録。Web標準値の約1.5倍を見積もる選定基準を解説する。
GPU・グラフィックボード

Qwen3.6 35B-A3B vs 27B UD AI用途で比較|M5 Pro 64GBの個人検証から見た選び方

Qwen 3.6とは、Alibaba Qwen Teamが公開する大規模言語モデルファミリーである。 海外のRedditコミュニティ(r/LocalLLaMA)で、MacBook P…
ComfyUI

精度を落とすと何が変わるか|SDXL・Flux・MiniMax H3など5モデルをFP16/BF16/FP8で実測

拡散モデルの精度フラグ(FP16/BF16/FP8)で何が変わるかをRTX 5080 16GBで実測。SDXL・Flux 1 dev・FLUX.2 Klein 9B・MiniMax H3など5モデルで生成時間とVRAMピークを比較。フラグに反応しないモデルもあった。
GPU・グラフィックボード

LTX 1 を 16GB VRAM で量産する実測ガイド|LTX 2.3 は動くか(RTX 5080 / 5060 Ti)

LTX 1 は 16GB VRAM の RTX 5080 / RTX 5060 Ti でも量産に足る軽量動画生成 AI モデルである。生成時間 5 分台・Peak VRAM 15.9 GB の実測データを出典付きで整理し、版ごとのライセンス差(v0.9.1 は研究・学術目的限定、v0.9.6 以降は Open Weights License)も併記した。
GPU・グラフィックボード

NVIDIA GPUドライバー最適化が決めるAI実効性能|RTX世代別ハードとソフトの相互作用

NVIDIA GPUの実効性能はハードスペックだけでは決まらない。ドライバー最適化・CUDAエコシステム・シェーダーコンパイル処理の各層がAI推論とゲーム双方の体感を左右する仕組みを、RTX 40/50シリーズ別に整理する。
GPU・グラフィックボード

RTX 5080 で測る ローカル LLM の TTFT|mistral 7B 792ms / phi4-mini 840ms の 1 秒以下応答

TTFTとは、ユーザー入力から最初のトークンが返るまでの時間(ms)である。 ローカルLLMの「体感速度」を決めているのは、tokens/secではなくTTFT(Time To First Token)。当サイトのRTX 5080実機計測で...
ローカルAI環境

vLLM v0.20.1解説|v0.20.0の不具合修正・DeepSeek V4対応・推論最適化

vLLM v0.20.1(2026年5月3日公開)を解説。DeepSeek V4ベースモデル対応、TopK=1024デッドロック修正、FlashInfer BF16/MXFP8通信とFP32→FP4変換の最適化を、PR番号と推奨アップグレード手順込みで整理。
PC構成

AIエージェント自動化のメモリ消費|VRAMだけでは足りない4つの詰まりどころ

AIエージェント自動化で詰まるのはVRAMだけではない。実際に効いてくるのはVRAM・システムRAM・ストレージI/O・電源とバス帯域の4か所で、前の2つは容量、後ろの2つは構成条件がそろった時に表面化する。96GB環境の実測でフェーズ別の消費を分解し、RAMを比率ではなく積み上げで決める考え方を示す。