llama.cpp

GPU・グラフィックボード

Bonsai 2 27BはVRAM 16GBで動くか|公称5.9GBの中身と、専用ビルドが要る理由を実測

PrismML が公開した Bonsai 2 27B を RTX 5080 16GB 単体で実測。標準の llama.cpp では読み込めず専用ビルドが要ること、配布される PTQ1_0 と PQ2_0 でプロンプト処理と生成の差の出方が変わること、公称5.9GBがどのファイルの値かを整理した。
ローカルAI環境

指定できる文脈長と使える文脈長は違う|Qwen3.8-27B を VRAM 16GB で実測

Qwen3.8-27B を VRAM 16GB 1枚で動かし、指定した文脈長が実際に使えるかを実測した。測った枠のうち 196,608 までは読み込みも生成も落ちず、262,144 だけが読み込みの途中で打ち切りになった。境目は専用VRAMの値には出ず、共有GPUメモリ側の増加として現れる。
ローカルLLM

Qwen3.8-27BをVRAM 16GBで実測|量子化3種の必要VRAMと起動オプションの差

Qwen3.8-27B の必要VRAMを、重み・KVキャッシュ・線形アテンション状態・計算バッファの内訳まで実測。量子化3種を16GBで動かし、起動オプションひとつで必要量が449MiB動くこと、載ったかどうかは生成速度と消費電力の組でしか判別できなかったことを RTX 5060 Ti・5080 で確かめた。
GPU・グラフィックボード

MTP(マルチトークン予測)でローカルLLMは本当に速くなるか|RTX 5080実測、非MoEで1.69倍・MoEは1.0〜1.4倍と構成次第

MTP(マルチトークン予測)でローカルLLMが何倍速くなるかをRTX 5080で実測。非MoEのgemma-4-12bは1.69倍、MoEは1.0〜1.4倍と量子化・GPU構成で振れる。効きを分けるのは1順伝播あたりのボトルネック(帯域/GPU間の受け渡し待ち)をMTPが薄められるか。llama.cppの実測で解説。
GPU・グラフィックボード

ローカルLLM推論エンジン比較|Ollama・llama.cpp・LM Studio・vLLMの選び方

Ollama, llama.cpp, LM Studio, vLLMの4大ローカルLLM推論エンジンを、速度・手軽さ・マルチGPU対応の3軸で徹底比較。RTX 5080+5060 Ti環境での実測データも交え、LM Studioのテンソル並列対応がもたらす影響や、あなたの環境に最適なエンジンの選び方を解説します。
ローカルAI環境

llama.cppのGemma 4でRAMが枯渇する原因|VRAM余裕でもOOMする仕組みと回避策

VRAM 32GBのGPUにモデルを載せた。VRAM使用量はまだ余裕がある。なのに数回プロンプトを送っただけでプロセスが強制終了される。原因はGPUではなく、システムRAMの枯渇だった。 海外のRedditコミュニティ(r/LocalLLa...