GPU・グラフィックボード VRAM 16GBでローカルLLMのコンテキスト長はどこまで伸ばせるか|KVキャッシュ量子化の実測
長文入力でつまずくとき、モデル本体とは別に、コンテキスト側のKVキャッシュがVRAMを食い尽くしているのが主因になっていることがある。前回、VRAM 16GBのGPUでGemma 4 12Bを動かす記事を書いた。モデル本体さえ16GBに収ま...
GPU・グラフィックボード
基礎知識
GPU・グラフィックボード
PC構成
GPU・グラフィックボード
ローカルAI環境
ComfyUI
GPU・グラフィックボード
GPU・グラフィックボード
GPU・グラフィックボード