ローカルLLM常駐時のVRAM配分

GPU・グラフィックボード

ローカルLLM常駐時のVRAM配分|他のAI作業と同時に回すと重みとKVキャッシュで詰まる

ローカルLLMのVRAM配分とは、重み・KVキャッシュ・一時確保の3枠に容量を割り振る設計。それなのに、常駐させたまま画像生成を回した瞬間に生成が始まらなくなる。この症状の原因は「VRAMが足りない」ではなく「配分を決めていない」ことにあります。