ローカルAI環境 Qwen3.8-27BのMTPは16GBで速くなるか|有効化で増えるVRAMと、速くならない条件を実測 Qwen3.8-27BのMTP(マルチトークン予測)を16GBのGPU1枚で実測。有効化でのGPU使用量の増分と速度変化は対応したが、開始時の空きと実配置も同時に違うため、増分が原因とは判定できない。KVキャッシュの型を落とすと結果が変わる例も測った。 2026.09.05 AIハードウェア図鑑 ローカルAI環境