MoE CPU

PC構成

GPUなしでローカルLLMは実用になるか|CPUのみ推論をi7実機で検証

GPUを使わずCPUだけでローカルLLMを動かし、1B〜35Bの生成速度・プロンプト処理時間・Ollama報告サイズをCore i7-14700F実機で実測。3〜8B級は実用域、27Bは2.97トークン/秒、MoEの35Bは14Bより速く、連続負荷では1〜2割落ちた。