GPUなし ローカルLLM

GPU・グラフィックボード

ローカルLLMを2枚のGPUのVRAMプールで動かす|OCuLink接続の帯域ボトルネックを見極める

1枚に載らないローカルLLMを2枚のGPUで動かすとき、OCuLink接続では分割方式で速度が変わる。RTX 5080+5060 Ti(OCuLink)の実測では、単一生成でテンソル並列がレイヤー分割より速い場面があり、プロンプト処理では逆に遅かった。実機ベンチをもとに分割方式の選び方を解説する。
PC構成

GPUなしでローカルLLMは実用になるか|CPUのみ推論をi7実機で検証

GPUを使わずCPUだけでローカルLLMを動かし、1B〜35Bの生成速度・プロンプト処理時間・Ollama報告サイズをCore i7-14700F実機で実測。3〜8B級は実用域、27Bは2.97トークン/秒、MoEの35Bは14Bより速く、連続負荷では1〜2割落ちた。