GPU・グラフィックボード ローカルLLMを2枚のGPUのVRAMプールで動かす|OCuLink接続の帯域ボトルネックを見極める
1枚に載らないローカルLLMを2枚のGPUで動かすとき、OCuLink接続では分割方式で速度が変わる。RTX 5080+5060 Ti(OCuLink)の実測では、単一生成でテンソル並列がレイヤー分割より速い場面があり、プロンプト処理では逆に遅かった。実機ベンチをもとに分割方式の選び方を解説する。
GPU・グラフィックボード
PC構成