2枚目のGPUがはっきり役立つのは、1枚のVRAMに収まらない大型LLMと、複数の処理を同時に動かす場面です。逆に、1枚で収まる画像生成や小型LLMでは、2枚目が遊んでしまうことも少なくありません。
GPUを2枚にすると、ローカルAIは何が変わるのか。マルチGPU(複数GPU)構成の効果を、当サイトは RTX 5080+RTX 5060 Ti(各16GB)を Oculink で2枚運用し、ローカルLLM・画像生成で実測してきました。良くなるケースと変わらないケースの両方を、実測したまま紹介します。
VRAMは2枚で足し算できるのか
よくある疑問が「2枚にすればVRAMは合算(足し算)できるのか」です。答えは 単純な足し算ではありません。2枚のVRAMが1つの大きなVRAMになるわけではなく、1つのモデルはそのままでは1枚にしか載りません。
ただし、モデルを層ごとに2枚へ分けて載せれば(モデル分割)、合算32GBに収まる大型モデルを実際に動かせます。当サイトでも、1枚(16GB)からあふれる qwen3.5:35b-a3b を2枚に分けて動かし、約1.9倍に高速化しました。一方で、合算32GBも超える超大型モデル(70B級など)は、この方法でも実用的な速度では動きません。分割したときに何が速度を決めるのかは 2枚のGPUのVRAMプールで動かす|OCuLink接続の帯域ボトルネックを見極める で実測しています。ローカルLLMで1枚にするか2枚にするか迷っているなら、モデルの大きさ別に1枚と2枚を比べた目安を、同じ記事の冒頭に置いています。
2枚にして良くなるケース/変わらないケース
◎ 2枚にして良くなるケース
- 1枚(16GB)に乗り切らない大型・MoEモデル。あふれてしまう分が2枚に収まり、速くなります(例:16GBで約38%あふれる qwen3.5:35b-a3b が約1.9倍)。
- 1枚(16GB)からあふれる 27B〜32B 級の Dense モデル。1枚(RTX 5080)でも動きはしますが、測った3本は 7.4〜12.8 tok/s まで落ち、16GB×2=合算32GBで全部載ると 25.7〜30.1 tok/s に上がりました(27〜35B級を2枚に載せて測った結果)。
- 複数の作業を同時に動かしたいとき。たとえば、ComfyUI やローカルLLM を2つ、別々のGPUに振り分けて同時に動かせます。
△ 2枚にしても変わらないケース・注意点
- 1枚に収まるモデルは、2枚目が遊びます。使われないので、速度はほとんど変わりません。
- 1枚で終わる画像生成は、2枚に分かれません。同時に2つ動かすときに、はじめて2枚目が活きます。
- Oculink(PCIe 4.0 x4)の通信速度。ふだんの推論には十分ですが、モデルの読み込みなど一部の処理では差が出ます。
- 2枚(合算32GB)でも収まらない超大型モデルもあります。70B級(Q4で約44GB〜)はRAMへの退避を併用しても実用速度が出ず、当サイト実機の32GBでは動かせません。
用途別・2枚目の効果の出やすさ
| 用途 | 2枚目の効果 | 理由 |
|---|---|---|
| 16GBに収まる小型LLM | 小さい | 1枚で完結しやすい |
| 27〜32B級LLM | 大きい場合あり | VRAM分割で載る可能性 |
| 画像生成(1ジョブ) | 小さい | 1枚のGPUで処理されやすい |
| 画像生成(2ジョブ同時) | 大きい | GPUごとに処理を分けられる |
| ComfyUI 複数ワークフロー | 条件次第 | ノード・処理の分離が必要 |
| 動画生成 | 条件次第 | VRAMとシステムRAMの両方が重い |
同じGPUを2枚そろえる必要があるか
2枚目を足すとき、1枚目と同じ型番をそろえるべきか。答えは使うツールによって変わります。当サイトは RTX 5080 と RTX 5060 Ti という型番の違う2枚(異種構成)で運用していて、ローカルLLMではこの構成のまま効果が出ています(1枚からあふれる qwen3.5:35b-a3b が約1.9倍)。モデルの層を分けて各GPUに置く方式なら、2枚の性能や容量が同じである必要はないからです。
一方で、同一GPU2枚を条件にしている機能もあります。ComfyUI に組み込みの MultiGPU CFG Split は、公式のノードドキュメントが対応構成を「Ampere以降の同一GPU2枚」とし、型番の違う混在は非対応と明記しています。当サイトの異種構成はこの条件から外れるため、この機能自体は未検証です。ただし異種でも別のやり方は残っていて、認識はされているのに2枚目が使われないときの切り分けは 複数GPUが認識されても使われない時の切り分け にまとめています。
2枚目が物理的に入るか確かめるならGPUに確保できるスロット幅と、ケースの対応カード長から絞り込めます。264枚の厚み・長さ・補助電源を型番ごとに並べています。
実測ハイライト
構成と始め方
2枚目は Oculink eGPU ドック(MINISFORUM DEG1)で増設しています。Ollama では2枚目が認識されない場合があり、OLLAMA_SCHED_SPREAD 等の設定で2枚に振り分けます。外付けの選択肢として Thunderbolt 5 もあります。
- MINISFORUM DEG1 Oculink eGPUドック 実機レビュー(半年運用・認識しない時の対処)
- Oculink接続のGPUがOllamaに認識されない原因と OLLAMA_SCHED_SPREAD
- Thunderbolt 5 でローカルAIを外付け強化する選択肢
デュアルGPU 関連記事
ローカルLLMで速くする
- デュアルGPUでローカルLLMを動かす|Ollama自動分散の実測と二枚目が遊ぶ落とし穴
- 16GBで38%あふれる qwen3.5:35b-a3b、2枚目で収まって約1.9倍に
- ローカルLLMの電力あたり生成速度|両GPU合算電力でMoEはdense型の何倍効率的か
- RTX 5080でMoEモデルだけ消費電力が1/4に落ちる
- AI用途にGPUは2枚必要か|OCuLink外付けで2枚目の効果を実測
- ローカルLLM推論時のGPU電力を実測|1枚/2枚構成を比較