GPUなし ローカルLLM

GPU・グラフィックボード

TTFTとは何を測っているのか|内訳を分けて2枚のGPUで実測すると、動く部分と動かない部分が分かれる

TTFT(Time To First Token)は、リクエストから最初のトークンが返るまでの時間。ただしローカルLLMでは、何を「最初」と数えるか、未ロードから測ったかで値が桁で変わる。RTX 5060 Tiと5080で7モデルを実測すると、初回は95〜99%がモデルの読み込みだった。
GPU・グラフィックボード

ローカルLLMを2枚のGPUのVRAMプールで動かす|OCuLink接続の帯域ボトルネックを見極める

1枚に載らないローカルLLMを2枚のGPUで動かすとき、OCuLink接続では分割方式で速度が変わる。RTX 5080+5060 Ti(OCuLink)の実測では、単一生成でテンソル並列がレイヤー分割より速い場面があり、プロンプト処理では逆に遅かった。実機ベンチをもとに分割方式の選び方を解説する。
PC構成

GPUなしでローカルLLMは実用的か|CPUのみ推論をi7実機で検証

GPUなしのCPUだけでローカルLLMは実用的か。Core i7-14700F実機で1B〜35Bの生成速度・読み込み時間・ロード時のサイズを実測し、2026年9月にはqwen3.5・gemma4の現行モデルも追加。3〜8B級は実用域、27Bは2.97トークン/秒、MoEはサイズの割に生成が速い。