ハードウェア

ハードウェア

VRAMに収まらないMoEモデルのデコードが約2倍になった|FreeTokenとOllamaをRTX 5080で実測比較

VRAM 16GBに収まらない35B級のMoEモデルを、推論エンジンをFreeTokenに替えて実測した。デコードは約2倍になる一方で最初のトークンまでは遅く、約44〜50トークンで総時間が逆転する。RTX 5080での実測値と導入の条件をまとめた。
ハードウェア

NVIDIA DGX Sparkは買いか|16GB GPUを実測し公開ベンチと突き合わせて見えた、128GBが効く条件

DGX Spark(GB10)とRTX 5080/5060 Tiを同一のllama-bench条件で実測。VRAMに収まる範囲と収まらない範囲で優劣がどう変わるか、dense/MoEで結論が分かれる理由を実測値で示す。