ハードウェア VRAMに収まらないMoEモデルのデコードが約2倍になった|FreeTokenとOllamaをRTX 5080で実測比較
VRAM 16GBに収まらない35B級のMoEモデルを、推論エンジンをFreeTokenに替えて実測した。デコードは約2倍になる一方で最初のトークンまでは遅く、約44〜50トークンで総時間が逆転する。RTX 5080での実測値と導入の条件をまとめた。
ハードウェア
ハードウェア