2.6BクラスのローカルLLM

ローカルLLM

「Qwen3.8-4B」は使えるか|土台のQwen3.5-4Bと同条件でRTX 5080/5060 Ti実測

「Qwen3.8-4B」は公式のQwen3.8ではなくQwen3.5-4Bを土台にした第三者蒸留。RTX 5080と5060 Tiで土台と同条件比較すると、生成速度も必要VRAMもほぼ同じで、短答では思考トークンが中央値で約10分の1から30分の1だった。
GPU・グラフィックボード

2.6BのローカルLLMで128Kの文脈は張れるか|LFM2.5-2.6Bの必要VRAMを16GB GPUとCPUのみで実測

LFM2.5-2.6BをRTX 5060 TiとCPUのみで実測。131,072トークンを張っても必要VRAMは3,970 MiBで、KVキャッシュは1トークンあたり16.00 KiB。同条件の密なTransformerは16GBに収まらない。層構成が長文脈のメモリを決める仕組みを実測値で示す。