ローカルLLMの量子化フォーマットの選び方

GPU・グラフィックボード

量子化で27B級LLMはVRAM 16GBに載るか|1bit・Ternary圧縮の実力と精度の代償

27B級LLMは1bit・Ternary(三値)の極低ビット量子化なら、重みを約3.8〜7.2GBまで圧縮してVRAM 16GBに載せられます。ただし精度はFP16比で約9割前後に低下し、長文ではKVキャッシュ量が可否を左右するため、理想サイズと実行時ピークメモリの区別が要点になります。
GPU・グラフィックボード

ローカルLLMの量子化フォーマットの選び方|Q4_K_M〜Q8・QATを精度・サイズと16GB VRAMで見極める

量子化フォーマットとは、LLMの重みを低ビットに圧縮し容量と速度を稼ぐ方式。 Hugging Faceで同じモデルのページを開くと、量子化の種類がずらりと並びます。Q4_K_M、Q5_K_M、Q6_K、Q8_0、さらにQAT版――名前だけでは何がどう違うのか、すぐには判断できません。