LLM量子化・軽量化

GPU・グラフィックボード

量子化で27B級LLMはVRAM 16GBに載るか|1bit・Ternary圧縮の実力と精度の代償

27B級LLMは1bit・Ternary(三値)の極低ビット量子化なら、重みを約3.8〜7.2GBまで圧縮してVRAM 16GBに載せられます。ただし精度はFP16比で約9割前後に低下し、長文ではKVキャッシュ量が可否を左右するため、理想サイズと実行時ピークメモリの区別が要点になります。