DiffusionGemma

GPU・グラフィックボード

DiffusionGemmaをローカルで動かす|量子化時に約18GB VRAMで載る拡散LLM、自己回帰比で最大4倍速の理屈

DiffusionGemmaは、離散拡散(ブロック自己回帰型)で文章を生成するGoogle製オープンウェイトLLM。量子化時で約18GB VRAM、GPU上で自己回帰比・最大4倍速(Google公称)。KVキャッシュや対応ランタイム、16GB GPUで動くかまで公式一次情報で整理します。
ComfyUI

DiffusionGemmaとは|拡散方式の高速LLMをRTXローカルで動かす要件

DiffusionGemmaとは、テキストをブロック単位で並列に生成する拡散方式のオープンな言語モデルです。Google DeepMindが実験的モデルとして公開し、NVIDIAがGeForce RTX・DGX Spark向けに最適化。従来の逐次生成とは異なる高速なテキスト生成をローカルPCで実現する仕組みと要件を解説します。