わからない言葉があったら、ここで引く。各用語をクリックすると、詳しい解説記事へ移動する。
GPU・メモリの基本
- GPUVRAMGPUの作業用メモリ。足りないとモデルが読み込めず止まる。AI用途で最初に見る数字。
- GPUGPU・CUDAコアAIの計算を担う部品。CUDAコア数は並列計算の規模の目安になる。
- 基礎NPUAI処理に特化した省電力チップ。GPU・CPUとの役割の違いを押さえる。
- メモリシステムRAMPC本体のメモリ。VRAMからあふれた分の受け皿になる。
- メモリSSD・NVMeモデルの保管場所と読み込み速度。NVMe規格で差が出る。
- GPUOCuLink・外付けGPUPCIeを外へ引き出して2枚目のGPUをつなぐ規格。増設できるが帯域は内部スロットより狭い。
- GPUデュアルGPUGPUを2枚使う構成。VRAMがそのまま足し算になるとは限らない。
- 基礎電源・12V-2×6必要ワット数とコネクタの規格。GPUが決まったら次に確かめるところ。
ローカルLLMの言葉
- LLMローカルLLM自分のPCでAIを動かす仕組み。クラウド不要でデータが外に出ない。
- LLMOllamaローカルLLMを一番簡単に動かすツール。最初の一歩。
- LLMllama.cpp軽量・高速な実行エンジン。多くのツールの土台になっている。
- LLM量子化モデルを圧縮してVRAM消費を減らす技術。動くか動かないかを分ける。
- LLMコンテキスト長一度に扱える文章の長さ。長いほどVRAMを多く使う。
- LLMtokens/sec生成速度の単位(毎秒トークン)。その数値が自分のPCでも出るかの読み方。
- LLM推論・thinking答える前に考える過程を挟む型。精度は上がるが遅く・VRAMも増える。
- LLMMoE必要な部分だけ動かす構造。規模が大きいのに高速で省電力。
- LLMKVキャッシュ文脈を保つためにVRAMを使う領域。長文を扱うほど膨らむ。
- LLMMTP(マルチトークン予測)複数トークンをまとめて予測して速くする仕組み。効く構成と効かない構成がある。
- LLMファインチューニング・LoRA既存モデルに自分のデータを覚えさせる方法。LoRAなら手元のVRAMでも届く。