GPU・グラフィックボード

GPU・グラフィックボード

GPUがSSDを直接読む仕組み|cuFileオープンソース化とローカルAIでモデルロードが速くなる条件

cuFileとは、GPUがストレージを直接読み書きするAPIである。「GPUがSSDを直接読む」と聞けば、ローカルLLMの起動が速くなるのでは、と期待したくなるところ。この記事の要点 cuFileはCPUのシステムメモリを介さずGPUメモリとストレージを直結させるAPI。
GPU・グラフィックボード

ローカルLLM常駐時のVRAM配分|他のAI作業と同時に回すと重みとKVキャッシュで詰まる

ローカルLLMのVRAM配分とは、重み・KVキャッシュ・一時確保の3枠に容量を割り振る設計。それなのに、常駐させたまま画像生成を回した瞬間に生成が始まらなくなる。この症状の原因は「VRAMが足りない」ではなく「配分を決めていない」ことにあります。
GPU・グラフィックボード

Nemotron-3-Puzzle 75B-A9Bは手元のGPUで動かせるか

Nemotron-3-Puzzle 75B-A9Bとは、NVIDIAが圧縮したハイブリッドMoEの大規模言語モデル。「アクティブが9.3Bなら、手元の16GB GPUでも動くのでは」——そう考えて検索した人ほど、答えは期待とずれます。結論を先に置くと、このモデルを手元で気軽に動かすのは現時点で難しいです。
GPU・グラフィックボード

量子化で27B級LLMはVRAM 16GBに載るか|1bit・Ternary圧縮の実力と精度の代償

27B級LLMは1bit・Ternary(三値)の極低ビット量子化なら、重みを約3.8〜7.2GBまで圧縮してVRAM 16GBに載せられます。ただし精度はFP16比で約9割前後に低下し、長文ではKVキャッシュ量が可否を左右するため、理想サイズと実行時ピークメモリの区別が要点になります。
GPU・グラフィックボード

Nemotron 3 EmbedをVRAM 16GBで動かす|RTX 5080実測の必要VRAM・速度・NVFP4

Nemotron 3 EmbedをRTX 5080(16GB)で実測。1B-BF16はロード約2.2GBで快適、8B-BF16単体は約15.7GB使用で大量処理には不向き。5080+5060 Tiのデュアルで短文は現実的、NVFP4は約1GBでロード可だが推論は不安定。
GPU・グラフィックボード

AI用途にGPUは2枚必要か|RTX 5080 + 5060 Ti + OCuLink外付けで2枚目の効果を実測

AI用途の2枚目GPUとは、速度でなくVRAM容量と同時実行を増やす手段である。基礎知識から接続構成、推論エンジンごとの帯域の効き方、そして実測データまで、AI用途でGPUを2枚にすべきか迷っている人が自分の用途で判断できるところまで一本で扱います。
ローカルAI環境

Thunderbolt 5でローカルAIを外付け強化する選択肢

OWC Stack AIは、Thunderbolt 5でローカルAIを外付け強化するアクセラレータ兼ストレージハブ。2026年5月21日発表、価格・詳細スペックは未公開です。VRAMの壁を外付けで越える発想の意味と、TB5の帯域が内蔵直結に劣る現実を、eGPU/Oculink運用の実感から整理します。
PC構成

Honor WIN H9のローカルAI実行ガイド|6ファン冷却とRTX 5070 Ti Laptopの実力

Honor WIN H9は6ファン冷却とRTX 5070 Ti Laptop GPUを搭載するノートPCで、CPU+GPU合計270W級の電力枠を支える設計である。長時間のローカルLLM推論や画像生成で持続性能を引き出したい個人ユーザーに向いている。
PC構成

ONEXStationに関するよくある疑問7選|Ryzen AI Max+ 395ミニPCの実力を全部まとめて解説

ONEXStationはOneXPlayerが2026年4月11日に発売したRyzen AI Max+ 395(Strix Halo)搭載のAI向けミニPCです。ローカルLLM性能・価格妥当性・dGPU構成との違い・TDP可変・輸入コストを公式仕様と一次ソースで整理します。
PC構成

AIミニPCワークステーションとは?GMKtec EVO-T2S/EVO-X2で学ぶIntel・AMDの選び方

AIミニPCワークステーションとは、NPUとiGPUを統合してローカルでAI推論を動かす小型PCの総称。GMKtecのEVO-T2S(Intel Core Ultra)とEVO-X2(AMD Ryzen AI Max+ 395)を例に、メモリ帯域・TOPS・用途別の選び方を比較表と公式ソース付きで整理する。