ローカルAI環境

llama3.2:3bとは?ドラフト生成で最速のローカルLLM|RTX 5080実測293.9 tok/sを解説

llama3.2:3bはMeta公開30億パラメータの軽量ローカルLLM。RTX 5080実測293.9 tok/sでドラフト用途最速クラス、phi4-mini:3.8bを16%上回る。VRAM 5.1GBで画像生成と並列稼働可、Q4_K_M量子化とOllama運用設定を実機データで解説。
ローカルAI環境

RTX 5080で動かす日本語ローカルLLM比較

RTX 5080とは、NVIDIA Blackwell世代のハイエンドGPU(VRAM 16GB)である。 ローカルで自然な日本語チャットを動かしたいなら、選択肢は2つに集約されます。日本語特化の8Bクラス(Swallow / ELYZA)...
ローカルAI環境

Ollamaが2枚目のGPUを使わない理由|nvidia-smiでは認識済みなのにVRAMが増えないとき

Ollamaはモデルが1枚のGPUに収まる場合はその1枚へ載せる(公式FAQ)。nvidia-smiで2枚とも見えているのに2枚目のVRAMが増えないのは、この既定動作によるもの。RTX 5080+Oculink接続のRTX 5060 Tiで、CUDA_VISIBLE_DEVICES/OLLAMA_SCHED_SPREAD/num_gpuそれぞれの役割と本検証での結果、切り分け手順をまとめた。
PC構成

Honor WIN H9のローカルAI実行ガイド|6ファン冷却とRTX 5070 Ti Laptopの実力

Honor WIN H9は6ファン冷却とRTX 5070 Ti Laptop GPUを搭載するノートPCで、CPU+GPU合計270W級の電力枠を支える設計である。長時間のローカルLLM推論や画像生成で持続性能を引き出したい個人ユーザーに向いている。
GPU・グラフィックボード

Qwen3.6-27Bとは?Dense 27BコーディングLLMをローカルGPUで動かすガイド

Qwen3.6-27BはAlibabaのDense 27BマルチモーダルLLMで、コーディング性能を重点強化。4bit量子化は16GB VRAMだとCPUオフロードを伴い、全量GPUは合計32GB級が目安。RTX 5080単体・デュアルの実測付きでローカル運用を解説。
PC構成

ONEXStationに関するよくある疑問7選|Ryzen AI Max+ 395ミニPCの実力を全部まとめて解説

ONEXStationはOneXPlayerが2026年4月11日に発売したRyzen AI Max+ 395(Strix Halo)搭載のAI向けミニPCです。ローカルLLM性能・価格妥当性・dGPU構成との違い・TDP可変・輸入コストを公式仕様と一次ソースで整理します。
ローカルAI環境

llama.cppのビルドが20種類以上あるのはなぜ?OS・GPU別ビルドの選び方

llama.cppとは、CPUとGPUの双方でLLMをローカル実行するための軽量推論エンジンだ。 llama.cppの公式リリースを開くと、ひとつのタグに対して20種類以上のビルドが並んでいる。macOSのApple Silicon版、In...
ComfyUI

ComfyUIとは?AI画像生成の始め方を初心者向けに解説

Stable Diffusionで画像を生成したいのに、UIの選択で手が止まる。AUTOMATIC1111は古くなりつつあり、Forgeは開発の方向性が読めない。どれを選んでも「動くけど快適じゃない」という中途半端な体験になりがちだった。そ...
PC構成

AIミニPCワークステーションとは?GMKtec EVO-T2S/EVO-X2で学ぶIntel・AMDの選び方

AIミニPCワークステーションとは、NPUとiGPUを統合してローカルでAI推論を動かす小型PCの総称。GMKtecのEVO-T2S(Intel Core Ultra)とEVO-X2(AMD Ryzen AI Max+ 395)を例に、メモリ帯域・TOPS・用途別の選び方を比較表と公式ソース付きで整理する。
GPU・グラフィックボード

RTX 5080 16GB VRAMの壁に関するよくある疑問7選|27B・32Bは起動するが6〜10 tok/sまで落ちる

RTX 5080 16GBでQwen3.5 27B・Gemma 4 31B・Qwen3 32Bを実測。既定タグでは全レイヤーが載らずCPU側へ回り6.2〜10.3 tok/sまで低下する一方、14Bクラスは75〜77 tok/s。MoEのGemma 4 26B A4Bは58.6 tok/sを維持した。