GPU・グラフィックボード

VRAM 16GBでローカルLLMのコンテキスト長はどこまで伸ばせるか|KVキャッシュ量子化の実測

長文入力でつまずくとき、モデル本体とは別に、コンテキスト側のKVキャッシュがVRAMを食い尽くしているのが主因になっていることがある。前回、VRAM 16GBのGPUでGemma 4 12Bを動かす記事を書いた。モデル本体さえ16GBに収ま...
基礎知識

Unitree G1:人型ロボット開発の国内現場ルポ|フィジカルAIの実装現場と日本の立ち位置

京都のスタートアップ・ハカルスの実機検証拠点『HACARUS Humanoid Lab』を現場ルポ。Unitree G1とNVIDIA Isaac Simで人型ロボット開発を支援。料金・4コース・導入手順をTECH+取材から整理します。
GPU・グラフィックボード

VRAM 16GBでGemma 4 12Bを動かす|RTX 5080/5060 Ti実測の速度・VRAMと16GB級LLMの選び方

Google が Gemma 4 12B を公開したのが 2026 年 6 月 3 日。エンコーダを持たない統合型のマルチモーダルモデルで、Google 自身が「16GB の VRAM またはユニファイドメモリを積んだノートで動く」サイズだ...
PC構成

Codex CLI 推奨スペック|GPU不要でも要注意なローカルサンドボックスとWindows・Node.js環境

Codex CLI に専用 GPU は不要(モデル推論はクラウド、コマンド実行は手元)。ローカル実行サンドボックス・承認モード・Windows 対応・Node.js・認証を公式情報で整理した推奨スペック/必要環境ガイド。
GPU・グラフィックボード

ローカルLLMの量子化はどれを選ぶか|Q4_K_M・Q8_0・FP16のVRAMと速度を実測比較

Ollama でモデルを探していると、同じモデル名でもタグがいくつも並んでいることに気づく。たとえば llama3.2:3b を引こうとすると、3b-instruct-q4_K_M や 3b-instruct-q8_0、3b-instruc...
ローカルAI環境

デュアルGPUでローカルLLMを動かす|Ollama自動分散の実測と二枚目が遊ぶ落とし穴(RTX 5080+5060 Ti)

デュアルGPU(RTX 5080 + RTX 5060 Ti)で、16GBに載らない大型ローカルLLM(qwen3.5:35b-a3b 等)を動かした実測。Ollamaは設定なしで自動的に二枚へ分散し、筆者環境・Ollama 0.23.3・num_ctx=4096では100% GPUロードでqwen 約93・gemma 約109 tok/s を確認。OLLAMA_SCHED_SPREADは通常不要。複数serve競合で二枚目が遊ぶ落とし穴も解説する。
ComfyUI

ComfyUIのアップスケールはRAMを67GB食う|ComfyUI外でESRGANを動かしRAM1.4GB・2倍速にする方法

ComfyUIで動画を4KアップスケールするとRAMを67〜77GB消費し、潤沢なメモリと長い処理時間が要る。本記事ではComfyUIを使わずspandrelでESRGANを直接動かし、フレーム逐次処理でメモリを一定(実測1.4GB)・処理を2倍以上高速にする方法を、動くコードと総当たり実測付きで解説する。
GPU・グラフィックボード

M5 MacBook Air は AI とゲーム両方で何ができるか|実測ベース総合レビュー

2026 年 3 月 11 日に発売された M5 MacBook Air は、 「軽量ノートで AI もゲームもどこまでできるか」 を考えるうえで、 かなり分かりやすい基準になるモデルだ。10 コア CPU + 最大 10 コア GPU の...
GPU・グラフィックボード

VRAM 16GB GPU を選ぶなら|AI 用途別に比較

この記事では VRAM 16GB モデルの GPU の選び方を解説する。 当サイトの検証環境では RTX 5080・RTX 5060 Ti という 16GB モデル 2 枚と、 RTX 4070 SUPER (12GB) を用途別に使い分け...
GPU・グラフィックボード

Qwen3.6-35B-A3B とは?MoE型マルチモーダル LLM のローカル実行ガイド

Qwen3.6-35B-A3B は総350億・動作30億パラメータのMoE型マルチモーダルLLMである。FP8版34.87GBでRTX 5090級のローカル実行が可能で、視覚言語タスクに向いている。スペックと実行環境を整理する。