Qwen3.8-27B

ローカルLLM

Qwen3.8-27BのNVFP4 GGUFをRTX 5080・5060 Tiで実測|UD-IQ4_XSより速いのか、VRAM 16GBで文脈40Kまで比較

Qwen3.8-27BのNVFP4 GGUF 3本をRTX 5080・5060 Ti(VRAM 16GB)で実測。UD-IQ4_XSと生成・入力処理の速さ、共有メモリへのあふれを文脈40Kまで比べ、選び方をまとめた。RTX 4070 SUPERとClaude Codeでの結果も載せる。
ローカルAI環境

Strataで125BのQwen3.8-Flash-NextをVRAM 12GB・16GBで実測|素のllama.cpp・27B・Claude Codeとも比較

VRAM 12GB・16GBのGPU 1枚とメインメモリ96GBの検証環境で、125BのQwen3.8-Flash-NextをStrataと素のllama.cppで実測。RTX 5080・5060 Ti・4070 SUPERでの速さ、2枚目のGPUの分け方、量子化の違い、Qwen3.8-27BやClaude Codeとの比較をまとめた。
ローカルLLM

Qwen3.8-27BのMTPは16GBで速くなるか|有効化で増えるVRAMと、速くならない条件を実測

Qwen3.8-27BのMTP(マルチトークン予測)を16GBのGPU1枚で実測。有効化でのGPU使用量の増分と速度変化は対応したが、開始時の空きと実配置も同時に違うため、増分が原因とは判定できない。KVキャッシュの型を落とすと結果が変わる例も測った。
ローカルLLM

Qwen3.8-27BをVRAM 16GBで実測|量子化3種の必要VRAMと起動オプションの差

Qwen3.8-27B の必要VRAMを、重み・KVキャッシュ・線形アテンション状態・計算バッファの内訳まで実測。量子化3種を16GBで動かし、起動オプションひとつで必要量が449MiB動くこと、載ったかどうかは生成速度と消費電力の組でしか判別できなかったことを RTX 5060 Ti・5080 で確かめた。