ローカルAI環境 Strataで125BのQwen3.8-Flash-NextをVRAM 16GBで実測|素のllama.cpp・27B・Claude Codeとも比較
VRAM 16GBのGPU 1枚とメインメモリ96GBの検証環境で、125BのQwen3.8-Flash-NextをStrataと素のllama.cppで実測。RTX 5080と5060 Tiでの速さ、2枚目のGPUの分け方、量子化の違い、Qwen3.8-27BやClaude Codeとの比較をまとめた。