この記事の要点
- 16GBで動くか: RTX 5080 16GB 単体・配布元ビルドで配布ファイルは2つとも読み込め、生成は PQ2_0 で毎秒86.60トークン。
- そのまま動くか: 標準の llama.cpp ビルドでは2ファイルとも読み込みに失敗し、配布元の専用ビルドが要る。
- どちらを取るか: 2つのファイルは大きさもビット幅も違い、配布元は Blackwell 世代のカードで PQ2_0 を生成の速い側として挙げている。
この結果が言える範囲: 測定は RTX 5080 16GB 単体・PrismML 配布ビルド b10685 による2026年9月18日時点の値で、条件の詳細は実測の節に置いた。出力の品質、長いコンテキスト、並列実行、画像入力は測っていない。公称値はいずれも配布元 PrismML の記載であり、第三者による検証ではない。
Bonsai 2 27Bは16GBに収まるか
RTX 5080 16GB 単体に、PrismML が配布するビルド b10685 で読み込ませたところ、配布されている量子化ファイル2つはどちらも読み込めた。モデル読み込みの前後で増えた専用VRAMは PQ2_0 で7,627MiB、PTQ1_0 で6,483MiB だった (2026年9月18日測定。増分は読み込み前後の差で、デスクトップ常駐分を含まない)。ただし、PrismML が配布するビルドではない標準の llama.cpp ビルドに同じファイルを読ませると2つとも読み込みの段階で停止し、動かすには配布元が用意した専用ビルドが要る。
Bonsai 2 27B は、Qwen3.8-27B をベースに三値の重みを採用したモデルとして配布元 PrismML が2026年9月17日に公開したもので、ライセンスは Apache License 2.0 と記載されている。配布ページに置かれた量子化ファイルは PTQ1_0 と PQ2_0 の2つで、大きさは5.947GB と7.206GB と揃っていない。27B級のモデルを16GBのカード1枚で動かしたい場合、判断は「収まるか」で終わらず、「2つのうちどちらを取るか」まで続く。
以下、ファイルの大きさとビット幅の記載、標準ビルドでの読み込み結果、RTX 5080 での実測、配布元が公称するスループットの順で並べる。測定条件と測っていない次元は、実測表を置く節にまとめて書く。
配布されている2つのファイルは大きさが違う
Hugging Face のリポジトリ prism-ml/Ternary-Bonsai-2-27B-gguf が返すファイルサイズは、PTQ1_0 が5.947GB、PQ2_0 が7.206GB (2026年9月18日時点)。モデルカードは形式ごとの重みあたりビット幅とサイズを表で示しており、そちらの記載と並べると次のようになる。
| 項目 | PTQ1_0 | PQ2_0 |
|---|---|---|
| Hugging Face が返すファイルサイズ (2026年9月18日時点) | 5.947GB | 7.206GB |
| モデルカード記載の重みあたりビット数 | 1.75ビット | 2.13ビット |
| モデルカード記載のサイズ | 5.95GB | 7.21GB |
| モデルカード記載の縮小率 (FP16基準) | 約9.0倍 | 約7.5倍 |
モデルカードは形式名にも説明を添えており、PTQ1_0 を dense trits、PQ2_0 を 2-bit slots として区別している。基準となる FP16 は16.0ビット・約54GB、三値g128の理想値は1.72ビット・5.8GBという記載になる。
モデルカードが挙げる1.72・1.75・2.13という値は、形式ごとに公称されている重みあたりのビット数であり、ファイルサイズを総パラメータ数で割った平均とは別の量になる。総パラメータ数についても、モデルカードは27.36B (言語バックボーン24.35B + embedding/LM head 2.54B + vision tower 0.46B) と記載する一方、ローダーが報告するのは vision tower を除いた26,895,998,464で、割り算の分母が一つに決まらない。形式ごとの公称値と、ファイル全体の平均値は、それぞれ別の条件で定義された数字として読む必要がある。
配布元のリリースページは、重みあたり1.76ビット・モデル全体で5.9GB・総合ベンチマークで元モデルの98.2%を保持 (総合スコア83.9) と記載している。いずれも配布元の公表値で、第三者による検証ではない。
リリースページはこの一組の数字を形式名を添えずに挙げており、モデルカードのように PTQ1_0 と PQ2_0 を分けた表記は取っていない。1.76ビット・5.9GBという並びはモデルカードの表では小さい側 (理想値の1.72ビット・5.8GB、PTQ1_0 の1.75ビット・5.95GB) に近い数字になるが、どちらの配布ファイルを指すかはリリースページの記載からは決まらない。なおリリースページの総合スコア83.9と、モデルカードのベンチマーク14本平均84.78は値が異なる。リリースページが挙げるのは推論・数学・コーディング・指示追従・視覚・エージェント的なツール利用という範囲で、モデルカードは14本の平均としている。どちらも配布元の数字だが直接は突き合わせられない。
どちらを使うかについて、モデルカードは PQ2_0 を H100・A100・Blackwell 世代のカードで、PTQ1_0 を Ada 世代のカード (RTX 6000 Ada / RTX 4090 / L40S / L4) で、それぞれ生成が速い方として挙げている。カード世代ごとの生成の速さという断面での記載で、RTX 5080 は Blackwell 世代にあたる。
標準のllama.cppでは読み込めない
配布元は、標準の llama.cpp ではこれらのファイルが動かないと明記している。理由として、PQ2_0 と PTQ1_0 を未知の型として拒否することを挙げ、あわせて Q2_0 は警告なく読み込んで壊れた出力を返すと述べている。ただし Q2_0 は Bonsai 2 の配布ファイルには含まれない形式で、この記述は別の形式についてのものになる。
手元でも、PrismML 配布ではない標準の llama.cpp ビルド b9745 に同じ2ファイルを読ませた (2026年9月18日)。
- PQ2_0: 読み込みに失敗し、tensor ‘output.weight’ has invalid ggml type 142. should be in [0, 42) というエラーで停止した
- PTQ1_0: 同じく失敗し、型番号だけが143に変わったエラーで停止した
2つのファイルで拒否される型番号が違う点まで含めて、標準ビルドが持つ型の一覧の外にあることがエラー文面に出ている。配布元の記載も手元の結果も読み込み段階の話で、生成まで到達していない。読み込みの可否だけを見た確認であり、生成の品質や速度は測っていない。標準ビルドは b9745 という1つの版でのみ試しており、他の版では挙動が違う可能性がある。本記事の測定は、冒頭に挙げた読み込み時のVRAMも含め、いずれも PrismML が配布するビルド b10685 で行った。
RTX 5080 16GBで測る
測定環境は、RTX 5080 16GB 単体 / PrismML 配布の llama.cpp ビルド b10685 / llama-bench / flash attention 有効 / KVキャッシュ f16 / 全レイヤーGPU / バッチは llama-bench の既定 (-b 2048、-ub 512) / depth 0 / 各3走行。カードの総VRAMは nvidia-smi 報告で16,303MiB。
| 項目 | PQ2_0 (2.13 bpw) | PTQ1_0 (1.75 bpw) |
|---|---|---|
| プロンプト処理 | 毎秒2,171.5トークン | 毎秒956.1トークン |
| 生成 | 毎秒86.60トークン | 毎秒83.76トークン |
| 専用VRAMの増分 | 7,627MiB | 6,483MiB |
| ピーク電力 | 319.3W | 285.0W |
| 最高温度 | 75℃ | 68℃ |
| 読み込み前の使用量 | 2,498MiB | 2,492MiB |
| 読み込み後のピーク | 10,125MiB | 8,975MiB |
読み込み後のピークは PQ2_0 で10,125MiB、PTQ1_0 で8,975MiB。総VRAMの16,303MiBに対して、どちらのファイルでも空きが残る幅で収まっている。読み込み前の使用量は2,498MiBと2,492MiBでほぼ同じ水準にあり、2つのファイルの増分は同じ土台の上で比べられる。読み込み前の使用量にはデスクトップ表示などの常駐分が含まれ、専用VRAMの増分はその常駐分を含まない読み込み前後の差、総VRAMの16,303MiBは nvidia-smi がカード全体について報告する値になる。16GBのカードに載るかどうかを見るときは、ファイルの大きさではなく、専用VRAMの増分と読み込み後のピークが目安になる。
測定は単一機・単一条件で行ったもの。プロンプト処理はトークン512本、生成はトークン128本の既定条件で、コンテキストを伸ばした場合・並列実行した場合・画像入力を与えた場合は測っていない。出力の品質も測っていないため、速度の差から品質の優劣は導けない。
本文の実測値は2026年9月18日に測定したものであり、モデル・ビルドの更新で変わりうる。ビルドは PrismML 配布の b10685、比較に使った標準ビルドは b9745。
プロンプト処理と生成では差の出方が違う
RTX 5080 での測定表を2つのファイルで比べると、開きの大きさが処理の種類ごとに違う。プロンプト処理は毎秒2,171.5トークン (PQ2_0) と毎秒956.1トークン (PTQ1_0) で倍以上の差がつき、生成は毎秒86.60トークン (PQ2_0) と毎秒83.76トークン (PTQ1_0) で差が小さい。走行ごとの内訳は次のとおり。
| 項目 | PQ2_0 | PTQ1_0 |
|---|---|---|
| ローダーの表示 | qwen35 27B PQ2_0 – 2.13 bpw (group 128) | qwen35 27B PTQ1_0 – 1.75 bpw ternary (group 128) |
| 読み込み後のサイズ | 7,195,047,936バイト | 5,935,527,936バイト |
| プロンプト処理の3走行 | 毎秒2,099.6 / 2,206.0 / 2,208.9トークン | 毎秒939.3 / 963.7 / 965.4トークン |
| 生成の3走行 | 毎秒86.83 / 87.09 / 85.88トークン | 毎秒83.62 / 83.86 / 83.80トークン |
生成側の3走行は PQ2_0 が毎秒85.88〜87.09トークン、PTQ1_0 が毎秒83.62〜83.86トークンの範囲に入り、3走行の中では両者の範囲が重ならなかった。プロンプト処理側も走行ごとの振れはあるが、2ファイルの開きに比べれば小さい。3走行ぶんの内訳であり、日をまたいだ再現性は測っていない。
ローダーが表示に出す 2.13 bpw / 1.75 bpw は、モデルカードが公称する形式ごとのビット幅と同じ値になる。ファイルサイズを総パラメータ数で割った平均とは別の量で、前者は形式固有の値、後者はファイル全体の平均という違いがある。
配布元のモデルカードが Blackwell 世代のカードについて PQ2_0 を挙げているのは、生成の速さという断面での記載になる。RTX 5080 での測定で開きが大きかったのはプロンプト処理側で、生成側の差は3走行を通じて小さかった。生成が速いのは PQ2_0 という点は RTX 5080 での測定とも一致した (3走行の範囲は重ならなかった)。ただし差は毎秒2.8トークンで小さく、モデルカードの数値は別のカードでの測定なので、差の大きさまでは突き合わせられない。
公称値と手元の値は別の測定になる
配布元が示すスループットは、資料によって数字が違う。リリースページは RTX 5090 で毎秒最大143トークンという上限値を挙げ、形式名は添えていない。モデルカードは同じ RTX 5090 について、PQ2_0 で毎秒129.9トークン、PTQ1_0 で毎秒120.5トークンと記載している。143という上限値はそのどちらとも一致せず、どちらの配布ファイルを指すかは2つの資料の記載からは決まらない。
モデルカード側の数値は、batch size 1・depth 0・vision tower なしの条件で llama-bench により測定したものとされる。掲載範囲は NVIDIA 系8枚 (RTX 5090 / RTX PRO 6000 Blackwell / H100 SXM / RTX 6000 Ada / RTX 4090 / L40S / A100 SXM / L4) が PQ2_0 と PTQ1_0 の両方、Apple 系3機種 (M5 Pro・M5 Max・M4 Pro) は PQ2_0 側のみで、Apple Silicon で測ったのは PQ2_0 だとモデルカードは記している。
上限としての表記と、条件を添えた測定値とでは、同じ配布元の数字でも読み方が変わる。
モデルカードのスループット表では、RTX 5090 や H100 では PQ2_0 の生成が速い一方、Ada 世代のカードでは PTQ1_0 の値が上回っており、カードによって速い側が入れ替わっている。
| カード (モデルカード記載の生成、毎秒トークン) | PQ2_0 | PTQ1_0 |
|---|---|---|
| RTX 4090 | 81.2 | 91.1 |
| RTX 6000 Ada | 82.8 | 90.4 |
| L40S | 74.4 | 81.8 |
| L4 | 29.8 | 32.1 |
いずれも配布元の測定値で、条件は batch size 1・depth 0・vision tower なし。本記事が測った RTX 5080 は、モデルカードのスループット表に含まれていない。手元の測定は、モデルカードの表とは別の測定として扱う。
同じ配布ページに置かれている他のファイル
同じ配布リポジトリには、Bonsai 2 27B を F16 で格納したファイルも置かれている。大きさは53.808GB (2026年9月18日時点)で、16GBのカード1枚に載る大きさではない。モデルカードが説明しているのは PTQ1_0・PQ2_0 と projector で、縮小率の記載 (PTQ1_0 で約9.0倍、PQ2_0 で約7.5倍) が基準に置く FP16 の16.0ビット・約54GB は元モデルの Qwen3.8-27B を指しており、リポジトリのこのファイルとは別の対象になる。
画像入力を扱うための projector ファイルも2つ置かれており、大きさは0.931GBと0.629GB。本記事が測ったのは、配布されている量子化ファイル PTQ1_0 と PQ2_0 の2つをテキストで動かした範囲だけで、画像入力は試していない。projector については、同じリポジトリに存在することと大きさ以外は述べない。
同じ27Bを他の量子化で載せたときの配布元の比較
モデルカードは、同じ Qwen3.8-27B を他の量子化で載せた場合との比較も表で示している。数値はいずれも配布元が測ったベンチマーク14本の平均。
| 量子化 (モデルカード記載) | サイズ | ベンチマーク14本の平均 |
|---|---|---|
| Qwen3.8-27B FP16 | 54GB | 86.32 |
| Qwen3.8-27B UD-Q4_K_XL (4ビット相当) | 17.6GB | 85.18 |
| Qwen3.8-27B IQ2_XXS (2ビット相当) | 9.4GB | 72.59 |
| Bonsai 2 27B | 5.9GB | 84.78 |
16GBのカード1枚という条件で読むと、4ビット相当の17.6GB (約16,800MiB) はファイルだけで総VRAMの16,303MiBを超える。2ビット相当の9.4GBはファイルサイズでは内側に入るが、実際に載るかは本記事では測っていない。本記事の実測では、読み込みで増えた専用VRAMがファイルサイズを上回った (PQ2_0 は7.206GBのファイルに対し増分7,627MiB、デスクトップ常駐分を含む読み込み後のピークは10,125MiB)。なお、この2ビット相当について配布元はベンチマーク14本の平均を72.59と記載しており、サイズが16GBの内側に入ることと質が保たれることは別の断面になる (いずれも配布元の測定で、本記事では回していない)。
Bonsai 2 27B の行は5.9GBで84.78。ベンチマーク表は Bonsai 2 27B を重みあたり1.72ビット・5.9GB としてモデル単位で記載しており、配布ファイルの名前は付されていない。実際に配布されているのは PTQ1_0 が1.75ビット・5.95GB、PQ2_0 が2.13ビット・7.21GB の2つなので、84.78 をどちらか一方の測定値として読むことはできない。比較表に並ぶ平均値は配布元が測ったもので、本記事ではこれらのベンチマークを回していないため、品質の優劣を自前の根拠としては述べない。
元モデル側を16GBのカードで動かしたときの数字は元モデルの Qwen3.8-27B を16GBのカードで測った結果にある (リンク先はコンテキスト4,096トークン・別の量子化形式での測定で、本記事の depth 0・llama-bench 既定条件とは条件が違う)。Q4_K_M や Q8 といった一般的な形式の間でどう選び分けるかは一般的な量子化フォーマットの選び分けで扱っている。
どちらのファイルを選ぶか
配布元のモデルカードは、Blackwell 世代のカードでは PQ2_0 を生成が速い方として挙げている。RTX 5080 はその世代にあたる。手元の条件で決める材料としては、RTX 5080 での測定表から次のように分かれる。
- 入力を読ませる量が多い使い方の場合 — 512トークンのプロンプト処理は PQ2_0 が毎秒2,171.5トークン、PTQ1_0 が毎秒956.1トークンで、開きが大きい断面になる。ただし測ったのは512トークンで、これより長い入力で同じ開きになるかは測っていない。
- 短い入力から長く書かせる使い方が多い場合 — depth 0 から128トークンぶんの生成は毎秒86.60トークン (PQ2_0) と毎秒83.76トークン (PTQ1_0) で、差は小さい。ただし測ったのは128トークンぶんで、それより長く書かせ続けた場合は測っていない。
- VRAMの空きを残したい場合 — 読み込み後のピークは PQ2_0 が10,125MiB、PTQ1_0 が8,975MiB。総VRAM16,303MiBとの差が、コンテキストを伸ばすときに使える余地の上限にあたる (コンテキストを伸ばすと KVキャッシュ以外の作業バッファも増えるため、差の全部が使えるとは限らない)。ただしコンテキストを伸ばした場合の速度と収まりは測っていない。
- 電力と温度を抑えたい場合 — ピーク電力は319.3W (PQ2_0) と285.0W (PTQ1_0)、最高温度は75℃と68℃。
出力の品質は測っていないため、どちらのファイルがよい出力を返すかは、RTX 5080 での測定からは言えない。速度・VRAM・電力の3つで見るかぎり、プロンプト処理を重く使うなら PQ2_0、空き容量と電力を優先するなら PTQ1_0 という分かれ方になる。
まとめ
判断の順序は2段になる。第一に、16GBのカード1枚で動くかどうか。RTX 5080 16GB 単体では、PQ2_0・PTQ1_0 とも読み込めて、専用VRAMの増分は7,627MiBと6,483MiB、読み込み後のピークは10,125MiBと8,975MiB (2026年9月18日測定)。ただし標準の llama.cpp ビルド b9745 では2ファイルとも読み込みに失敗しており、動かすには配布元が用意する専用ビルドが要る。
第二に、2つのうちどちらを取るか。ファイルの大きさは5.947GBと7.206GBで、モデルカードが公称する重みあたりのビット数は1.75ビットと2.13ビット。配布元は Blackwell 世代のカードでは PQ2_0 を生成が速い方として挙げている。RTX 5080 での測定では、プロンプト処理の開きが大きく、生成の差は小さかった。出力の品質、長いコンテキスト、並列実行、画像入力は測っていないため、これらの次元での優劣はここでは判断材料にならない。
よくある質問
前世代の Bonsai 27B からは何が変わったのか
配布元は、前世代の Bonsai 27B が元モデルの95%を保持していたのに対し、Bonsai 2 27B では98%を超えたと記載している。ただし前世代のベースは Qwen3.6-27B で、Bonsai 2 のベースである Qwen3.8 27B とは元モデルが異なるため、同じ元モデルに対する比較ではない。保持率どうしを直接引き算する読み方はできず、それぞれ別のベースに対する数字として読むことになる。三値量子化そのものの考え方と前世代の扱いは1ビット・三値量子化と精度の関係で扱っている。
PTQ1_0 と PQ2_0 は結局どちらが速いのか
断面によって答えが変わる。配布元のモデルカードは生成の速さについて H100・A100・Blackwell 世代では PQ2_0 を、Ada 世代のカード (RTX 6000 Ada / RTX 4090 / L40S / L4) では PTQ1_0 を挙げており、RTX 4090 では PTQ1_0 が毎秒91.1トークン、PQ2_0 が81.2トークンと、カードによって速い側が入れ替わる値を載せている。RTX 5080 で測った範囲では、生成の差は小さく、プロンプト処理の差が大きかった。ただし測ったのは512トークンのプロンプト処理と128トークンぶんの生成で、これより長い入力や長い生成での差は測っていない。
ファイルの大きさと、GPU上で増える量は同じか
同じにならない。ローダーが読み込み後に報告するサイズは PQ2_0 で7,195,047,936バイト、PTQ1_0 で5,935,527,936バイトだったのに対し、nvidia-smi で見た専用VRAMの増分は7,627MiBと6,483MiB。差の内訳は測っていない。16GBに収まるかを見るときは、読み込み後のピーク (10,125MiBと8,975MiB) と総VRAM (16,303MiB) を突き合わせるのが実際に近い見方になる。

