IT・AI
2026年9月18日
AIモデルを9分の1に圧縮した「Bonsai 2」、海外で妥当性を巡り論争
PrismMLが公開した「Ternary Bonsai 2 27B」は、270億パラメータのモデルを1.76ビット相当まで圧縮しながら、性能の劣化をほぼ抑えたとするモデルだ。GGUF形式で配布され、Hugging Face上の比較表ではUD-Q4_K_XLという通常の4bit量子化モデルとほぼ同等の性能を示すという。Hacker Newsのスレッドでは、この「9倍の圧縮」が既存の2bit量子化と何が違うのかを巡って技術的な検証が交わされたほか、Mac miniやRTX 5090など手元の環境で実際に動かした速度報告も相次いだ。
Bonsai 2 27B: 9分の1の軽量化でほぼ無劣化の圧縮を実現
出典: prismml.com / 元記事はこちら
3
海外の名無しさん
2026-09-18 00:53
企業向けの大規模版「Big Bonsai」を作ってDSV4 Flashなどと張り合ってほしい
24
海外の名無しさん
2026-09-18 00:55
>>3 言うなれば「木」だね
4
海外の名無しさん
2026-09-17 22:46
「Ternary Bonsai 2 27BはグループごとのFP16スケーリングを伴う三値{-1,0,+1}の重みを使い、実効1.76ビット/重みを実現」とあるが、記憶が正しければ最近の投稿[1]で、同じQwenベースモデルのQ2量子化(2.6bpw程度)は『明らかに劣化する』と『Q1は使い物にならない』の境界にあると示されていた。Bonsaiのブログ記事をざっと見たが、『一般的な』量子化との比較や、何が優れているのかの説明が見当たらない。https://news.ycombinator.com/item?id=49611128
25
海外の名無しさん
2026-09-18 00:00
>>4 Hugging Faceのページに、FP16・UD-Q4_K_XL・IQ2_XXSと比較した表がある(ドロップダウンを開く必要あり)。この表によれば、OCRを除けばUD-Q4_K_XLと同等の性能とされている。
26
海外の名無しさん
2026-09-17 22:53
>>4 単純な量子化は4bpwを下回ると破綻するが、QATに近い高度な手法を使えばもっと下げられるという話だと思う。ただしBonsaiの量子化手法は非公開だ。
27
海外の名無しさん
2026-09-17 23:10
>>4 1.76bpwという数字は、そのままIQ2/Q2と比較するとやや誤解を招く。エンコーディングは三値だが、量子化の手順ははるかに高度だ。まず重みを量子化に適した基底に回転させてから、グループごとのスケールと誤差補正を使って三値化している。
6
海外の名無しさん
2026-09-17 22:42
いいね!このモデルのUnsloth版量子化と比べてどうなのか知っている人はいる?
https://unsloth.ai/docs/models/qwen3.8#run-qwen3.8-guide
30
海外の名無しさん
2026-09-17 23:57
>>6 自分も同じことを聞きたかった。ざっくりした理解だが、Unsloth方式はファイルサイズが大きくなる代わりに精度がやや高く、PrismML方式は別のアプローチで小さいサイズを実現している(その分精度は落ちるはず)ようだ。
8
海外の名無しさん
2026-09-17 23:56
Appleとの交渉がどうなったのか気になる。GPUだけでなくTPUで動かせるかどうかに一番興味がある。GPUはそれに比べてバッテリーの消費がかなり大きいので。
9
海外の名無しさん
2026-09-18 00:33
必要なRAMは?自分の経験則では『パラメータ数と同じバイト数』だが、さすがにその9分の1(約3GiB)では動かないと思う。あと速度はどれくらい上がるのか?
35
海外の名無しさん
2026-09-18 00:35
>>9 RAMは約7.9GB、RTX 6000 Pro Blackwellで120トークン/秒出ている。
11
海外の名無しさん
2026-09-17 23:30
Mac Mini M2 16GBで7〜8トークン/秒(プリフィルは約60トークン/秒)。今のところBonsai 1 27Bより賢く感じる。Q1_0量子化よりわずかに大きいサイズだ。かなりワクワクする内容だ。
12
海外の名無しさん
2026-09-17 21:26
16GB GPUを使っている人には嬉しい話だ。3.8の27Bはすごいモデルだが32GB未満ではまともに動かなかった。手元のIntel B50(16GB)に読み込ませて試してみる。今のところXPUコアでこの量子化が高速化できるかは分からないが、そのうち対応するかもしれない。
37
海外の名無しさん
2026-09-17 21:53
>>12 コンテキストサイズにあまりこだわらなければ、4bit程度の量子化は24GBで動く。今回のモデルはそれより良くなることを期待したいが、公称のサイズでそこまで性能が上がるなら相当驚きだ。ベンチマークの詳細をもっと見たい。
49
海外の名無しさん
2026-09-17 22:00
>>37 自分はRX 7900 XT(VRAM20GB)でUnsloth版UD-Q4_K_Sを動かしていて、KVキャッシュを量子化しなければ約9万トークンのコンテキスト、8bit量子化なら約13万4千トークンのコンテキストウィンドウが使える。スロットは1つだけだが、自分の用途には十分で、ウィンドウの埋まり具合によって20〜35トークン/秒出る。
13
海外の名無しさん
2026-09-17 22:11
近いうちにQwen 3.8系ベースの8B版を出してほしい。それがあればスマホで直接動かせる強力なモデルになる。
38
海外の名無しさん
2026-09-17 23:22
>>13 そのためにはまずAlibabaがQwen 3.8の8B版を出す必要がある。
39
海外の名無しさん
2026-09-17 22:35
>>13 それだ!あとHugging FaceのfusedなWebGPUランナーがあれば速く動くはず!
14
海外の名無しさん
2026-09-17 23:24
慎重ながら期待している。V1は一般知識の面で明らかに弱かったが、今回のベースであるQwen 3.8自体がもともと一般知識より推論寄りのモデルなので、あまり問題にならないかもしれない。
15
海外の名無しさん
2026-09-17 23:58
DS4.1 Flashでも同じことをやってほしい。そうすればSparkやStrix Haloのような128GB環境に収まるところまで小さくできる。
16
海外の名無しさん
2026-09-17 21:27
ローカルモデルの動向はあまり追っていないが、これはかなりすごそうだ。Apple Siliconでも動かせるのか?
40
海外の名無しさん
2026-09-17 21:47
>>16 最初の27B版BonsaiはiPhoneでも動いていた。
41
海外の名無しさん
2026-09-17 21:28
>>16 「Ternary Bonsai 2 27BはNVIDIA GeForce RTX 5090で最大143トークン/秒、M5 Maxで46.8トークン/秒に達する。RTX 4090では1トークンあたりわずか0.714ミリワット時しか消費せず、フル精度の8Bモデルより40%省電力だ」とのこと。
17
海外の名無しさん
2026-09-17 22:32
Qwen3.8-Next版を作れば、5090一枚に収まるのでは?
18
海外の名無しさん
2026-09-17 22:00
1000億パラメータ超のモデルから始めて30GB未満まで縮めるBonsaiモデルが見てみたい。でもそこまでいったら『トピアリー』と呼ぶべきかもしれない。
42
海外の名無しさん
2026-09-17 23:26
>>18 他に思いつく名前としては『果樹園』『森』『林』あたりかな。
19
海外の名無しさん
2026-09-17 22:58
(昨日の圧縮に関する投稿[1]を覚えている人向けに補足すると、確認した限りこのモデルはさらなる圧縮の対象にはならない。ゼロに偏った分布では全くない。) [1] https://news.ycombinator.com/item?id=49732931
21
海外の名無しさん
2026-09-17 22:53
>>2 それを使って自転車に乗るペリカンのSVGを生成してみた。18分20秒かかった。5.5GBのモデルファイルとしてはなかなか悪くない。
22
海外の名無しさん
2026-09-17 22:56
>>2 その手順はどこで手に入れたのか?向こうにはsetup.shというスクリプト付きのデモリポジトリがある。あなたが挙げているリリースタグや重みファイルは、彼らが書いているものと一致していない。
43
海外の名無しさん
2026-09-17 23:07
>>22 Hugging Face上のGGUFから自分で試行錯誤して見つけた手順だ。もっと良い手順が見つかって、それでうまくいくならそちらを使ってほしい。個人的には、中身を確認しないといけない./setup.shのようなスクリプトを実行するより、モデルを直接ダウンロードする方が好みだ。
32
海外の名無しさん
2026-09-17 22:29
>>7 サイズではなく速度の話なら『9倍速い』と言うのは全く問題ないと思う。『9分の1のサイズ』が直感に反するというのには同意しかねる。自分にはしっくりくる。
47
海外の名無しさん
2026-09-17 23:33
>>32 『9倍』は文字通り9倍に増えることを意味するが、ここでは9で割っている。この言い回しが定着しているので理解不能というわけではないが、無駄にぎこちない。『サイズ削減の増加が10メガバイトになった』と言っているようなものだ。
36
海外の名無しさん
2026-09-17 23:58
>>10 プリフィルの速度はどれくらい出ている?
48
海外の名無しさん
2026-09-18 00:41
>>36 PTQ_01で450、もう一方のPQ2_0で900出ている。
44
海外の名無しさん
2026-09-18 00:43
>>26 GGUFがQTIP形式を実装していればもっと良くなっていたはずだ。GGUFの表現形式はllama.cppの量子化性能にとって大きな制約になっている。
55
海外の名無しさん
2026-09-18 00:48
>>44 どのみち彼らは自前のllamaフォークを使っているので、それは関係ないはずだ。
50
海外の名無しさん
2026-09-17 21:53
>>41 5090への言及はちょっと妙だ。32GBのGPUならQ6が収まって、しかも品質はそちらの方が良いのだから。とはいえ16GBのGPUにとっては非常に興味深いモデルだ!
57
海外の名無しさん
2026-09-17 22:17
>>50 5090への言及は速度に関するものだ。Q6ではその速度は出ないのでは?そして多くの用途では速度がかなり重要になる。
51
海外の名無しさん
2026-09-17 22:30
>>41 それは『私の冷蔵庫は机から2ミリキロメートル離れている』と言っているようなものだ。m=0.001、h=3600なのだから、単にWsかJで表すべきだ。
58
海外の名無しさん
2026-09-17 22:41
>>51 ミリワット時の何がいけないんだ?
この話題の背景と論点
Ternary Bonsai 2 27Bは、Alibabaの「Qwen 3.8」27Bモデルをベースに、重みを{-1,0,+1}の三値へ変換して1.76ビット相当まで圧縮したモデルで、前作「Bonsai 1」の後継にあたる。Hugging Face上の比較表では、通常の4bit量子化(UD-Q4_K_XL)とほぼ同等の性能をOCR以外で示すとされる。スレで割れたのは、この圧縮率をIQ2やQ2など既存の低ビット量子化とそのまま比べてよいかという点で、PrismML独自の量子化手順(基底の回転や誤差補正)が非公開である以上、性能の裏付けが十分か疑問視する声があった。また「9倍小さい」という表現そのものが、比率の割り算を「倍」で表す慣用表現として不自然だという言葉遣いを巡るやり取りも起きている。TPUやApple Siliconでの正式対応は言及があるのみで、まだ確定した情報ではない点は読者が留意すべきところだ。
※本記事は5ch(Hacker News)スレッド「Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint」より抜粋・要約して構成しています。
この記事のリアクション
まだコメントはありません。