Qwen3.8-27Bが公開 海外「意味を持つ唯一のベンチマークは自分のものだけ」
姉妹サイトの新着
AlibabaがオープンモデルQwen3.8-27Bを公開し、DeepSWEベンチマークでOpus 4.7 Max(Claude Code使用)の40点を上回る42.2点を記録したことが海外掲示板Hacker Newsで話題になった。
RTX 5090で200トークン/秒、3090二枚構成でも110トークン/秒という速度報告が相次ぐ一方、「実際の運用ではOpusには勝てない」「意味を持つ唯一のベンチマークは自分自身のものだ」とベンチマーク自体への懐疑論も交わされた。
Qwen3.8-27B(Qwenチームによる公開告知)
We promised open weights for Qwen3.8. Now, time to meet them! 🎉
— Qwen (@Alibaba_Qwen) August 14, 2026
⚡ Qwen3.8-27B:
– A native multimodal dense model. With just 27B parameters, it outperforms Qwen3.7-Plus overall and shines in real-world coding & office workflows.
– 262K native context, easily extendable to 1M… pic.twitter.com/QuN8oWkG4C出典: twitter.com / 元記事はこちら
Unsloth の GGUF 量子化版が上がっている: https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
Unsloth のモデルを使うのは、公式の https://huggingface.co/Qwen/Qwen3.8-27B-FP8 と比べて何か利点があるんだろうか?
量子化版それぞれを、元のモデルと同じテストでベンチマークしてほしい。そうすれば性能を比較できるのに。
サイズ差が圧倒的なことを考えると、これは驚異的だ。もっとも、小さいQwenモデルが階級以上の力を出すのは知られている話ではある。
ログインせずに画像を見るための代替リンク: https://xcancel.com/Alibaba_Qwen/status/2088280182356611304
> 中間として A5B でも A8B でも
みんなアクティブパラメータ数にこだわっているのは何なんだ? 重みをいじったりしているのか?
総パラメータ数は必要なVRAM量を決め、アクティブパラメータ数は動作速度を決める。うちの10年前のGPUは量子化した35Bや27Bを読み込めるが、1トークンあたり27Bパラメータを処理する速度は2〜4トークン/秒しか出ない。一方 A3B なら40トークン/秒以上出る。
この手のモデルはCPUでもそこそこ現実的な速度で動かせる。
数日中に出るであろう MTP 版を待つのがいい。私は128GBの Strix Halo機を使っていて、3.6-27B の8ビット版で9トークン/秒程度(お世辞にも良くない)だった。MTP なら18トークン/秒近くまで上がる(どうにか実用になる水準)。
MTPLX を試して、コンテキストサイズを絞るといい。
私は 3.8-122B の MoE 版に期待している。
9Bや10Bクラスの言語モデルの使い道を教えてもらえないか? たとえば気の利いた bash コマンドを出させるために LoRA を学習させる、くらいしか思いつかないのだが。
GLM 5.3 のときもそうだったが、事後学習にはまだ相当絞り出せる余地が残っているようだ。
最近まさに似たことをやろうと考えていた。要するに Qwen に見えたものを説明させて、それを Flash に渡しているということ? Flash に LoRA なり視覚ヘッダなりを足すことも検討したが、うまく仕上げるには時間がかかりそうだった。DSv4 Flash がマルチモーダルだったら、しばらくモデル探しは終わりにできるのだが。
Gemma モデルは Google の「Vertex AI」で使えたはずだ。
https://x.com/sgl_project/status/2088281320422322413
YouTube に、神がかったハードウェアではなく市販の機材でLLMを動かして一連のテストをする、地に足のついた人がいる。近いうちにこれもテストするだろう。
https://www.youtube.com/@lukesdevlab
求めているものかどうかは分からないし、いつものことだが体験は人によって違うだろう。
他サイトの新着
投機的デコードを使えば軽く100トークン/秒を超えるはずだ。うちの3090二枚構成では、qwen 3.5 27b が https://github.com/noonghunna/club-3090 の設定で110トークン/秒あたり出ていた。5090一枚なら200トークン/秒、Opus の4倍速ということになる。
https://x.com/radixark/status/2088285681131110446
開発者に5090を2枚積んだ箱が配られて「これを使い倒せ」と言われる日も近い。
視覚推論が強いらしく、これはうれしい。ただ音声はまだネイティブ対応していない。`gemma-4-12b-qat` のような、本当の意味でのマルチモーダル(テキスト・画像・動画・音声)を目指す姿勢を、もっと多くの企業に受け継いでほしい。
「良い」知らせとして、アーキテクチャ上の新要素は何もないようだ。Qwen 3.5 や 3.6 と同じなので、llama.cpp から見れば違いはない。
> アーキテクチャ設計には GLM-5.3(旧 Deepseek v4 pro 0813)で落ち着いた
おい、GLM-5.3 は*今日*リリースされたばかりだぞ。この文脈で「落ち着いた」という言い方はおかしい。
だから「旧 deepseek v4 pro」と書いている。今朝試してみて特に不満はない。そもそも glm 5.2 も気に入っていた。
> ……しかし違う。実際の運用ではOpusには勝てない
同意するが、それならそれを明確に示す意味のあるベンチマークが必要だ。そうでなければ、本来は定量的に紙に書き出せるはずのことを、身振り手振りで語っているだけになる。
企業で言語モデルを使っているなら、信頼できる評価セットを自前で用意して、新しいモデルの検証に使うのが非常に良い。ときどき本番データで較正もする。うちにも独自のものがあり、品質とコストについて私が信用している数字は、この仕組みから出てきたものだけだ。
かつて賢人が言った。「数えられるものすべてが重要なわけではなく、重要なものすべてが数えられるわけでもない」
結局のところ、意味を持つ唯一のベンチマークは自分自身のベンチマークだ。
この話題の背景と論点
Qwen3.8-27Bは、SWEベンチ系のDeepSWEで42.2点を記録し、比較対象のOpus 4.7 Max(Claude Code使用)の40点をわずかに上回ったとして話題になった。27Bという比較的小さい密モデルでこの数値が出た点、またRTX 5090で200トークン/秒、3090二枚でも110トークン/秒という報告が、個人のローカル環境での実用性への期待を後押ししている。
スレで意見が割れたのは、この差をどう評価するかという点だ。「自宅にOpus級モデルがある」と歓迎する声がある一方、「実運用ではOpusに勝てない」「意味を持つベンチマークは自分自身のものだけ」という懐疑論も根強く、単一ベンチマークの僅差を過大評価すべきでないという指摘が出ている。
見落とされがちなのは、話題の42.2点が公式のFP8版によるものであり、実際に多くのユーザーが使うUnslothなどのGGUF量子化版では同条件での再計測がまだ行われていない点だ。またアーキテクチャ自体はQwen3.5/3.6から変更がなく、性能向上は訓練データや手法によるものと推測される段階にとどまる。
※本記事は5ch(Hacker News)スレッド「Qwen3.8-27B」より抜粋・要約して構成しています。






まだコメントはありません。