RTX4090で125Bモデルが100トークン/秒、量子化の精度にHNで賛否

姉妹サイトの新着

Hacker Newsで、MoE型の大規模言語モデル「Qwen3.8 Flash Next」(総パラメータ125B)を一般向けGPU・RTX4090上で毎秒100トークン超の速度で動かせるという推論ツール「Strata」が話題になった。投稿者は自身の環境(RTX4090・DDR5 128GB・Ryzen 7950X3D)で124トークン/秒を記録したと報告。スレッドでは既存の同種ツール(DwarfstarやFreeToken)との違いや、速度の代償となる量子化(Q2・Q4)がモデルの精度をどこまで落とすのかが主な論点になり、意見が分かれた。

コンシューマー向けハードウェア(RTX4090)でQwen3.8 Flash Next(125B)を100トークン/秒で動かす

出典: github.com / 元記事はこちら

2 海外の名無しさん 2026-10-04 14:02
Dwarfstarはすでにこれに対応している。比較してみたいところだが、自分はq4量子化版を毎日使っていて、普通に快調に動いている。 https://github.com/antirez/ds4/blob/main/docs/MODELS.md#qwen…
3 海外の名無しさん 2026-10-04 13:33
> 『このPCにStrataをセットアップして』: https://github.com/Niko1221/Strata のdocs/AI_SETUP.mdに従って。 ――bashにパイプするのもヤバいと思ってたのに、これは輪をかけてヤバいな
16 海外の名無しさん 2026-10-04 13:46
>>3 bashにパイプする方が確実にマズい。bashにはプランモードが無いからね。エージェントも普通は何も黙って実行したりしない。悪くてもログで変なことをしてるのが見える程度だ
17 海外の名無しさん 2026-10-04 13:34
>>3 最初は驚いたけど、setup.pyとsetup.shを読んで何をしてるのか理解した
4 海外の名無しさん 2026-10-04 14:11
最近ローカルLLM用の推論エンジンがAIで量産されすぎてる。どれも対応範囲は狭いけど、llama.cppより速い。llama.cppも戦略を考え直す時期なんじゃないか
5 海外の名無しさん 2026-10-04 12:51
試してみたら驚くほど快調だった。自分の環境(RTX4090、DDR5 128GB、Ryzen 7950x3d)だと124トークン/秒出てる。せっかくなので共有。 https://huggingface.co/Qwen/Qwen3.8-Flash-Next
19 海外の名無しさん 2026-10-04 13:45
>>5 何が『驚くほど』なんだ? Anthropicのモデルより2.5倍速くて、データも自分の手元に残せて、プライバシーも確保できて、しかも強いモデルだ。むしろベストケースだと思うけど
20 海外の名無しさん 2026-10-04 13:03
>>5 Qwen 3.8 27Bと比べてどう? ハーネス付きの蒸留版とフルMoE版を比較したいんだけど
6 海外の名無しさん 2026-10-04 14:05
GLM 5.3と比べて実用面でどうなんだろう? 知ってる人いる?
7 海外の名無しさん 2026-10-04 13:55
Q2量子化か。それなら興味ないな
21 海外の名無しさん 2026-10-04 14:19
>>7 低スペック機向けを謳って『100トークン/秒』とアピールしてるこの手のプロジェクト、どれも中身は同じ2bit量子化でしかない。しかも精度の数値を載せてるところは見たことがない。4bitが下限だと思う
9 海外の名無しさん 2026-10-04 13:25
FreeTokenという推論エンジンでこれ、1か月前のリリース時にもう動かしてたよ。 https://github.com/FlashML-org/FreeToken
10 海外の名無しさん 2026-10-04 13:39
3090で試してるけど爆速。自分が投げてるタスク(PHPコードベースのセキュリティ監査)でも結構いい仕事する
11 海外の名無しさん 2026-10-04 13:39
これもまた、実はClaudeがKVキャッシュをq4以下に量子化してた、みたいなリポジトリの一つじゃないのか? READMEには書いてないけど、全部AI生成っぽいし…
12 海外の名無しさん 2026-10-04 13:15
こういう量子化モデルの『実質的な知能』を誰か計測した人いる?
23 海外の名無しさん 2026-10-04 13:23
>>12 READMEにいくつか情報があるよ。例えば『Coder: 半分のエキスパートを削除したコーディング特化版。作者の計測によるとSWE-bench Verifiedでフルモデルの91%のスコアを達成し、RAM32GBに収まる』 https://github.com/Niko1221/Strata#which-model-should-i-pick
34 海外の名無しさん 2026-10-04 13:40
>>23 このCoder、Qwen 3.8 27Bと比べてどうなんだろう。メモリ要件が同じくらいなのに、本当にそれより良くなり得るのか?
35 海外の名無しさん 2026-10-04 14:08
>>23 92%は99%までの道のりの半分くらいだからな。十分健闘してると思う
13 海外の名無しさん 2026-10-04 13:49
自分としては、99%の人が買えないようなハードウェアで高価な大規模モデルがどれだけ良いかより、Chromebookや8GB RAMのスマホで一番よく動くものが見たい
25 海外の名無しさん 2026-10-04 14:21
>>13 低VRAMで動くモデルがあまり話題にならないのは、単純に『使う価値がない』からだよ。Qwen3.8 27Bでそれが変わったけど、それでも24GB VRAMじゃ足りない。今は12GB VRAMでもっと良いモデルをもっと速く動かせる時代で、だからみんなそっちの話をしてる
26 海外の名無しさん 2026-10-04 13:53
>>13 Ternary Bonsai 2が向いてるかもしれない
14 海外の名無しさん 2026-10-04 13:16
生成速度はMoEのオフロードにとっては楽な方の指標だけど、16kコンテキストでのプロンプト処理速度はどれくらい?
27 海外の名無しさん 2026-10-04 13:55
>>14 Q2_0はRTX2060(VRAM8GB)で、デコードが33トークン/秒、プロンプト処理は128kコンテキストで約600トークン/秒。ISTA IQ3_XXSはデコードが約21トークン/秒、プロンプト処理は約240トークン/秒
28 海外の名無しさん 2026-10-04 13:28
>>14 コミュニティのベンチマーク結果が公開されてるよ https://github.com/Niko1221/Strata/tree/main/bench/results
22 海外の名無しさん 2026-10-04 13:54
>>12 最近の論文を見てみて。『Quantization Degradation in Large Language Models: A Signal-Noise Perspective』。劣化の度合いは要因によって大きく変わるとしていて、4bit量子化はだいたい性能を維持できるけど、2bitは広範な劣化を引き起こすことが多いとのこと。このリポジトリは2bit量子化を使い、さらに最速・最小のモデルではエキスパートの一部を削除している。そのへんを踏まえて判断してほしい [1]: https://arxiv.org/abs/2608.08188
33 海外の名無しさん 2026-10-04 14:01
>>22 自分もq2量子化でエキスパートを削った版を作ったことがある。限られたハードウェアでは良い性能が出たけど、品質の劣化はかなり大きかった
29 海外の名無しさん 2026-10-04 14:20
>>15 興味深いのは、Q4で十分そうに見えること。4bit浮動小数点で推論に十分な性能が出る理由って何かあるのかな?
37 海外の名無しさん 2026-10-04 14:25
>>29 新しいモデルは8bit/4bit量子化を前提に学習されてる。『ネイティブ』が8bitなら、そこから4bitに落とすのは、ネイティブがフルbf16の場合に8から4に落とすのと比べて、そんなに大きな落差じゃない

他サイトの新着

30 海外の名無しさん 2026-10-04 14:18
>>15 その通りだけど、単純な用途には十分使える。ds4+Qwen3.8をQ4_Kで試すといいと誰かが言ってたから、自分もそれを試してみるつもり
31 海外の名無しさん 2026-10-04 13:23
>>20 Qwen 3.8 Flash Nextは27Bよりずっと良い。もうClaudeを使わなくなったくらい良い
39 海外の名無しさん 2026-10-04 13:26
>>31 同意。自分もPiで動かしてるけど、下位モデルと比べてそこまで違いは感じなかった――ただ速度は別格
32 海外の名無しさん 2026-10-04 13:47
>>20 性能も実用面も明確に上。3.8 27Bは良い小型モデルだけど、こっちは良いモデルそのもの
40 海外の名無しさん 2026-10-04 13:53
>>32 自分は27Bの方が正確だと感じる――NVFP4じゃなくFP8で動かしてるからかもしれないけど。Flash Nextは15万トークン前後のコンテキストになるとスペルミスが出てくる。.mdファイルの指示を無視することもある。他の人はそういうの気づいてないかな
36 海外の名無しさん 2026-10-04 13:28
>>23 おお、これは面白くなってきたな!
41 海外の名無しさん 2026-10-04 13:42
>>38 これは面白い、ありがとう。 https://github.com/Neroued/ninfer
42 海外の名無しさん 2026-10-04 13:43
>>39 最近Deepseek Harnessで27Bを動かしてるけど、パラメータは何も変えてないのに、使ってるだけでモデルがさらに賢く感じる
43 海外の名無しさん 2026-10-04 14:17
>>40 スペルミス? Flash Nextにはどの推論エンジン使ってる?

この話題の背景と論点

Qwen3.8 Flash Nextは中国Alibaba系のQwenが出したMoE(混合専門家)型の大規模言語モデルで、総パラメータは125Bだが推論時に実際に動く専門家は一部だけのため、見た目の規模より少ない計算量・メモリで動かせる。今回話題の「Strata」はこれを個人のGPU一枚に収めるための量子化・推論ツールの一つで、同種のプロジェクト(Dwarfstar、FreeTokenなど)が次々登場している流れの中にある。スレッドで割れたのは、速度を優先するQ2量子化がどこまで精度を犠牲にしているかという点で、公開された速度の数値には精度の劣化幅が示されていないという指摘が出た。一方で、近年のモデルは8bitや4bit量子化を前提に学習されているため4bit程度までの劣化は小さいとの意見もあり、どの量子化幅を「実用」と見るかは論者によって分かれたままだった。

※本記事は5ch(Hacker News)スレッド「Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s」より抜粋・要約して構成しています。

この記事のリアクション

他サイトの新着

まだコメントはありません。

コメントする

誹謗中傷・個人を特定する書き込みは削除対象です。投稿は承認後に表示されます。

相互リンクサイト新着記事