Cerebrasが新モデルを秒間1500トークンで提供、海外の反応

姉妹サイトの新着

他サイトの新着

推論チップメーカーのCerebrasが、Qwen 3.8 27Bというモデルを秒間1500トークンという速度でAPI提供し始めたことがHacker Newsで話題になった。これは同種のサービスの中でも際立って速い数値で、OpenRouter経由の最速プロバイダーが約80トークン/秒、競合のMixlayerが150〜200トークン/秒とされる中での数字だ。スレでは速度そのものへの驚きに加え、なぜCerebrasが超巨大モデルではなく中規模モデルばかりホストするのかという技術的な疑問、プロンプトキャッシュを使っても料金が下がらない点への戸惑い、Discordしかないサポート体制への不満などが交わされた。

Qwen 3.8 27BがCerebras上で秒間1500トークンの速度で使えるようになった

出典: inference-docs.cerebras.ai / 元記事はこちら

2 海外の名無しさん 2026-09-03 19:21
ついこの前ninfer(https://github.com/Neroued/ninfer)というものを知ったんだけど、RTX 5090で今は約200トークン/秒、同時リクエストなら400トークン/秒以上出せる。ローカルで動かすモデルとしてはこの強さなら十分速い。
3 海外の名無しさん 2026-09-03 18:50
OpenRouter経由でもこのモデルの推論キャパシティを提供してくれたら嬉しい。OpenRouterで今一番速いプロバイダーでも約80tps止まり(https://openrouter.ai/qwen/qwen3.8-27b#providers)。CerebrasはOpenRouterで他のモデルもホストしているから、そのうちQwen3.8も来るかもしれない: https://openrouter.ai/provider/cerebras
20 海外の名無しさん 2026-09-03 19:05
>>3
うちは150〜200トークン/秒くらいで提供してるよ(新しい投機的デコード実装をDFlash2のドラフトモデルで使ってる)。https://mixlayer.com、プロモコード「LAUNCH-Q38-27B」で5ドル分のクレジットがもらえるから、試しに使ってみて。
4 海外の名無しさん 2026-09-03 18:37
彼らのCoding Planを数ヶ月使ってた。モデルの進化についていくのが本当に大変なくらい出力が速い。Qwen 3.8 27Bはおそらく彼らがホストしてきた中で最強クラスのモデルだと思う。
追記: どうやらAPIトークン課金でしか使えないみたい。プロンプトキャッシュはもう導入されてるのかな? エージェント的なコーディングタスクだとキャッシュ無しではかなり高くつくんだよね。
21 海外の名無しさん 2026-09-03 18:46
>>4
プロンプトキャッシュには対応してるみたいだよ: https://inference-docs.cerebras.ai/capabilities/prompt-cachi…
22 海外の名無しさん 2026-09-03 19:04
>>4
公開エンドポイントでホストしてる中では最強のモデルってだけ。OpenAI向けにはGPT 5.6 Solの爆速版を用意してるし、専用エンドポイントではもっと大きいオープンモデルも扱ってる。
23 海外の名無しさん 2026-09-03 19:04
>>4
Coding Planってもう無くなったんじゃなかったっけ?
5 海外の名無しさん 2026-09-03 18:54
1500トークン/秒って狂ってるな。俺の脳みそなんて1分に2トークンくらいしか出せなくて、しかもその半分は「えーと」だよ。ついにシンギュラリティに到達したわ
26 海外の名無しさん 2026-09-03 19:19
>>5
君の脳は常時アップデートされながら身体全体を維持してるんだぞ。LLMは静的なだけ。
とはいえ1500トークン/秒は確かに狂ってる
27 海外の名無しさん 2026-09-03 19:05
>>5
君の脳は洗濯もパスタを茹でることもできる。まだまだ道のりは長いよ
28 海外の名無しさん 2026-09-03 19:04
>>5
Qwen 3.8の推論トレースを読むと、あっちも「えーと」とか「いや、待てよ…」ばっかり言ってるけどね
7 海外の名無しさん 2026-09-03 18:46
サポート窓口がDiscordしか無いのは本当に勘弁してほしい。しかもDiscordが俺をボット扱いして、メールも電話番号も受け付けてくれない
29 海外の名無しさん 2026-09-03 19:02
>>7
そういう問題こそDiscordのサポートで直せるはずだよ
11 海外の名無しさん 2026-09-03 19:09
もう1年以上ユーザーで、Coding Planも使ったことがある。普通のコーディング用途だとopencodeを使ってる場合はレート制限(RPM)がやや少なめだから、いずれ詰まると思う。プロダクトやAPI用途としては十分良い。
12 海外の名無しさん 2026-09-03 18:47
(今さっきアカウント作れた人いる? 試したらオンボーディングがリダイレクトループに入っちゃうんだけど)
(追記: 解決した。support@から返信が来て、俺のメールドメインがブラックリストに入ってたらしい。俺だけの問題だった(もう解決済み))
30 海外の名無しさん 2026-09-03 18:58
>>12
うん、Googleでサインインしたらいけたよ
13 海外の名無しさん 2026-09-03 18:41
なんで2.4Tのバージョンじゃなくて小さいモデルばかりホストするんだろう? ウェハー同士のI/Oやインターコネクトが、あの巨大チップのサイズに対して限られたスペースのせいで良くないのかな?
31 海外の名無しさん 2026-09-03 18:44
>>13
彼らは巨大な推論チップを作ってる会社だからね。推論サービスは基本的にハードウェアという本業の宣伝みたいなもの。
CEOが数年前にGradient Dissentに出演してた: https://www.youtube.com/watch?v=qNXebAQ6igs
32 海外の名無しさん 2026-09-03 18:51
>>13
ウェハー上には44GB分のSRAM分のスペースしか無い。RAMをオフロードすると、全部を1チップに載せる(それこそがCerebrasの存在意義)ことによる高速化のメリットが失われる。
33 海外の名無しさん 2026-09-03 18:42
>>13
大部分は経済的な事情だと思うよ
14 海外の名無しさん 2026-09-03 19:06
プロバイダーとモデルの組み合わせごとに、タスク完了までの時間を比較できる一番良いベンチマークやランキングって何がある?
15 海外の名無しさん 2026-09-03 18:59
あれ、落ちてるかも: Qwen 3.8 27Bにメッセージを送ったら「サーバーに接続できません。接続を確認してもう一度試してください」って出た。
16 海外の名無しさん 2026-09-03 19:12
その場でカスタムソフトウェアを作るというアイデアが現実になりつつあるね
17 海外の名無しさん 2026-09-03 19:00
この速度だとエージェント的なタスクにはちょっと値段が高すぎる。
34 海外の名無しさん 2026-09-03 19:18
>>17
ターゲット層は生の速度を求めている人たちだよ。
選択肢があるのは良いことで、速度・性能・品質のあいだでトレードオフを選べる。
去年までは、みんな信じるAI神様が1つだけだった(だいたいAnthropicのやつ)。今はオープンウェイト、最先端、速度特化など、システム設計と同じように選択できる力がある。
18 海外の名無しさん 2026-09-03 18:48
普通の人: tok/s または t/s
サイコパス: tok/SEC
35 海外の名無しさん 2026-09-03 18:54
>>18
まあ確かに、Caps Lockが付けっぱなしだったわ /o\
36 海外の名無しさん 2026-09-03 18:49
>>18
俺はtpsって言う派
19 海外の名無しさん 2026-09-03 18:43
GLM4.7で彼らのCode製品を使ったことある。面白いけど、モデル自体がイマイチだとあまり役に立たない。
Codeにもこういうモデルを追加してくれるといいな 🙂
37 海外の名無しさん 2026-09-03 18:47
>>19
うん、このスピード感からするとGLM 4.7はもう一昔前のものだよね

他サイトの新着

24 海外の名無しさん 2026-09-03 18:40
>>4
同意だけど、うちのSaaSだとこれでUXが一段階跳ね上がる部分があると思う
25 海外の名無しさん 2026-09-03 18:47
>>4
昔月額プランがあったと思うんだけど、あれってどうなったの?
38 海外の名無しさん 2026-09-03 19:20
>>20
プロモコードを入力する場所が見つからないんだけど?
39 海外の名無しさん 2026-09-03 19:10
>>21
それをやっても値段自体は下がらないけどね。
40 海外の名無しさん 2026-09-03 19:08
>>21
「キャッシュされたトークンの料金は?」
「プロンプトキャッシュの利用に追加料金は一切ありません。入力トークンは、キャッシュから提供されたものでも新規に処理されたものでも、該当モデルの標準入力トークン料金で課金されます」
いや、これはこれで話をひっくり返してくるな。
47 海外の名無しさん 2026-09-03 19:17
>>40
へえ
速度が上がるってこと? それとも「うちの側ではキャッシュしてるかもしれないけど、あなたへの割引は無いよ」っていう単なるマーケティング上手いこと言ってるだけ?
41 海外の名無しさん 2026-09-03 19:20
>>23
前回もらった時は、Discordサーバーにログインして「ドロップ」を待つ必要があって、確かDaniel Kimがその場にいた人にランダムで配ってた記憶がある。1分もしないうちに無くなってた。8ヶ月くらい前の話。
42 海外の名無しさん 2026-09-03 19:17
>>27
(追加の肉体パーツは別売りです)
45 海外の名無しさん 2026-09-03 18:56
>>32
複数のウェハーにパイプライン処理させれば、もっと大きいモデルもホストできるはず。各ウェハーが1層を担当して、N層あればN×44GBのモデルをN並列で提供できる。制約になるのはウェハー間のI/Oで、それがまさに自分が言いたかったこと。GPT 5.6 Solみたいなもっと大きいモデルもこうやって提供してるんだと思う[1]。
[1] https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultraf…
48 海外の名無しさん 2026-09-03 19:08
>>45
オフロードが不可能だとは言ってない。ただ大きな速度低下が起きるってこと。
他社が27B版をホストしてCerebrasより高いTPSを見せつけたら、Cerebrasとしては格好悪いだろうね。

この話題の背景と論点

CerebrasはSRAM上にモデル全体を載せて動かす「ウェハースケールエンジン」という特殊な推論チップを作る会社で、通常のGPUクラスタとは方式が違う。スレで指摘されている通り、1枚のウェハーに載るSRAMは44GB程度とされ、これがQwen 3.8 27Bのような中規模モデルは載せられても、2.4Tパラメータ級の巨大モデルをそのまま置けない理由になっている。複数ウェハーに層を分けて載せる方法もあるが、ウェハー間I/Oがボトルネックになるという指摘は技術的に筋が通っている。もう一つの論点はプロンプトキャッシュの扱いで、Cerebrasは「キャッシュされたトークンも通常の入力料金のまま」と明言しており、これは他社が採用する「キャッシュ分は割引」という慣行とは異なる。速度面のメリットがあるのか、単なる据え置き課金なのかがレスの中でも決着していない。またDiscordのみのサポート体制やアカウント作成時のトラブルは、急成長中のAI系スタートアップにありがちな運用の粗さを示すエピソードとして読める。

※本記事は5ch(Hacker News)スレッド「Qwen 3.8 27B available on Cerebras at 1500 tokens/s」より抜粋・要約して構成しています。

この記事のリアクション

他サイトの新着

まだコメントはありません。

コメントする

誹謗中傷・個人を特定する書き込みは削除対象です。投稿は承認後に表示されます。

相互リンクサイト新着記事