Cerebrasが新モデルを秒間1500トークンで提供、海外の反応
姉妹サイトの新着
他サイトの新着
- 5chまとめMAP【悲報】ワイさん、最近「デブ女キャラ」が好きになってしまった模様
- ニュース速報まとめMAP【皇室】葬儀簡素化で何が変わる?上皇さまの意向と宮内庁の苦悩、国民が知るべき「真実」
- なんJ傑作まとめアンテナMAP【衝撃】「ドラゴンボール超ビルス」、10月11日から“エンハンスド版”で復活wwwwwwwwww
- アニメ声優まとめアンテナMAPなろうパーティ「あんたは追放よ…!荷物を多く持てるだけなんていらない」 主人公「え、そんな・・・僕がいなかったら…」
- VTuberまとめアンテナMAP【にじさんじ】カラオケまねきねこ×にじさんじ/NIJISANJI EN コラボ開催決定
- だめぽアンテナ【CN悲報】ネパールの大洪水、中国のせいだった
- ヌルポあんてな【動画】芦田愛菜さん、完璧な英語を披露した結果なぜか自認旦那たちの鼻が高くなってしまうw w w w w w w w w w
- 2chまとめアプリ+【GIF画像】フフッとしたら寝ろwwwwwwwwwwwwwww
- News人タレント・千秋さん「ドバイは今や日本より治安が良く安全。何故なら・・・」→納得の理由がこちらwwwww他
- ブルーアンテナオッサン二人組が東海道を徒歩で移動しながら毎日美味いものを食って風俗紹介してレビューする小説を書こうと思う
- ウマーあんてなCerebrasが新モデルを秒間1500トークンで提供、海外の反応
- にゅーもふ命を削ってTEMUの食材を食いまくっていた人気YouTuberさん、ヤバイことになっていた・・・
- ぷぅアンテナ【画像】海外モデルの乳デカすぎて草www ワイの理性が崩壊しそうwwwww 他
- 5chnavi【ニュース】ネパール大洪水、トヨタが救助で大活躍!!!!
- 海外反応・海外ニュースまとめ【海外の反応】マリナーズ新人が2安打デビュー→「イチロー以来25年ぶり」に地元総立ち
- 海外の反応アンテナ.com外国人「hololiveスレだぞ。ホロEN、ホロJP、ホロID、みんな語ろうぜ」
- ライムアンテナ【ウマ娘】ウマ娘を描いてくれ(2026/08/30)2
- キター!アンテナ移民が大規模流入のスペイン飛び地セウタ、性的暴行が「ほぼ毎日」発生 検察当局
- つべこアンテナ夜7時ごろ、縁側のガラス戸が突然どーんと叩かれた。家全体が揺れるような大きな音だった。【再】
- 2ちゃんマップ【エロ板まとめ】【悲報】昭和の日本さん、女子小学生の全裸放送OKだった
推論チップメーカーのCerebrasが、Qwen 3.8 27Bというモデルを秒間1500トークンという速度でAPI提供し始めたことがHacker Newsで話題になった。これは同種のサービスの中でも際立って速い数値で、OpenRouter経由の最速プロバイダーが約80トークン/秒、競合のMixlayerが150〜200トークン/秒とされる中での数字だ。スレでは速度そのものへの驚きに加え、なぜCerebrasが超巨大モデルではなく中規模モデルばかりホストするのかという技術的な疑問、プロンプトキャッシュを使っても料金が下がらない点への戸惑い、Discordしかないサポート体制への不満などが交わされた。
Qwen 3.8 27BがCerebras上で秒間1500トークンの速度で使えるようになった
出典: inference-docs.cerebras.ai / 元記事はこちら
うちは150〜200トークン/秒くらいで提供してるよ(新しい投機的デコード実装をDFlash2のドラフトモデルで使ってる)。https://mixlayer.com、プロモコード「LAUNCH-Q38-27B」で5ドル分のクレジットがもらえるから、試しに使ってみて。
追記: どうやらAPIトークン課金でしか使えないみたい。プロンプトキャッシュはもう導入されてるのかな? エージェント的なコーディングタスクだとキャッシュ無しではかなり高くつくんだよね。
プロンプトキャッシュには対応してるみたいだよ: https://inference-docs.cerebras.ai/capabilities/prompt-cachi…
公開エンドポイントでホストしてる中では最強のモデルってだけ。OpenAI向けにはGPT 5.6 Solの爆速版を用意してるし、専用エンドポイントではもっと大きいオープンモデルも扱ってる。
Coding Planってもう無くなったんじゃなかったっけ?
君の脳は常時アップデートされながら身体全体を維持してるんだぞ。LLMは静的なだけ。
とはいえ1500トークン/秒は確かに狂ってる
君の脳は洗濯もパスタを茹でることもできる。まだまだ道のりは長いよ
Qwen 3.8の推論トレースを読むと、あっちも「えーと」とか「いや、待てよ…」ばっかり言ってるけどね
そういう問題こそDiscordのサポートで直せるはずだよ
(追記: 解決した。support@から返信が来て、俺のメールドメインがブラックリストに入ってたらしい。俺だけの問題だった(もう解決済み))
うん、Googleでサインインしたらいけたよ
彼らは巨大な推論チップを作ってる会社だからね。推論サービスは基本的にハードウェアという本業の宣伝みたいなもの。
CEOが数年前にGradient Dissentに出演してた: https://www.youtube.com/watch?v=qNXebAQ6igs
ウェハー上には44GB分のSRAM分のスペースしか無い。RAMをオフロードすると、全部を1チップに載せる(それこそがCerebrasの存在意義)ことによる高速化のメリットが失われる。
大部分は経済的な事情だと思うよ
ターゲット層は生の速度を求めている人たちだよ。
選択肢があるのは良いことで、速度・性能・品質のあいだでトレードオフを選べる。
去年までは、みんな信じるAI神様が1つだけだった(だいたいAnthropicのやつ)。今はオープンウェイト、最先端、速度特化など、システム設計と同じように選択できる力がある。
サイコパス: tok/SEC
まあ確かに、Caps Lockが付けっぱなしだったわ /o\
俺はtpsって言う派
Codeにもこういうモデルを追加してくれるといいな 🙂
うん、このスピード感からするとGLM 4.7はもう一昔前のものだよね
他サイトの新着
同意だけど、うちのSaaSだとこれでUXが一段階跳ね上がる部分があると思う
昔月額プランがあったと思うんだけど、あれってどうなったの?
プロモコードを入力する場所が見つからないんだけど?
それをやっても値段自体は下がらないけどね。
「キャッシュされたトークンの料金は?」
「プロンプトキャッシュの利用に追加料金は一切ありません。入力トークンは、キャッシュから提供されたものでも新規に処理されたものでも、該当モデルの標準入力トークン料金で課金されます」
いや、これはこれで話をひっくり返してくるな。
へえ
速度が上がるってこと? それとも「うちの側ではキャッシュしてるかもしれないけど、あなたへの割引は無いよ」っていう単なるマーケティング上手いこと言ってるだけ?
前回もらった時は、Discordサーバーにログインして「ドロップ」を待つ必要があって、確かDaniel Kimがその場にいた人にランダムで配ってた記憶がある。1分もしないうちに無くなってた。8ヶ月くらい前の話。
(追加の肉体パーツは別売りです)
複数のウェハーにパイプライン処理させれば、もっと大きいモデルもホストできるはず。各ウェハーが1層を担当して、N層あればN×44GBのモデルをN並列で提供できる。制約になるのはウェハー間のI/Oで、それがまさに自分が言いたかったこと。GPT 5.6 Solみたいなもっと大きいモデルもこうやって提供してるんだと思う[1]。
[1] https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultraf…
オフロードが不可能だとは言ってない。ただ大きな速度低下が起きるってこと。
他社が27B版をホストしてCerebrasより高いTPSを見せつけたら、Cerebrasとしては格好悪いだろうね。
この話題の背景と論点
CerebrasはSRAM上にモデル全体を載せて動かす「ウェハースケールエンジン」という特殊な推論チップを作る会社で、通常のGPUクラスタとは方式が違う。スレで指摘されている通り、1枚のウェハーに載るSRAMは44GB程度とされ、これがQwen 3.8 27Bのような中規模モデルは載せられても、2.4Tパラメータ級の巨大モデルをそのまま置けない理由になっている。複数ウェハーに層を分けて載せる方法もあるが、ウェハー間I/Oがボトルネックになるという指摘は技術的に筋が通っている。もう一つの論点はプロンプトキャッシュの扱いで、Cerebrasは「キャッシュされたトークンも通常の入力料金のまま」と明言しており、これは他社が採用する「キャッシュ分は割引」という慣行とは異なる。速度面のメリットがあるのか、単なる据え置き課金なのかがレスの中でも決着していない。またDiscordのみのサポート体制やアカウント作成時のトラブルは、急成長中のAI系スタートアップにありがちな運用の粗さを示すエピソードとして読める。
※本記事は5ch(Hacker News)スレッド「Qwen 3.8 27B available on Cerebras at 1500 tokens/s」より抜粋・要約して構成しています。






まだコメントはありません。