AIモデルの「思考」が減った? Anthropic製品の劣化疑惑、海外で議論に

姉妹サイトの新着

他サイトの新着

Hacker Newsのスレッドで、Anthropicの生成AI「Fable」の応答品質が時期によって変動しているとの指摘が相次いだ。8月以降、AIが「考える」量を示す指標(推論トークン)が減っているとの観測データがきっかけとなり、ユーザーの間では意図的な性能調整、いわゆる「ステルスナーフ」を疑う声が上がった。過去にも同様の指摘に対しAnthropicは「Claude Code側のリグレッションだった」と説明した経緯があるが、今回は明確な公式説明は出ていない。スレでは「非決定的なAIの性能をどう検証するか」という方法論の議論と、「サブスクリプション料金に見合う品質が担保されているか」という不満が入り混じった。

Fable 5 – 8月にかけて『思考』の中央値が低下していた

出典: twitter.com / 元記事はこちら

6 海外の名無しさん 2026-09-21 16:37
Anthropicは公式に、モデルの性能をいじって計算リソースを最適化するようなことはしていないと言っていたはずだ。ただ、体感では週ごとにパフォーマンスの浮き沈みが激しい(Fableじゃなくて主にOpusだけど)。これについて彼らの『公式な説明』とやらを聞いてみたいものだ。
29 海外の名無しさん 2026-09-21 17:30
>>6 言ってたね、しかも一度じゃない。『Anthropicが反発を受けてClaudeユーザーの研究を妨害しかねない方針を撤回』(Wired)。でも実際は今も起きてる。GitHubのissue #81759を見ると分かる。
30 海外の名無しさん 2026-09-21 16:48
>>6 前回問題を指摘された時は、Claude Code自体のリグレッションだったらしい。少なくとも公式の説明ではそう。とはいえ『バイブコーディング』にとっては印象が悪かったけど、結局うやむやにされた。
31 海外の名無しさん 2026-09-21 17:10
>>6 彼らは毎週、下手したら毎日、いろんなA/Bテストを回して最適化をデプロイしている。モデルの性能そのものを操作しているわけじゃなく、あくまでテストを積極的にやっているだけだと思う。
8 海外の名無しさん 2026-09-21 16:45
まあそうだろうね。お決まりのパターンは、モデルXが『事実上のAGIだ』とあらゆるベンチマークを制覇したと持ち上げられ、翌日にはYとZも同じくベンチマーク王者になる、というやつ。それから数週間後、実は量子化されていたとか推論の質が落ちていたとか気づいて、みんな『騙された』と文句を言う。200ドルのサブスクを払うくらいならちゃんとしたコーヒーでも買った方がいい、そうすればこの手の話には巻き込まれずに済む。
34 海外の名無しさん 2026-09-21 16:53
>>8 いや、僕はコーヒーも200ドルのAIプランも両方楽しんでるよ。じゃあBlue Bottleがコーヒーを薄め始めたらどうする?コーヒーをやめて紅茶にしろってこと?ベンダーが提供内容について誤解を招くようなことをしているという証拠は、その製品を個人的に気に入っているかどうかに関係なく、共有する価値がある。
35 海外の名無しさん 2026-09-21 17:03
>>8 悪いけど、まともなAIはどこかで手に入れないといけない。AIなしだと生産性はざっと5分の1になる。中国企業にお金を払うのは気が進まないし、西側の企業でオープンモデルをサブスク形式で提供しているところもない。
11 海外の名無しさん 2026-09-21 17:24
5年後、意図的にユーザーを欺いたとして訴訟で負けたりするのかな?それとも、こういう調整ができるように利用規約にもう何か盛り込まれているんだろうか?
13 海外の名無しさん 2026-09-21 17:03
気になるのは、これがAIや分散システムなど特定分野で作業しているユーザーのサブセットだけで起きているのか、それとも全体的な話なのかということ。自分は分散システムの仕事をしていて、今日のFableはほぼ使い物にならない。Opusみたいな挙動になっていて、他にも同じ症状の人がいないか探してみたら、案の定いた。
14 海外の名無しさん 2026-09-21 16:52
非決定的なシステムでどうやって再現可能なテストを作るの?同じプロンプトを送っても毎回違う答えが返ってくるのに。
39 海外の名無しさん 2026-09-21 16:56
>>14 これがどう行われているか、いい解説記事がある。Anthropicの『Demystifying evals』というエンジニアリング記事。
40 海外の名無しさん 2026-09-21 16:54
>>14 実際のトークン出力自体は非決定的かもしれないけど、本来一定であるべき代理指標を見ればいい。例えばベンチマークでの正解率・性能、複雑な問題での『思考レベル』とか。
15 海外の名無しさん 2026-09-21 17:19
これはAnthropicの誰かが急いで仕事をしていない結果かもしれない。
16 海外の名無しさん 2026-09-21 17:10
他人には透明性を求めるくせに、自分たちには求めないってわけね。さもありなん。
17 海外の名無しさん 2026-09-21 17:02
Anthropicはもはやユーザーをあからさまに騙しにかかっている。
18 海外の名無しさん 2026-09-21 17:16
これは昔の共有クラウドと同じ話で、誰かがCPUを使いすぎると自分にも影響が出るというやつ。みんな同じサービスにプールされているんだから。モデルの『知能』についてもSLAが必要だと思う。じゃないと『fable』を買ったつもりが、実は『table(机)』程度の知能しかないものを売りつけられていることになる。
19 海外の名無しさん 2026-09-21 16:57
本物のFableは6月の数日間だけ存在した、というのが自分の持論。その後、政府に市場から引き上げられたのをきっかけに少しだけ性能を落とされた。今使っているのはそれより劣るけど、それでもまだ十分良い。
20 海外の名無しさん 2026-09-21 16:40
思考トークンってどうやって計測するの?クライアントには返ってこないのに。
41 海外の名無しさん 2026-09-21 16:46
>>20 使用トークン数自体は教えてくれるよね?じゃないと自分のトークン消費量も分からないはずだし。
23 海外の名無しさん 2026-09-21 17:08
>>2 FableとOpus 5.5の新しいリリースが控えていて、Anthropicはリソースを再配分している最中。移行期にはいつも性能が落ちる、しんどいよね。今のOpus 5.5はOpus 5として提供されている状態。
42 海外の名無しさん 2026-09-21 17:34
>>23 その『劣化』の仕組みをもう少し詳しく教えてもらえる?リソースが足りないなら、普通は『リソース不足』というエラーでリクエストが失敗すると思うんだけど。裏側でモデルの性能を落として、サービスだけは劣化した状態で維持しているということ?
43 海外の名無しさん 2026-09-21 17:33
>>23 『Opus 5.5は今Opus 5として提供されている』か。すごいな。体感だけど、まるで『明日なんて来ない』と思っているドゥーマーみたいにトークンをガンガン消費している。
44 海外の名無しさん 2026-09-21 17:20
>>23 しかも頻繁にリリース、つまりバージョンアップも多いしね。
24 海外の名無しさん 2026-09-21 17:38
>>2 コーヒーを飲む前の自分みたいだ。
25 海外の名無しさん 2026-09-21 17:19
>>2 もしかしたらナビエ・ストークス方程式を解いた人たちに嫉妬して、顧客そっちのけで計算資源の8割をホッジ予想に注ぎ込もうとしてるのかもね。
28 海外の名無しさん 2026-09-21 16:55
>>6 新しいものは最初は信じられないくらい高性能に感じる。時間が経つとその能力が当たり前になって、欠点に気づき始める。(ただ、もし元記事が本当に推論トークンを計測しているなら、それはまったく別の話。彼がどう計測しているのか、正直よく分からない。)
32 海外の名無しさん 2026-09-21 17:39
>>7 彼らの部署名を『Office of Weights and Biases(重みとバイアスの局)』に改名すべきだという提案、笑える。
36 海外の名無しさん 2026-09-21 17:36
>>12 これをやるために retort というツールを作った。いろんな実験を回せて、トークンに余裕があれば結果を投稿できる。自分でテストを追加できるし、Claude・Codex・Gemini・ローカルモデル用のHermesも実行できる。

他サイトの新着

37 海外の名無しさん 2026-09-21 17:27
>>12 収益モデルとして思いつくのは広告くらい(AI Stupid Levelみたいに)。あるいはMargin Labみたいに、自社サービスへの集客のための撒き餌として使うか。(追記:HNがいまだにMarkdown形式のリンクに対応していないことに驚いた。)
48 海外の名無しさん 2026-09-21 17:31
>>37 うまくやればそのデータへのアクセスにお金を払う企業はたくさんあると思う。エンタープライズ向けサブスクみたいな感じで。自分が勤めているFortune500企業の周りにある他のデータサービスと似ている。
46 海外の名無しさん 2026-09-21 17:36
>>29 これも『よく分かっていない人たちがノイズを撒き散らす』典型例。その投稿は単純に勘違いしていて、100万回のOpus呼び出しというのは自動モード用の分類器の話で、実際のエージェント呼び出しは今もFableのまま。
47 海外の名無しさん 2026-09-21 16:58
>>33 0番目の理由:『うちのモデルは危険すぎて一般公開できない』
51 海外の名無しさん 2026-09-21 17:06
>>47 Googleの検索AIは本当に一般公開するには危険なレベルだと思う。うちの親戚が医療アドバイスの情報源として普通にそれを使っているのを見たことがある。そんなことをしていたら危ないと、かなり強く言って止めた。
49 海外の名無しさん 2026-09-21 16:47
>>41 いい指摘。数字が増えていくのを見られるだけでも、それ自体は有用な情報だと思う。最近DeepSeek 4.1 FlashでClaude Codeを使っているけど、CoT(思考の連鎖)が部分的には演出だとしても、どうやって『ソーセージが作られているか』が見えるのはいい感じ。
52 海外の名無しさん 2026-09-21 17:31
>>51 毎日の食事に石をたくさん取り入れるといいよ、ミネラルたっぷりだから!

この話題の背景と論点

AIモデルの「劣化」を疑う声は、これまでも他社の大規模言語モデルを巡って繰り返し話題になってきた。典型的に疑われるのは、運用コストを抑えるための量子化や、推論(思考)にかけるトークン数の圧縮といった裏側の調整だ。AI企業は通常、非公開のA/Bテストや段階的なモデル切り替えを常時行っており、これがユーザー体感のばらつきを生みやすい構造になっている。加えてAIの出力はそもそも非決定的なため、「性能が落ちた」という体験を客観的な証拠として示すのが難しく、今回のスレでも「何を再現可能な指標として測るか」という方法論自体が論点になっている。スレ内の投稿はあくまでユーザー側の観測・推測であり、Anthropicからの追加の公式説明は示されていない点には注意が必要だ。

※本記事は5ch(Hacker News)スレッド「Fable 5 – Median thinking declined in August」より抜粋・要約して構成しています。

この記事のリアクション

他サイトの新着

まだコメントはありません。

コメントする

誹謗中傷・個人を特定する書き込みは削除対象です。投稿は承認後に表示されます。

相互リンクサイト新着記事