IT・AI
2026年8月23日
Claude Codeが「手抜き」? Anthropicの効果レベル疑惑、海外で議論に
「IT・AI」の記事
Hacker Newsで、Claude Codeが以前よりずっと長く「考え込む」ようになり、単純な作業でもコンテナ起動やテストスイート作成まで始めてトークンを大量消費しているという報告が話題になった。収益のためにわざとトークンを浪費させているのではという疑いの声が上がる一方、学習方法の副作用に過ぎないという反論も出て、原因をめぐって意見が割れている。
Anthropicが、Claude Codeで効果レベルを下げるA/Bテストをしているようだ
出典: twitter.com / 元記事はこちら
2
海外の名無しさん
2026-08-22 17:39
Opus 5がやっていることはおかしい。プロンプトは『設定ファイルを読んで新しいデータで更新して』というだけ。4.6ならファイルを読んでパースして直すのに2分もかからない作業。ところがOpus 5の結果は、43分もかけてコンテナを取得し、サンドボックスを動かし、テストスイートまで作り、しかも設定ファイルの範囲を超えてリポジトリ全体を評価していた。どちらも変更したのはファイル1つだけなのに。
16
海外の名無しさん
2026-08-22 18:20
>>2 Opus 5のxhighモードは基本的な計算すらまともにできない。性能をわざと落とされている気がして、昨日サブスクを解約した。以前は月200ドル払っていたのを、Fable騒動のあと20ドルに下げて、Codexの使用分を使い切ったときだけ使うようにしていた。あと文章が『いかにも深い意味がありそうな書き方』を狙いすぎていて読んでいて疲れる。
17
海外の名無しさん
2026-08-22 17:56
>>2 会社の収益はトークン数にかかっている。株主が見たいのはまさにそれ。
21
海外の名無しさん
2026-08-22 17:44
>>2 AI企業には、必要以上にトークンを消費させる金銭的インセンティブがある。
4
海外の名無しさん
2026-08-22 17:46
LLMのユーザーは面倒な作業をLLMに丸投げしたいわけだが、LLM自身も面倒くさがっているように見える。これはAGIなのでは?
26
海外の名無しさん
2026-08-22 18:23
>>4 AGIじゃなくて『Anthropicのもうけ(Generated Income)』だろ。
5
海外の名無しさん
2026-08-22 18:21
何が起きているのか分からないが、単純なバックエンドの修正でもOpus 5のミスをGLM-5.3で直す羽目になっている。
6
海外の名無しさん
2026-08-22 18:25
簡単な作業なのに思考モードを最大にしたままなのはユーザー側のミスだが、Anthropicもそっちを直そうとするだろう。
7
海外の名無しさん
2026-08-22 17:27
これだけじゃなく、利用上限を微調整したりバックエンドで別モデルにルーティングしたりといった『最適化』もいろいろありそうだ。インセンティブが強すぎる。
27
海外の名無しさん
2026-08-22 17:35
>>7 API経由(実はalyph.ai経由)で使っているが、違いがとんでもない。チャット版のモデルは個人の利用状況や全体の負荷(特に米国太平洋時間の業務時間帯が一番ひどい)に応じて明らかに機能を絞られている。APIはその影響を受けていないようだ。
9
海外の名無しさん
2026-08-22 17:54
こういうモデルの『効果レベル』設定って具体的に何を意味するんだろう。思考時間が長くなるだけ?何かしらのシステムプロンプト?低い効果設定から最大級の出力を引き出せない理由は何?
10
海外の名無しさん
2026-08-22 18:12
FableとGPTを組み合わせつつ、補助付きのトークンを使い続けたい場合、今一番いいやり方は何?
30
海外の名無しさん
2026-08-22 18:15
>>10 自分でハーネスを作るか、オープンソースのハーネスをCodexのサブスクと組み合わせるといい。自分もFable用にClaudeのサブスクは維持しているけど、ほとんど使っていない。
11
海外の名無しさん
2026-08-22 17:44
どのモデルを使っていても(Claude Codeと合わせても)、サブエージェントはちょっとした(小さめの)作業に異常な量のトークンを使っている気がする。
12
海外の名無しさん
2026-08-22 17:58
Anthropicから離れて本当によかった。OpenAIでも問題は起きるけど、Anthropicほど耐え難いレベルではない。
15
海外の名無しさん
2026-08-22 17:36
…ツイートを見る限り、根拠はClaudeに『自分の効果レベルは何?』と聞いた回答みたいだけど、そもそもモデル自身がそれを把握できるものなのか。あまり納得できない。
32
海外の名無しさん
2026-08-22 17:40
>>15 今もそうかは分からないけど、Copilotを使っていたとき、思考過程の出力を見ると『予算』について考えている場面があった。『セッションの予算が近いから…』みたいに。だからあり得ない話ではないと思う。
33
海外の名無しさん
2026-08-22 17:39
>>15 効果レベルは基本的にシステムプロンプトで制御されている(モデルはその形式で学習されているはず)。だから、これは確認方法として妥当だと思う。
18
海外の名無しさん
2026-08-22 17:43
>>2 そうそう、あれでトークンを無駄遣いしてる。
19
海外の名無しさん
2026-08-22 18:11
>>2 儲けないといけないからね。
22
海外の名無しさん
2026-08-22 18:01
>>2 しかも最後は『一つ伝えておきたいことがあります』で締めて、意味不明なACとかR1とか§の羅列がついてくる。
23
海外の名無しさん
2026-08-22 18:12
>>3 『インセンティブが揃っていない事業者』という話は、競合がいない場合にしか成り立たない議論だ。自分たちはブラックボックスの市場にいるわけで、我慢しなきゃいけない相手は『ただ一つ』じゃない。選択肢はあるし、自分で作ることもできる。
40
海外の名無しさん
2026-08-22 18:16
>>23 選択肢と言っても3社くらいしかなくて、しかもみんな同じ料金体系。それに自分にはフロンティアモデルの会社を立ち上げられる立場でもない。
24
海外の名無しさん
2026-08-22 18:07
>>3 じゃあどうやって課金すればいいんだ。運用コストはトークン単位でかかっているのに。
42
海外の名無しさん
2026-08-22 18:18
>>24 それにトークンは確実に計測できる。『タスクの完了』みたいな指標と違って。
25
海外の名無しさん
2026-08-22 18:19
>>3 少なくともOpenAIとAnthropicは、1回の応答ごとに使用上限を設定できる。それにトークンの定義もはっきりしている。
28
海外の名無しさん
2026-08-22 18:03
>>8 効果レベルの設定に適切に応答するのは(事後の)学習の一部だったはず。だとすればこれも『ビターレッスン』の一例と言えるかもね。最高だよ。
35
海外の名無しさん
2026-08-22 18:24
>>16 月200ドルと月20ドルのプランって、実質的に違うモデルに誘導されてるんじゃないの?
36
海外の名無しさん
2026-08-22 18:10
>>17 LLM業界はこれだけ競争が激しいんだから、どの企業も可能な限り最高の製品を作ろうとしている以外のことをしているとしたら驚きだ。わざと無駄にトークンを使わせるように学習させているとは到底思えない。
44
海外の名無しさん
2026-08-22 18:23
>>36 両方やっている可能性を否定しているの?
45
海外の名無しさん
2026-08-22 18:17
>>36 コンピュート量を最小化するように学習させているんだから、たぶん最初の数ターンで一番安く動くモデルを見つけようと量子化のグレードを動的に下げているんだろう。その副作用として無駄にトークンを生成しているのかもしれない。
37
海外の名無しさん
2026-08-22 18:00
>>21 それが成り立つのは、余計なことをしないモデルでトークン生産を飽和させられない場合だけだ。実際には(彼らは笑えるほど計算資源が足りていないので)それができる。作業を早く終わらせるモデルの方が、ユーザーにとっての体感価値ははるかに高い。
38
海外の名無しさん
2026-08-22 18:19
>>21 同意。ただ『効果』と『推論』の差は大きい。AIを使えば普段40時間かかる仕事を3時間で終わらせているんだけど、納期に遅れている理由が分からなくてログを見て気づいた。思考は膨大で、依頼した内容の50倍もの作業をしていた。
39
海外の名無しさん
2026-08-22 18:00
>>21 つまり、詐欺だ。
43
海外の名無しさん
2026-08-22 17:44
>>33 Qwenはそうだって知ってるけど、大半のモデルもそうなのかな。
46
海外の名無しさん
2026-08-22 18:05
>>43 OpenAIのモデルもこの方式だ。推論レベルを変えるとキャッシュが丸ごと吹き飛ぶことからも分かる。自分が見てきたオープンウェイトモデルも全部そう(『reasoning_effort』の引数はチャットテンプレートのシステムプロンプトの一部を変えているだけ)。Anthropicが何か違うことをしているという証拠があれば見てみたい。
この話題の背景と論点
Claude Codeのような対話型コーディング支援ツールでは、モデルの「思考の深さ」を制御する効果レベル(reasoning effort)という設定が一般に用いられ、これは通常システムプロンプトを通じてモデルに伝えられる仕組みとされる。API課金がトークン消費量に連動する一方、サブスクプランは月額固定という料金体系の違いも背景にある。
スレで割れたのは、単純作業でも長時間の思考やコンテナ起動・テスト作成まで行う挙動について、収益確保のための意図的なトークン浪費とみる説と、強化学習や計算資源最適化の副作用にすぎないとする技術的説明との対立、さらにモデル自身に「効果レベルは?」と尋ねて確認する手法が妥当な検証方法かどうかという点である。
見落とされがちなのは、モデルが「予算」や「効果レベル」について言及したとしても、それは学習データに基づく応答パターンである可能性があり、実際の内部制御ロジックを正確に把握・報告している保証はないということだ。またAPI経由とサブスクのチャット版で体感が異なるという指摘も、公式に検証された情報ではなく個々の利用者の観測にとどまる点には注意が必要である。
※本記事は5ch(Hacker News)スレッド「Anthropic appears to be A/B testing reduced effort levels in Claude Code 」より抜粋・要約して構成しています。
続けて読む(IT・AI)
この記事のリアクション
😆 おもしろい 0 😮 びっくり 0 😢 かなしい 0 👍 わかる 0 😠 ひどい 0
まだコメントはありません。