数学は解けてもチェスは弱い、LLM懐疑論のブログに海外で賛否
姉妹サイトの新着
他サイトの新着
- 5chまとめMAP人気漫画「NANA」ゴディバとコラボ、矢沢あいが新規イラスト“描きおろし”
- ニュース速報まとめMAP【訃報】セクシー女優・倉木華さん(25)死去 所属事務所が発表「生前に深く傷つき、苦しんでいた」
- なんJ傑作まとめアンテナMAP【悲報】ポケカ、30周年直前に大暴落wwwwwwwww
- アニメ声優まとめアンテナMAP【画像】APEXのスト6コラボ、春麗がポリコレブスになるwwwwwwwwwwwww
- VTuberまとめアンテナMAP【にじさんじ】リゼアンラジオ(仮)!アンジュがモテないのはにじさんじが悪かったんか
- だめぽアンテナ【GIF動画】紐パン水着のフランス美女さん、伊豆で発見される
- ヌルポあんてな【画像】お前らが抜きまくった『●●GIF』ガチでこれwwwwww
- 2chまとめアプリ+「紅茶」←こいつの正直な感想
- News人【警鐘】武井壮「“やったもの勝ち”の狂った時代になってきた」暴力・嘘・迷惑行為まで金になる社会を嘆く他
- ブルーアンテナ日本←ジェンダーギャップ指数117位←これ
- ウマーあんてな【海外の反応】人気投票トーナメントで浮上する「複垢による票操作」疑惑
- Red4 海外の反応まとめ【海外の反応】「生活必需品の値上がりがヤバい…」日本のインフレと金利上昇に日本居住の外国人が悲鳴! →「オルカン積立しか勝たん」「賃上げなんて実感ないぞ」
- 海外の反応ジャーナル「世界中の人々は日本について知っていることが全て間違っている?」海外の反応
- ハゲリシャス速報【ハゲ速報】めちゃくちゃ40歳にみえない男性がこちら(画像あり)
- アニメ・漫画アンテナ「二発以上当てた漫画家の最高峰」←これ意見分かれるよな
- 勝つるあんてな!【朝日新聞】在日コリアンとは? 国籍や呼称が決まった経緯 [9/15] [ばーど★]
- 2ちゃんねるまとめるまとめ原付のタイヤ交換前後で34000円もとられたんだが
- 5chnavi【画像】ローソン100、一点突破で300円以下弁当シリーズ発表
- ぷぅアンテナ【画像】まぢか!寺脇康文が常盤貴子の○っ○を我慢…でも触っちゃうwwww 他
- にゅーもふ【画像】 女の子「うぅ、暑い・・・。なんとかしてくれ・・・????」
海外のブログに投稿された「ナビエ・ストークスの難問が解決した後も、私はLLMに懐疑的だ」と題する記事が、Hacker Newsで大きな反響を呼んだ。筆者は、現行の最先端モデルでも単純な作業に念入りな監視とガードレールが必要だと指摘し、チェスをまともに指せないことなどを根拠に慎重な立場を示している。これに対しコメント欄では、数学分野での強さを認めつつ自律型AIへの懐疑に賛同する声と、検証対象のモデルがすでに旧世代でフェアではないという反論が交錯し、AI業界全体の資金規模やオープンウェイトモデルの安全性にまで話が広がった。
ナビエ・ストークスの難問が解決した後も、私はLLMに懐疑的だ
出典: dank.systems / 元記事はこちら
このJSをコンソールに貼れば文頭を大文字化できるよ(完璧じゃないけど役には立つはず)。
Array.from(document.body.querySelectorAll('p,li')).filter(e=>e.innerText).map(e=>e.innerText = e.innerText.split('. ').map(s=>s[0].toUpperCase() + s.slice(1)).join('. '))
サイト全体を見てみたけど、全部このスタイルで統一されてた。まあ……個性的ではあるね。
自分も同じこと思った。経験則だけど、全部小文字で書かれた文章って大抵思いつきの放言だから読む価値がないことが多いんだよね。要するに『小文字だから読まない』ってやつ(笑)
オープンモデルもそう長くはオープンでいられないと思う。ゼロデイ攻撃を連鎖させられるようなモデルを誰も公開しないだろうし、中国だってそこまで無謀じゃない。自分たちに跳ね返ってくるだけだから。
同意はするけど、オープンウェイトモデルの安全性はやっぱり心配。アライメント済みのものも、そうでないものも含めて。
まるでOpenAIみたいなラボがそれを知らなくて、値下げ競争を防ぐ手を常に打ってないみたいな言い方だね
『最先端のモデルでさえ、単純な作業にすら念入りな監視とガードレールが必要』ってくだり、これはまさに現在の能力を否定してるように読めるけど
ありがとう(笑)。実際毎日使ってて楽しんでるし、今の性能は本当にすごいと思う。ただ最先端モデルの値段がバカ高すぎるだけで。
そう、純粋数学やそれに近い分野ではかなり強い。
それはブラウザ側でやるべき機能じゃない?
『最先端モデル』として挙げてるのがGemini 2.5 Pro、O3、Claude Sonnet 3.7、ChatGPT 4.1か。これらと本当の意味での現行最先端モデルとの間には、ものすごい性能差がある。この検証の結論をそのまま信用する気にはなれないな。
自分でもAstra xhighを弱いボット相手に試してみた(lichessのスタディはこちら)。チェスはまだかなり弱いけど、反則手を指すまでの手数は前より長くなってた。
そもそもLLMは『トークン列』以外の意味でのルール(文法)に従うようには作られていない。それに、知的なエージェントにとってルールに従うことが本当に必要なのかもはっきりしない。もちろん、外側の仕組み(ハーネス)で簡単に補正はできるけど。
今のモデルだったらどうなるんだろうね。検証で使われたモデルはもうかなり古い。
知能ってそういうものじゃないと思う。LLM自身が推論だけでチェスを指せなくても、チェスを指すプログラムを書いて実行させればいい。人間の知能も同じ。自分では飛べないけど、飛行機は作れる。
話はそんなに単純じゃない。結局はタスク次第ってことだよ。チェスの棋譜を大量に学習できるか? できない。数学の論文を大量に学習できるか? できる。この差が大きい。
他サイトの新着
なんでモデルがStockfishをツールとして呼び出しちゃダメなんだろう。複雑な数式計算のためにPythonを実行できない、って言ってるのと同じに聞こえるけど。
それのどこが大問題なのか分からない。そもそもチェスにLLMを使う人なんていないし、使うにしてもハーネスの一部としてStockfishを持たせればいい。ツールを使いこなせる賢さがあれば、全部自分でやる必要はないんだから。
専用の訓練をしていないのにチェスを指せること自体が驚きだし、他の多くの人がそれを驚きだと思わないという事実こそ、AIがどれだけ速く進歩してきたかを物語ってる。
『文頭の大文字化がされてなくて読みづらい』って言うけど、ちゃんと大文字化されてたらされてたで、今度は『LLMで書かれた文章だ』って叩かれるんだよ。どっちにしても勝ち目がない……
その通りだと思う。AI市場に流れ込む資金の大半はOpenAIとAnthropic経由で、両社は株式売却と顧客からの収益の両方でそれを集めている。7〜8兆ドルという数字も、結局そこから派生したものにすぎない。
Anthropicの偉い人たちいわく、AIが人類を滅ぼす確率は10%超えらしい。それが本当なら君は間違ってるし、嘘なら嘘でAnthropicは不誠実な会社ってことになる。不誠実な会社の企業価値なんてどうして信用できるんだ?
ナビエ・ストークスの件って、ある研究者の非公開チャットログを勝手に流用して『解いた』ことになってたんじゃなかったっけ?
『カスタマーサポート』が何を指すか次第だね。普通はナレッジベースからの情報検索か、ユーザーには見えない管理画面の操作を意味することが多い。
自分もまさにそれを言いに来た。実際、これがカスタマーサービス分野でAI活用があまり進んでいない理由だと思うし、たまに導入されてても大抵イライラさせられる出来になってる。
Elizaだって、ちゃんと筋の通った英文を書いてたよ。
『これって人間の学習の仕方と本当に違うのか?』うん、違う。
それに、GPT-6 AstraのARC-AGI-2での高スコアって、この主張と矛盾してない? 各問題はルールが全然違う、それぞれ独立したゲームみたいなものなのに。
つまり、モデルが『何をするか』を心配してるってことなら、まあそうだね。
この話題の背景と論点
タイトルにある「ナビエ・ストークス」は、AIが数学分野で成果を上げたとされる出来事を指しているとみられるが、スレ内にその詳細を裏付ける情報はなく、事実関係の確認はできない。議論の軸は、論文データが豊富な数学分野でLLMが強さを見せる一方、学習データの乏しいチェスのような領域では弱さが目立つという指摘で、これを「Stockfishのようなツールを呼べば解決する話」とみるか「それ自体が限界の証拠」とみるかで意見が割れている。またAnthropicの研究者がAIによる人類滅亡リスクに言及しているという指摘も出ているが、真偽や出典の検証は本スレでは行われていない。検証に使われたモデルがすでに旧世代だという批判も複数あり、AIの能力評価はどの世代のモデルを前提にするかで結論が大きく変わりうる点には注意が必要だ。
※本記事は5ch(Hacker News)スレッド「Why I’m still bearish on LLMs after Navier-Stokes」より抜粋・要約して構成しています。






まだコメントはありません。