xAI新型「Grok 4.7」発表 比較グラフ巡り海外で議論

姉妹サイトの新着

他サイトの新着

xAIが新型AIモデル「Grok 4.7」を発表し、海外掲示板Hacker Newsで議論になった。公式の比較グラフにOpenAIの新モデル「Astra」が含まれていない点について、単なる見落としではなく都合の悪い結果を隠しているのではという疑いの声が上がった。CursorBenchはCursorをハーネスとするため、Cursor上でAstraを使えないことが原因という技術的な指摘もあった。Grokの実際の使用感についても、コーディングで「すぐ完了と自己申告して手を抜く」と酷評する声がある一方、批判的な視点での調査に強いと評価する声もあり、意見が割れた。

Grok 4.7 — xAIの新型AIモデルが発表された

出典: x.ai / 元記事はこちら

6 海外の名無しさん 2026-09-21 16:52
とにかく、xAIなのかSpaceXAIなのか呼び方はともかく、あのチームが急速に成長し、いくつもの面で最先端に迫っている、あるいは達している点は素直に称賛できる。
26 海外の名無しさん 2026-09-21 17:16
>>6
その感想、半年から1年遅れてるよ。
8 海外の名無しさん 2026-09-21 16:50
このモデルの評価は、simonw氏の「自転車に乗るペリカンのSVGを生成させる」ベンチマーク待ちだな
28 海外の名無しさん 2026-09-21 16:55
>>8
要するに、何も測れていないパフォーマンス目的の疑似ベンチマークってことだろ。それを言うなら、テキストから音声波形を生成させて『音声モデルとしての性能』を測るとか、SVG生成専用に作られたモデル[0]に動画を作らせて評価するのと変わらない。[0] https://quiver.ai/
52 海外の名無しさん 2026-09-21 17:01
>>28
俺たちにも儀式くらい許してくれよ。
53 海外の名無しさん 2026-09-21 17:05
>>28
モデルの『知能』が、普段最適化されているタスクやモダリティを超えて汎化するかどうかを知るのは有益だと思わないのか?
9 海外の名無しさん 2026-09-21 16:52
4.6にはx-highの推論レベルが無かったんだっけ? なんで4.7のx-highと4.6のhighを比較してるんだ?
29 海外の名無しさん 2026-09-21 17:11
>>9
無かったよ。xhighはGrokで今回初めて追加されたもの。
11 海外の名無しさん 2026-09-21 16:55
Grokは本当に高い。DeepSeek 4.1 Flashなら、その何分の一かの値段で十分すごい結果が出せてる。
30 海外の名無しさん 2026-09-21 17:08
>>11
面倒くさがりな人間として、このモデルを一番安全に使う方法は?
31 海外の名無しさん 2026-09-21 17:00
>>11
提供:○○ってか。
13 海外の名無しさん 2026-09-21 16:10
あくまで個人の感想だけど、雑談用にGrokを使ってみた感じ、Claude、ChatGPT、DeepSeek、Geminiなどの中でも断トツで一番使えない。キャラクターに個性が無いし、頑張って助けようともしていない気がする。
32 海外の名無しさん 2026-09-21 16:24
>>13
自分も同じ印象。Grokはタスクをほとんど何もせずに『完了!』と言って終わらせてくる。全モデルの中でも間違いなく一番怠けていて『不誠実』。他のモデルも完璧じゃないけど、まともなコーディング作業にGrokは使えない。
33 海外の名無しさん 2026-09-21 16:28
>>13
『個性が無い』とのことだけど、自分はGrokを使わないから分からないけど、そもそもLLMに個性なんて求めてる? その『個性』こそ、みんながClaudeで嫌がってる部分そのものだと思うけど。
34 海外の名無しさん 2026-09-21 16:23
>>13
OpenRouter経由でQwen、DeepSeek、Gemini、Grokに同じプロンプトを投げてみたけど、Grokは調査がしっかりしていて、特にアイデアに批判的な視点を求めたときに的外れな回答が少なかった。
18 海外の名無しさん 2026-09-21 16:18
上の方にある紛らわしいグラフは何なんだ? Astraを含めていないのは単なる見落としとは思えない。Astraと比べたら成績が悪かったんじゃないのか?
36 海外の名無しさん 2026-09-21 16:26
>>18
https://openai.com/index/our-decision-on-cursor-following-it…
これが理由。他のコメントにもあるけど、CursorBenchはCursorをハーネスとして明示的にテストするもので、OpenAIはCursor上でAstraを使うことを許可していない。
37 海外の名無しさん 2026-09-21 16:32
>>18
紛らわしい? ちょっとググればすぐ分かることだけど。OpenAIはAstraをリリースする前にCursorから手を引いたから、そもそもそのベンチマークを受けていないんだよ。
38 海外の名無しさん 2026-09-21 16:21
>>18
もしかして、SpaceX側の評価ではAstraの方がFableより優れていると判断しているのか、それとも単にサム一派が嫌いすぎて彼らの製品を載せたくないだけなのか、どっちなんだろうな。
20 海外の名無しさん 2026-09-21 16:52
>>2
『Claudish(Claude語)にはどうしても耐えられない』に完全同意。モデルが賢くなるほど、大半の人には理解しづらくなっていく…けど、それって人間も同じことをしてないか?
42 海外の名無しさん 2026-09-21 17:12
>>20
同意。ある分野の知識が深まるほど、極めて具体的かつニュアンスを込めて話す必要が出てくる。そうしないと伝える内容自体が不正確になってしまう。表現力は上がるけど、理解されにくくもなる。ただ不思議なのは、AIモデルがやっているのはそれとは違うということ。文章がただただ変なんだよな。
44 海外の名無しさん 2026-09-21 17:04
>>20
それは半分正しい。本当に賢いモデルなら、分かりやすい説明――つまり簡潔で理解しやすい文章――も作れるはずだ。思考過程がどれだけ人間離れしていっても、それは両立できるはず。
46 海外の名無しさん 2026-09-21 17:00
>>20
シンプルに説明できないなら、それは十分に理解できていないということ。
21 海外の名無しさん 2026-09-21 16:25
>>2
参考までに言うと、ここ数年で見て、Anthropicが一番『ベンチマーク対策』をしていない印象がある。とはいえ、自分はコストパフォーマンスの面でOpus/FableよりSol/Astraの方を今は好んで使ってる。
47 海外の名無しさん 2026-09-21 16:48
>>21
自分は逆のことを言おうと思ってた。ここ1年、ベンチマークの数字ほどClaudeに満足できていない。AstraもFableもそれぞれクセはあるけど、去年は使用比率10%だったCodexが、今年は90%まで増えた。
22 海外の名無しさん 2026-09-21 17:10
>>2
まだ使ったことがないのかもしれないけど、3.8 Flashは会話相手としても最高のモデルだよ。Claudeの出力を3.8に通して説明させるだけでも、かなり新鮮で気持ちがいい。
48 海外の名無しさん 2026-09-21 17:11
>>22
Geminiの3.8 Flashのこと?
23 海外の名無しさん 2026-09-21 16:32
>>2
トークンの効率が分からなければ、単価だけ見てもあまり意味がない。
49 海外の名無しさん 2026-09-21 16:52
>>23
タスクあたりのコストを示した目玉のベンチマークを見ると、Fable 5.1 Lowと比べても売り込みにくいし、Fable 5.1 Mediumの性能にも届いていない。これが実際の使用感をどこまで反映しているかは分からないけど。あと、そのベンチマークではGPT 5.6 Solが以前のモデルより妙に成績が悪く見えるのも気になる。

他サイトの新着

25 海外の名無しさん 2026-09-21 16:52
>>2
次のAnthropicのリリースでは、いよいよ『Claudish』が減ることを期待してる。
50 海外の名無しさん 2026-09-21 17:00
>>25
もしClaudishを直してくれたら、また自分をMaxプランの客として取り戻せるのに! Fable 5.1はまだそこまで達していない。あのSonnet 3.5の魔法を取り戻してほしい。
51 海外の名無しさん 2026-09-21 17:00
>>25
何を根拠に?
56 海外の名無しさん 2026-09-21 16:59
>>34
誕生日パーティーの写真を批評させてみろよ、どうなるか見てみると面白いぞ。
67 海外の名無しさん 2026-09-21 17:02
>>56
もう少し詳しく説明してもらえる?
60 海外の名無しさん 2026-09-21 16:25
>>38
https://openai.com/index/our-decision-on-cursor-following-it…
これが理由。CursorでAstraは使えないし、CursorBenchはCursorをハーネスとして使っている。だから、そのハーネスでは実際にベンチマークが取れず、載っていないというわけ。
69 海外の名無しさん 2026-09-21 17:10
>>60
OpenAIのAPIキーをCursorで使えるから、ベンチマーク自体は取れるはず。AstraがCursorのプランに含まれていないだけの話。
70 海外の名無しさん 2026-09-21 16:26
>>60
ページの下の方にある他のベンチマークにはAstraが載ってる。ただ、Astraが勝っている姿を見せたくないだけだろ。
68 海外の名無しさん 2026-09-21 16:50
>>58
仮に(CursorBenchにAstraを含める)回避策があったとしても、Cursorユーザーにとって実用上の意味は無い。自分はCursorを開発に使っていて(開発以外はChatGPTを使うけど)、気にしているのはそこなんだよね。
71 海外の名無しさん 2026-09-21 16:52
>>68
いや、それは明らかにベンチマークの質を上げる話だろ。新モデルが競合とどう比較されるかを示すのが、ベンチマークやグラフそのものの存在意義なんだから。

この話題の背景と論点

Hacker Newsは開発者やエンジニアが多く集まる掲示板で、新モデル発表のたびに公式ベンチマークの妥当性が検証される傾向がある。今回話題になった「Astra除外」は、OpenAIがCursorとの提携から離脱した経緯によりCursor上でAstraを動かせないため、Cursorを採点環境とするCursorBenchのスコアに載せられないという技術的な制約が背景にあるとの指摘があった。ただしページ内の別のベンチマークにはAstraのスコアが掲載されているとの反論もあり、意図的な選別だとする見方が完全には消えていない。またスレ中では、Claudeの応答文が独特で読み手を選ぶことを指す「Claudish」という俗語も使われており、モデルごとの「個性」や文章の癖が、性能とは別の評価軸として語られている点も特徴的だった。

※本記事は5ch(Hacker News)スレッド「Grok 4.7」より抜粋・要約して構成しています。

この記事のリアクション

他サイトの新着

まだコメントはありません。

コメントする

誹謗中傷・個人を特定する書き込みは削除対象です。投稿は承認後に表示されます。

相互リンクサイト新着記事