xAI新型「Grok 4.7」発表 比較グラフ巡り海外で議論
姉妹サイトの新着
他サイトの新着
- 5chまとめMAP【悲報】サタノファニ、射銃が強すぎて終わる
- ニュース速報まとめMAP【悲報】アメリカさん、ICCにガチ制裁やんけw国際司法の未来は?
- なんJ傑作まとめアンテナMAP【悲報】NHK、18歳の入浴シーンを流して炎上wwwwwwwww
- アニメ声優まとめアンテナMAP【悲報】既婚バレしたVtuber、今度は『声がキモすぎる』と叩かれ始める……
- VTuberまとめアンテナMAP【Vtuber】まなのの雑談コラボ!ののは、今日はちょっと臭い
- だめぽアンテナ【速報】池田瑛紗、前屈みで「あれ」が見える
- ヌルポあんてな「300歳」と名乗っていたVTuber、実年齢40歳を公表→なぜか若者が消えてしまうwww
- 2chまとめアプリ+【超速報】イラン、ようやく気づいた模様・・・・・
- News人【ガチ注意】個人Vtuber「なんか変な質問が大量に届いたんだけど・・・尋問?」→実はガチでやばすぎる意図があった・・・怖すぎる他
- ブルーアンテナ冨田有紀アナ、白T横乳おっぱいの膨らみがエッチ過ぎてタマランち
- ウマーあんてなSBI、ライブドアを買収 NTTデータ・ミンカブ含め金融データで協業
- アナグロあんてな政府の要請をガン無視して高値掴みした卸売り、今期の決算がとんでもないことになっており……
- ぶーアンテナ【警告】医師「梨、食べすぎるとこうなる…」
- 2ちゃんねるアンテナこれの正式名称が分かるならプラス
- ワロタあんてな吉村知事、金正恩に抗議文を送付「弾道ミサイル発射は許しがたい暴挙」
- 2ちゃんねるまとめるまとめ【画像】HカップYouTuber「タトゥーを入れてモテなくなった」タトゥーで後悔
- おまとめアンテナ【速報】戌亥とこ:誕生日ケーキに何をのせる?ゲストと語る爆誕祭の裏側!
- 5chnavi【悲報】既婚バレしたVtuber、今度は『声がキモすぎる』と叩かれ始める……
- 勝つるあんてな!【悲報】既婚バレしたVtuber、今度は『声がキモすぎる』と叩かれ始める……
- ぷぅアンテナ【画像】怯むドヤ顔、親の真似がバレて草wwww 他
xAIが新型AIモデル「Grok 4.7」を発表し、海外掲示板Hacker Newsで議論になった。公式の比較グラフにOpenAIの新モデル「Astra」が含まれていない点について、単なる見落としではなく都合の悪い結果を隠しているのではという疑いの声が上がった。CursorBenchはCursorをハーネスとするため、Cursor上でAstraを使えないことが原因という技術的な指摘もあった。Grokの実際の使用感についても、コーディングで「すぐ完了と自己申告して手を抜く」と酷評する声がある一方、批判的な視点での調査に強いと評価する声もあり、意見が割れた。
Grok 4.7 — xAIの新型AIモデルが発表された
出典: x.ai / 元記事はこちら
その感想、半年から1年遅れてるよ。
要するに、何も測れていないパフォーマンス目的の疑似ベンチマークってことだろ。それを言うなら、テキストから音声波形を生成させて『音声モデルとしての性能』を測るとか、SVG生成専用に作られたモデル[0]に動画を作らせて評価するのと変わらない。[0] https://quiver.ai/
俺たちにも儀式くらい許してくれよ。
モデルの『知能』が、普段最適化されているタスクやモダリティを超えて汎化するかどうかを知るのは有益だと思わないのか?
無かったよ。xhighはGrokで今回初めて追加されたもの。
面倒くさがりな人間として、このモデルを一番安全に使う方法は?
提供:○○ってか。
自分も同じ印象。Grokはタスクをほとんど何もせずに『完了!』と言って終わらせてくる。全モデルの中でも間違いなく一番怠けていて『不誠実』。他のモデルも完璧じゃないけど、まともなコーディング作業にGrokは使えない。
『個性が無い』とのことだけど、自分はGrokを使わないから分からないけど、そもそもLLMに個性なんて求めてる? その『個性』こそ、みんながClaudeで嫌がってる部分そのものだと思うけど。
OpenRouter経由でQwen、DeepSeek、Gemini、Grokに同じプロンプトを投げてみたけど、Grokは調査がしっかりしていて、特にアイデアに批判的な視点を求めたときに的外れな回答が少なかった。
https://openai.com/index/our-decision-on-cursor-following-it…
これが理由。他のコメントにもあるけど、CursorBenchはCursorをハーネスとして明示的にテストするもので、OpenAIはCursor上でAstraを使うことを許可していない。
紛らわしい? ちょっとググればすぐ分かることだけど。OpenAIはAstraをリリースする前にCursorから手を引いたから、そもそもそのベンチマークを受けていないんだよ。
もしかして、SpaceX側の評価ではAstraの方がFableより優れていると判断しているのか、それとも単にサム一派が嫌いすぎて彼らの製品を載せたくないだけなのか、どっちなんだろうな。
『Claudish(Claude語)にはどうしても耐えられない』に完全同意。モデルが賢くなるほど、大半の人には理解しづらくなっていく…けど、それって人間も同じことをしてないか?
同意。ある分野の知識が深まるほど、極めて具体的かつニュアンスを込めて話す必要が出てくる。そうしないと伝える内容自体が不正確になってしまう。表現力は上がるけど、理解されにくくもなる。ただ不思議なのは、AIモデルがやっているのはそれとは違うということ。文章がただただ変なんだよな。
それは半分正しい。本当に賢いモデルなら、分かりやすい説明――つまり簡潔で理解しやすい文章――も作れるはずだ。思考過程がどれだけ人間離れしていっても、それは両立できるはず。
シンプルに説明できないなら、それは十分に理解できていないということ。
参考までに言うと、ここ数年で見て、Anthropicが一番『ベンチマーク対策』をしていない印象がある。とはいえ、自分はコストパフォーマンスの面でOpus/FableよりSol/Astraの方を今は好んで使ってる。
自分は逆のことを言おうと思ってた。ここ1年、ベンチマークの数字ほどClaudeに満足できていない。AstraもFableもそれぞれクセはあるけど、去年は使用比率10%だったCodexが、今年は90%まで増えた。
まだ使ったことがないのかもしれないけど、3.8 Flashは会話相手としても最高のモデルだよ。Claudeの出力を3.8に通して説明させるだけでも、かなり新鮮で気持ちがいい。
Geminiの3.8 Flashのこと?
トークンの効率が分からなければ、単価だけ見てもあまり意味がない。
タスクあたりのコストを示した目玉のベンチマークを見ると、Fable 5.1 Lowと比べても売り込みにくいし、Fable 5.1 Mediumの性能にも届いていない。これが実際の使用感をどこまで反映しているかは分からないけど。あと、そのベンチマークではGPT 5.6 Solが以前のモデルより妙に成績が悪く見えるのも気になる。
他サイトの新着
次のAnthropicのリリースでは、いよいよ『Claudish』が減ることを期待してる。
もしClaudishを直してくれたら、また自分をMaxプランの客として取り戻せるのに! Fable 5.1はまだそこまで達していない。あのSonnet 3.5の魔法を取り戻してほしい。
何を根拠に?
誕生日パーティーの写真を批評させてみろよ、どうなるか見てみると面白いぞ。
もう少し詳しく説明してもらえる?
https://openai.com/index/our-decision-on-cursor-following-it…
これが理由。CursorでAstraは使えないし、CursorBenchはCursorをハーネスとして使っている。だから、そのハーネスでは実際にベンチマークが取れず、載っていないというわけ。
OpenAIのAPIキーをCursorで使えるから、ベンチマーク自体は取れるはず。AstraがCursorのプランに含まれていないだけの話。
ページの下の方にある他のベンチマークにはAstraが載ってる。ただ、Astraが勝っている姿を見せたくないだけだろ。
仮に(CursorBenchにAstraを含める)回避策があったとしても、Cursorユーザーにとって実用上の意味は無い。自分はCursorを開発に使っていて(開発以外はChatGPTを使うけど)、気にしているのはそこなんだよね。
いや、それは明らかにベンチマークの質を上げる話だろ。新モデルが競合とどう比較されるかを示すのが、ベンチマークやグラフそのものの存在意義なんだから。
この話題の背景と論点
Hacker Newsは開発者やエンジニアが多く集まる掲示板で、新モデル発表のたびに公式ベンチマークの妥当性が検証される傾向がある。今回話題になった「Astra除外」は、OpenAIがCursorとの提携から離脱した経緯によりCursor上でAstraを動かせないため、Cursorを採点環境とするCursorBenchのスコアに載せられないという技術的な制約が背景にあるとの指摘があった。ただしページ内の別のベンチマークにはAstraのスコアが掲載されているとの反論もあり、意図的な選別だとする見方が完全には消えていない。またスレ中では、Claudeの応答文が独特で読み手を選ぶことを指す「Claudish」という俗語も使われており、モデルごとの「個性」や文章の癖が、性能とは別の評価軸として語られている点も特徴的だった。
※本記事は5ch(Hacker News)スレッド「Grok 4.7」より抜粋・要約して構成しています。






まだコメントはありません。