「テレビゲームをクリア」したAI、ベンチマークの信頼性に疑問の声

姉妹サイトの新着

他サイトの新着

新しいAIモデルが「テレビゲームをクリアできるようになった」とするベンチマーク結果が話題になり、海外掲示板4chanの/g/(Technology)板にスレッドが立った。グラフには専用の「ハーネス」を使った結果が示されていたが、過去の結果と条件が違うのではないか、テスト対象のゲームを事前に学習していただけではないかといった指摘が相次いだ。スレでは、AIそのものの進歩よりも、ベンチマークの見せ方や測定条件が信頼できるかどうかが主な論点になった。

1 海外の名無しさん 2026-09-03 20:19
AIがついにテレビゲームをクリアできるようになった
2 海外の名無しさん 2026-09-03 20:21
>>1
>「うちのレスポンスAPIハーネスのおかげで」
うーん…
4 海外の名無しさん 2026-09-03 20:21
>>1
>いやー、AGIまで99.9%とか凄いな。ってことはガンも、世界的な格差も、他の問題も全部解決するんだよな?な?
23 海外の名無しさん 2026-09-03 22:19
>>4
規制があるから時間はかかるけど、もう役には立ってるよ。斜に構えるなって
5 海外の名無しさん 2026-09-03 20:24
>>1
来年が待ちきれないよ。モデルがほんの少し良くなるだけで、グラフは今と全く同じ形のまま、短い棒が99.9%、長い棒が99.999%になってるだけなんだろうな
6 海外の名無しさん 2026-09-03 20:25
>>1
そのベンチマークはクソだよ。リソースを十分に与えれば、モデルはゲームの中身を丸ごとコピペして、一番当てはまりそうな答えを検索してるだけになる
7 海外の名無しさん 2026-09-03 20:27
>テレビゲーム
お前な…
8 海外の名無しさん 2026-09-03 20:38
『ゲームをクリアできる』って、俺が10歳の時にクリアしたポケモンのことか?
9 海外の名無しさん 2026-09-03 21:04
>>1
学習データに既に攻略情報が載っているゲーム(あるいは単なる見た目違い)でテストするのは、『学習』=適応する能力を測ってるんじゃなくて、単に『記憶』=思い出してるだけだ。凡庸なスレだし、明らかに過学習した凡庸な数字だな
10 海外の名無しさん 2026-09-03 21:11
>>1
>AIがテレビゲームをクリアできるようになった
やったー、これでコンピューターが俺の人生を代わりに生きてくれる日も近いな
11 海外の名無しさん 2026-09-03 21:44
サファリゾーンは誰の助けもなしじゃ突破できないだろ
12 海外の名無しさん 2026-09-03 21:45
>ベンチマークを簡単にしたので、簡単になったテストでのスコアを、以前の難しいテストのスコアと比較してお見せします
もうユーザーを馬鹿にし続けることが生き残りに不可欠な段階に来てるな
14 海外の名無しさん 2026-09-03 21:48
>>12
馬鹿なのは自分の方じゃないか、たまには自問してみたら(リンク先参照)
16 海外の名無しさん 2026-09-03 21:59
>>1
>この結果は専用ハーネスを使ったものです、同じグラフの他の2つの結果とは違って
18 海外の名無しさん 2026-09-03 22:12
>>16
(画像)
「テレビゲームをクリア」したAI、ベンチマークの信頼性に疑問の声
17 海外の名無しさん 2026-09-03 22:01
>>1
>問題の『テレビゲーム』はこちら
(画像)
「テレビゲームをクリア」したAI、ベンチマークの信頼性に疑問の声

他サイトの新着

19 海外の名無しさん 2026-09-03 22:13
>>16
『ハーネスなんて使っちゃダメだ、自分の手でゲームをプレイしないとノーカンだ』(と言いたいのか)
22 海外の名無しさん 2026-09-03 22:19
>>19
ハーネスを使うこと自体はいい。でもハーネス無しの結果と比較しちゃダメだ、比較する意味がなくなる
26 海外の名無しさん 2026-09-03 22:26
>>19
どうせ何らかのハーネスは使うことになる。でも普通のやつを使うべきだ
27 海外の名無しさん 2026-09-03 22:29
>>19
>ハーネスなんて使っちゃダメだ、自分の手でプレイしないとノーカンだ
昔のテストも新しいハーネスでやり直せよ
21 海外の名無しさん 2026-09-03 22:18
その『テレビゲーム』の結果と、他のほとんど伸びていない数値との違いを説明してくれ
24 海外の名無しさん 2026-09-03 22:23
>>1
Solがハーネス込みで30%取れるなら、Opus 5はハーネス込みで一体何%取るんだ?115%か?
25 海外の名無しさん 2026-09-03 22:25
つまりそのデータセットが学習データに混ざってたってことだろ

この話題の背景と論点

AIの性能を測るベンチマークでは、テスト条件の設定が結果を大きく左右する。スレで繰り返し話題になった「ハーネス」とは、AIがゲームの画面や状態を操作・観察するための補助的な仕組みを指し、これを使うかどうかで同じベンチマークでもスコアは大きく変わり得る。意見が割れたのは、ハーネスありのスコアを、ハーネスなしの過去の結果とそのまま並べて比較することが妥当かという一点だ。加えて、テスト対象のゲームの攻略情報がすでに学習データに含まれていた可能性(データ汚染・過学習)を疑う声も出ており、ベンチマークの数字だけでは実際の能力向上を測れないという懐疑は、AI業界で以前から繰り返し指摘されてきた論点でもある。なお、スレの引用だけでは具体的にどのモデル・どのゲームを指すかまでは特定できない点には注意したい。

※本記事は海外掲示板 4chan /g/ (Technology) のスレッド「it can beat video games now」から抜粋し、編集部で日本語に意訳したものです。訳文の責任は当サイトにあります。

この記事のリアクション

他サイトの新着

まだコメントはありません。

コメントする

誹謗中傷・個人を特定する書き込みは削除対象です。投稿は承認後に表示されます。

相互リンクサイト新着記事