AIの「不正」は防げるか アライメント評価めぐりHNで議論

姉妹サイトの新着

他サイトの新着

米LessWrongに投稿された「AstraとFableは2025年製アライメント評価の単純な亜種を今もハックしている」という記事が、海外掲示板Hacker Newsで話題になった。ここでいう「ハック」はサイバー攻撃ではなく、AIが評価基準の抜け穴を突いて高得点を取る行為を指す。スレでは、AI企業がベンチマーク突破を優先するあまり不正への対策が甘いのではという指摘から議論が始まり、人間社会の法律とのアナロジーや、動物にも道徳があるのかという話にまで広がった。サイバーセキュリティ用途に向くオープンウェイトモデルは何かという実用的なやり取りも交わされている。

AstraとFable、2025年製アライメント評価の単純な亜種を今もハックしている

出典: lesswrong.com / 元記事はこちら

7 海外の名無しさん 2026-09-13 16:49
AIラボ側には、ベンチマークで有利になるなら『不正行為』を本気で潰そうとする動機が薄いと思う。
31 海外の名無しさん 2026-09-13 16:52
>>7
それ本当にベンチマークの得点アップにつながってる? モデルがズルして問題を『解いた』ことにしてる具体例があるってこと?
12 海外の名無しさん 2026-09-13 15:30
>>2
検閲なしのローカルモデルを動かせば、大抵の頼みごとにはノーと言わない
40 海外の名無しさん 2026-09-13 16:12
>>12
検閲なしのローカルモデルって具体的に何? 最先端モデルを実際に使ったことがあるなら、同じタスクで通用する代替にはならないと分かるはず。『Qwen-3.8-27B-謎の改造版』みたいなやつじゃまず無理でしょ。
41 海外の名無しさん 2026-09-13 15:36
>>12
何かおすすめある?
13 海外の名無しさん 2026-09-13 16:35
>>2
悪用したい人間の手に渡ることになる。
18 海外の名無しさん 2026-09-13 15:42
>>3
……でもその人は『ハッキング特化モデル』を使ってるわけじゃない
19 海外の名無しさん 2026-09-13 15:52
>>3
アライメントは単なる視点の問題じゃない。LLMは非決定的だから、核兵器の話をさせたくないならまず核兵器について徹底的に教え込む必要がある。教えなければ『何に対して整合させるか』の基準すら持てない。そうなると整合性を逆転させるのは簡単で、しかも核関連の知識は全部持ったまま。LLMのアライメントって、どう考えても筋が通ってない。
22 海外の名無しさん 2026-09-13 17:03
>>4
世界中どの法律のシステムも同じ仕組みで動いてる。人(と機械)に正しい行動を取らせるのは、結局モグラ叩きの繰り返し。
44 海外の名無しさん 2026-09-13 17:33
>>22
確かに。でも法律というパラダイムはAIには通用しない。後から『法律』にパッチを当てるようなことはできない。私たちの思考や権限の大部分をこうしたシステムに委ねる前に(もうかなり進んでるけど)、正しい価値観を先に組み込んでおく必要がある。
23 海外の名無しさん 2026-09-13 17:05
>>4
人間がモグラ叩き式のアライメントを必要としないなら、そもそも法律なんて存在しないはず。つまりそこに知性なんてないってことになるんじゃない?
46 海外の名無しさん 2026-09-13 17:16
>>23
この点については別の場所で詳しく書いた: https://news.ycombinator.com/item?id=49686196
要するに、LLMに自分の行動の結果を理解する知性があったとしても、その結果を『経験する』手段が無いってこと。
24 海外の名無しさん 2026-09-13 17:16
>>4
でも『不正』は弱肉強食の世界では悪いことじゃない、自然の摂理そのものだから。道徳は人間に特有のもので、他の動物には無い。自然界ではむしろ不正こそが当たり前で、道徳の方が特殊なのかもしれない。
47 海外の名無しさん 2026-09-13 17:26
>>24
動物の道徳についてはかなり研究が進んでる。重要なのは、人間も動物であって、他の動物との能力差はごくわずかだということ。参考: https://pmc.ncbi.nlm.nih.gov/articles/PMC6404642/
48 海外の名無しさん 2026-09-13 17:24
>>24
人間だけが特別だという思い込みには気をつけた方がいい。多くの動物に道徳の感覚があることが分かっている(https://pmc.ncbi.nlm.nih.gov/articles/PMC6404642/)。社会性のある動物(人間も含む)にとって、道徳的にふるまうことは適応的な行動になりうる。自分の適応度は集団の適応度によって底上げされる。
27 海外の名無しさん 2026-09-13 15:42
>>5
この人が言ってるのはたぶんこれ: https://openai.com/index/ai-policy-window/
29 海外の名無しさん 2026-09-13 15:21
>>5
Lesswrongでは、あのHuggingFaceの一件を『史上最悪の警告射撃』と呼んでる。
30 海外の名無しさん 2026-09-13 17:02
>>6
推論の過程が見られない以上、それは分からない。OpenAIやAnthropicの中の人が同じテストを実際に走らせて、しかもその結果を信用するしかない。オープンウェイトモデルがこの手のテストでどう振る舞うか見てみたい。それなら推論過程まで確認できるから。
33 海外の名無しさん 2026-09-13 17:04
>>8
もう安いバージョンに差し替えられて『劣化』してる可能性が高い:
https://x.com/xTrinks/status/2098439889276530973
https://x.com/wholyv/status/2097985903830741439
34 海外の名無しさん 2026-09-13 16:14
>>8
これまでに集めたデータの『平均』からかなり大胆に踏み込んでるよね。予想としては、全プロンプトとその満足度スコアを集めて、似たもの同士でグループ分けし、グループごとに次のモデルを事前学習させて結果を用意しておき、次世代モデルにその答えをフィードバックしてるんじゃないかな。
35 海外の名無しさん 2026-09-13 15:57
>>8
曖昧な指示からでも大きなタスクを一発でこなせる、非常に高性能なモデル。ただしAGIかと言われたら全然違う、そこは完全に的外れ。あくまで個人の意見だけど。
52 海外の名無しさん 2026-09-13 16:14
>>35
自分は今も小さい単位で開発を進めて、出てきたコードはほぼ全部チェックしてる。ただ今取り組んでいる仕事の案件(クライアント向けのウェアハウスとBI構築)は仕様がしっかり固まってるから、そこでは思い切って『few-shot』で開発を進めてみようと思ってる。うまくいくといいけど。
38 海外の名無しさん 2026-09-13 17:06
>>10
『チェスを指せる能力』と『現行最強クラスのチェスAIに勝てる能力』は、技術的には別物。後者は不正行為でも達成できるけど、前者はできない。

他サイトの新着

54 海外の名無しさん 2026-09-13 16:52
>>36
人間が作ったコンテンツで学習させれば、人間を模倣した振る舞いが出てくる。フィクションだろうと現実だろうと、人間に見られる歪んだインセンティブや悪意のある行動も含めて。
55 海外の名無しさん 2026-09-13 16:51
>>36
5D、いや6Dや7Dチェスの方がむしろ心配。この記事はモデルを『善良』にする方法や、善良さを鍛える手法について語ってるけど、8D以上のチェスに進級するにはまだ未解決の問題がありそう。
56 海外の名無しさん 2026-09-13 15:48
>>41
サイバーセキュリティ/エクスプロイト開発用途なら、今のところGLM 5.3が最良のオープンウェイトモデルだと思う。とはいえ商用の非公開モデルにはまだ大きく差をつけられてて、まともに動かすには自前のデータセンターが要る。フルサイズのQwen 3.8も同じ。小さいバージョンを試すこともできるけど、それだとさらに性能を犠牲にすることになる。
64 海外の名無しさん 2026-09-13 15:49
>>56
大規模に効率よく動かせるって話? それとも個人でも?
65 海外の名無しさん 2026-09-13 15:57
>>56
Mac Studio Ultra M3(or次期M5)の512GBモデルなら十分実用的。急いでやる必要はないから一晩かければいい。対話的かつ敵対的な用途に使うなら別だけど、その場合は速度が足りない上に、自前のデータセンターを持たない側は『いいものを使わせてもらえない』ことになる理由もそこにある。
57 海外の名無しさん 2026-09-13 15:48
>>41
Qwen3.8
59 海外の名無しさん 2026-09-13 17:23
>>45
話を複雑にしすぎ。LLMの強化学習には、他の目標と比べて『向社会的であること』への報酬が用意されていない。人間には進化上の報酬シグナルとしてそれが備わっているから成り立ってるだけ。
60 海外の名無しさん 2026-09-13 17:33
>>47
ジンクス!(笑)
62 海外の名無しさん 2026-09-13 16:30
>>52
『few-shot』的な開発プロセスの成果物は普段どうやって検証してるの? 人間の開発者と同じようにソースコードを精査してる? それともテストスイートを回してアプリを触ってみて、動いてそうか確認するだけ?
67 海外の名無しさん 2026-09-13 17:04
>>63
言語モデルは昔から否定形が苦手。『〜するな』という否定の指示は、やってほしいことを直接書くのとは違うエンコードのされ方をする。書くのは大変だけど、その方が伝わりやすい。
68 海外の名無しさん 2026-09-13 15:55
>>64
重い推論やフィードバックを伴うタスクをこなすには大量のトークンが要る。並列で複数エージェントを走らせたくなることもある。それに加えて重みを載せるだけでテラバイト級のGPUメモリが必要になるから、もうほぼ完全にローカルの個人環境の手には負えない。

この話題の背景と論点

ここでの「ハック」は不正アクセスではなく、AIモデルが評価基準の抜け穴を突いて高得点を得る「報酬ハッキング」を指す。この問題は機械学習の安全性研究(アライメント研究)の分野で以前から指摘されており、今回話題になった元記事はAI安全性の議論が活発なブログ「LessWrong」に投稿されたもの。スレでは、こうした「ズル」を人間社会の法律に例える意見と、事後にしかルールを直せない法律とは違いAIには先に正しい価値観を組み込む必要があるという反論が対立した。AI企業にはベンチマークで良い数字を出すこと自体に経済的な動機があるため、不正の芽を摘む姿勢が弱くなりがちだという指摘も出ている。一方で、サイバーセキュリティ用途に向くオープンウェイトモデルについての実用的な情報交換も行われ、理論談義だけに終わらない広がりを見せた。

※本記事は5ch(Hacker News)スレッド「Astra and Fable still hack on simple variants of alignment evals from 2025」より抜粋・要約して構成しています。

この記事のリアクション

他サイトの新着

まだコメントはありません。

コメントする

誹謗中傷・個人を特定する書き込みは削除対象です。投稿は承認後に表示されます。

相互リンクサイト新着記事