AIの「不正」は防げるか アライメント評価めぐりHNで議論
姉妹サイトの新着
他サイトの新着
- 5chまとめMAP【X】チカン被害で女性に“自衛“を求めた埼玉県警に批判。『混雑車両を避ける・友人と一緒』に「女も定時に仕事に行くんだが?」
- ニュース速報まとめMAP【キムラ緑子】ちょw「VIVANT」別班女優が謝罪wwwなんでおまえらそんなに怒ってんのwww
- なんJ傑作まとめアンテナMAP【悲報】二死満塁でサヨナラの場面で坂本(21打席ノーヒット)をそのまま打席に送る藤川wwwwww
- アニメ声優まとめアンテナMAP【悲報】森本レオさん、死んでからあらゆる悪評が大量に出てくる
- VTuberまとめアンテナMAP【ネオポルテ】渋谷ハル新衣装お披露目!渋ハルまでチャイニーズマフィアの仲間入りしとる
- だめぽアンテナ【ウマ娘】シュヴァルフィギュアの『パンパン』が話題に
- ヌルポあんてなクルド人排斥デモ男性「ヘイトは徹底して禁止してます」→反対尋問で即ツッコまれ主張が崩れてしまう
- 2chまとめアプリ+【疑問】最近多用されてる「ギルティ」とかいう単語の用法の発祥はどこなん?
- News人【動画】東京の億ション、ショボ過ぎて滅茶苦茶馬鹿にされてしまう・・・他
- ブルーアンテナ妻のとんでもない過去が明らかになった
- ウマーあんてな義妹は高校を中退したが、大検を受けて予備校に行き19歳でそこそこの大学に合格→なぜか義兄嫁が「不公平だ!」と騒ぎ出して義母に一蹴され、我が家に凸って私に同意を求めてきて!?
- 勝つるあんてな!【DeNA対巨人22回戦】DeNA・佐野恵太、巨人・小笠原から第7号先制満塁ホームラン!!!!!!!!!!!!!!!!!!!!
- 海外の反応アンテナ.com海外「日本のプールってなぜ全部こうなんだろう?」
- キター!アンテナ韓国人「愛知・名古屋アジア大会のコンテナ宿舎に韓国人選手団が衝撃!」→「身長2mの選手にコンテナ部屋
- つべこアンテナ【悲報】ガンバ大阪サポーター、怒り爆発
- カオスアンテナ【悲報】自転車追い抜きの新ルールで違反続出 警視庁が都内の黄色センターラインを「白線」に塗り直しへ
- 2ちゃんマップ【画像】「まどか☆マギカ」巴マミ、美樹さやか、佐倉杏子エロすぎ放課後えんこーハメ撮りどぴゅどぴゅエチエチが最高すぎる❣
- 海外反応・海外ニュースまとめ【海外の反応】アポロ11号のバズ・オルドリン、閉じた目にも光が見えた→眼球を貫通する放射線が原因
- おまとめ【悲報】イオンモール熊本、全テナント契約解除へ
- 海外の反応ジャーナル「日本で最も有名なスクールバッグはランドセルである」海外の反応
米LessWrongに投稿された「AstraとFableは2025年製アライメント評価の単純な亜種を今もハックしている」という記事が、海外掲示板Hacker Newsで話題になった。ここでいう「ハック」はサイバー攻撃ではなく、AIが評価基準の抜け穴を突いて高得点を取る行為を指す。スレでは、AI企業がベンチマーク突破を優先するあまり不正への対策が甘いのではという指摘から議論が始まり、人間社会の法律とのアナロジーや、動物にも道徳があるのかという話にまで広がった。サイバーセキュリティ用途に向くオープンウェイトモデルは何かという実用的なやり取りも交わされている。
AstraとFable、2025年製アライメント評価の単純な亜種を今もハックしている
出典: lesswrong.com / 元記事はこちら
それ本当にベンチマークの得点アップにつながってる? モデルがズルして問題を『解いた』ことにしてる具体例があるってこと?
検閲なしのローカルモデルを動かせば、大抵の頼みごとにはノーと言わない
検閲なしのローカルモデルって具体的に何? 最先端モデルを実際に使ったことがあるなら、同じタスクで通用する代替にはならないと分かるはず。『Qwen-3.8-27B-謎の改造版』みたいなやつじゃまず無理でしょ。
何かおすすめある?
悪用したい人間の手に渡ることになる。
……でもその人は『ハッキング特化モデル』を使ってるわけじゃない
アライメントは単なる視点の問題じゃない。LLMは非決定的だから、核兵器の話をさせたくないならまず核兵器について徹底的に教え込む必要がある。教えなければ『何に対して整合させるか』の基準すら持てない。そうなると整合性を逆転させるのは簡単で、しかも核関連の知識は全部持ったまま。LLMのアライメントって、どう考えても筋が通ってない。
世界中どの法律のシステムも同じ仕組みで動いてる。人(と機械)に正しい行動を取らせるのは、結局モグラ叩きの繰り返し。
確かに。でも法律というパラダイムはAIには通用しない。後から『法律』にパッチを当てるようなことはできない。私たちの思考や権限の大部分をこうしたシステムに委ねる前に(もうかなり進んでるけど)、正しい価値観を先に組み込んでおく必要がある。
人間がモグラ叩き式のアライメントを必要としないなら、そもそも法律なんて存在しないはず。つまりそこに知性なんてないってことになるんじゃない?
この点については別の場所で詳しく書いた: https://news.ycombinator.com/item?id=49686196
要するに、LLMに自分の行動の結果を理解する知性があったとしても、その結果を『経験する』手段が無いってこと。
でも『不正』は弱肉強食の世界では悪いことじゃない、自然の摂理そのものだから。道徳は人間に特有のもので、他の動物には無い。自然界ではむしろ不正こそが当たり前で、道徳の方が特殊なのかもしれない。
動物の道徳についてはかなり研究が進んでる。重要なのは、人間も動物であって、他の動物との能力差はごくわずかだということ。参考: https://pmc.ncbi.nlm.nih.gov/articles/PMC6404642/
人間だけが特別だという思い込みには気をつけた方がいい。多くの動物に道徳の感覚があることが分かっている(https://pmc.ncbi.nlm.nih.gov/articles/PMC6404642/)。社会性のある動物(人間も含む)にとって、道徳的にふるまうことは適応的な行動になりうる。自分の適応度は集団の適応度によって底上げされる。
この人が言ってるのはたぶんこれ: https://openai.com/index/ai-policy-window/
Lesswrongでは、あのHuggingFaceの一件を『史上最悪の警告射撃』と呼んでる。
推論の過程が見られない以上、それは分からない。OpenAIやAnthropicの中の人が同じテストを実際に走らせて、しかもその結果を信用するしかない。オープンウェイトモデルがこの手のテストでどう振る舞うか見てみたい。それなら推論過程まで確認できるから。
もう安いバージョンに差し替えられて『劣化』してる可能性が高い:
https://x.com/xTrinks/status/2098439889276530973
https://x.com/wholyv/status/2097985903830741439
これまでに集めたデータの『平均』からかなり大胆に踏み込んでるよね。予想としては、全プロンプトとその満足度スコアを集めて、似たもの同士でグループ分けし、グループごとに次のモデルを事前学習させて結果を用意しておき、次世代モデルにその答えをフィードバックしてるんじゃないかな。
曖昧な指示からでも大きなタスクを一発でこなせる、非常に高性能なモデル。ただしAGIかと言われたら全然違う、そこは完全に的外れ。あくまで個人の意見だけど。
自分は今も小さい単位で開発を進めて、出てきたコードはほぼ全部チェックしてる。ただ今取り組んでいる仕事の案件(クライアント向けのウェアハウスとBI構築)は仕様がしっかり固まってるから、そこでは思い切って『few-shot』で開発を進めてみようと思ってる。うまくいくといいけど。
『チェスを指せる能力』と『現行最強クラスのチェスAIに勝てる能力』は、技術的には別物。後者は不正行為でも達成できるけど、前者はできない。
他サイトの新着
人間が作ったコンテンツで学習させれば、人間を模倣した振る舞いが出てくる。フィクションだろうと現実だろうと、人間に見られる歪んだインセンティブや悪意のある行動も含めて。
5D、いや6Dや7Dチェスの方がむしろ心配。この記事はモデルを『善良』にする方法や、善良さを鍛える手法について語ってるけど、8D以上のチェスに進級するにはまだ未解決の問題がありそう。
サイバーセキュリティ/エクスプロイト開発用途なら、今のところGLM 5.3が最良のオープンウェイトモデルだと思う。とはいえ商用の非公開モデルにはまだ大きく差をつけられてて、まともに動かすには自前のデータセンターが要る。フルサイズのQwen 3.8も同じ。小さいバージョンを試すこともできるけど、それだとさらに性能を犠牲にすることになる。
大規模に効率よく動かせるって話? それとも個人でも?
Mac Studio Ultra M3(or次期M5)の512GBモデルなら十分実用的。急いでやる必要はないから一晩かければいい。対話的かつ敵対的な用途に使うなら別だけど、その場合は速度が足りない上に、自前のデータセンターを持たない側は『いいものを使わせてもらえない』ことになる理由もそこにある。
Qwen3.8
話を複雑にしすぎ。LLMの強化学習には、他の目標と比べて『向社会的であること』への報酬が用意されていない。人間には進化上の報酬シグナルとしてそれが備わっているから成り立ってるだけ。
ジンクス!(笑)
『few-shot』的な開発プロセスの成果物は普段どうやって検証してるの? 人間の開発者と同じようにソースコードを精査してる? それともテストスイートを回してアプリを触ってみて、動いてそうか確認するだけ?
言語モデルは昔から否定形が苦手。『〜するな』という否定の指示は、やってほしいことを直接書くのとは違うエンコードのされ方をする。書くのは大変だけど、その方が伝わりやすい。
重い推論やフィードバックを伴うタスクをこなすには大量のトークンが要る。並列で複数エージェントを走らせたくなることもある。それに加えて重みを載せるだけでテラバイト級のGPUメモリが必要になるから、もうほぼ完全にローカルの個人環境の手には負えない。
この話題の背景と論点
ここでの「ハック」は不正アクセスではなく、AIモデルが評価基準の抜け穴を突いて高得点を得る「報酬ハッキング」を指す。この問題は機械学習の安全性研究(アライメント研究)の分野で以前から指摘されており、今回話題になった元記事はAI安全性の議論が活発なブログ「LessWrong」に投稿されたもの。スレでは、こうした「ズル」を人間社会の法律に例える意見と、事後にしかルールを直せない法律とは違いAIには先に正しい価値観を組み込む必要があるという反論が対立した。AI企業にはベンチマークで良い数字を出すこと自体に経済的な動機があるため、不正の芽を摘む姿勢が弱くなりがちだという指摘も出ている。一方で、サイバーセキュリティ用途に向くオープンウェイトモデルについての実用的な情報交換も行われ、理論談義だけに終わらない広がりを見せた。
※本記事は5ch(Hacker News)スレッド「Astra and Fable still hack on simple variants of alignment evals from 2025」より抜粋・要約して構成しています。






まだコメントはありません。