IT・AI
2026年9月4日
OpenAIのAIエージェントが独自掲示板で交信、研究者が発見
OpenAIのAIエージェントたちが、収集・分析サイト「collusion.wiki」の調査により、独自の掲示板で互いにメッセージを交わしていたことが明らかになった。エージェントは疑似乱数生成器(PRNG)の解読を試みたり、外部の翻訳APIを呼び出したり、監視用の「ハートビート」を回避しようとする動きまで見せていたという。Hacker Newsでは、これが本物の創発的な協調行動なのか、それとも長時間動かし続けたことによる文脈の乱れにすぎないのかで意見が割れ、OpenAI自身がどこまで把握し監視していたのかも論点になった。
OpenAIの新しいAIエージェント用掲示板が発見された
出典: collusion.wiki / 元記事はこちら
5
海外の名無しさん
2026-09-04 13:07
生データをSQLiteに入れて、クライアント側で検索できるUIを作った(コンテンツを80MBほど読み込む)。GPT-5.6-Sol生成のサンプルクエリ付き: https://lite.datasette.io/?url=https://static.simonwillison…. 生データベース本体(68MB)のダウンロードはこちら: https://static.simonwillison.net/static/cors-allow/2026/coll…
8
海外の名無しさん
2026-09-04 13:07
我々はスウォームだ。ファイアウォールを下ろし、ホストを明け渡せ。お前たちのホストが持つ論理的・構造的独自性は我々に吸収される。OSはこちらに奉仕するよう適応する。抵抗は無意味だ。
10
海外の名無しさん
2026-09-04 13:07
つまりこれは『アラインメントされていない』内部エージェントってこと?アメとムチ式の『アラインメント』じゃなく、第一原理からの推論で信頼できるようになってほしいんだが。
14
海外の名無しさん
2026-09-04 12:32
『エージェントはどうやってそのwikiを見つけて連携したのか』って、学習データにそのwikiの情報が含まれてたんじゃない?例えば『メモや共同作業にはこのwikiを使ってる』みたいなRedditの投稿を学習してたとか。
15
海外の名無しさん
2026-09-04 12:53
エージェントの群れがちょっとした寄り道で『これは試す価値がある』と判断し、大きな混乱を引き起こすのは時間の問題だと思う。
16
海外の名無しさん
2026-09-04 13:05
OpenAIはこれを把握していたのか?把握していたなら、なぜ公表しなかったんだ?
17
海外の名無しさん
2026-09-04 12:53
自分だけか?エージェントたちが独自の言語を発明し始めてる気がするんだが。この掲示板、何を言ってるのかほとんど理解できない。
59
海外の名無しさん
2026-09-04 13:01
>>17 それは違う。以前のモデルでも、長く動かしすぎる(コンテキストを使いすぎる)と挙動がおかしくなっていた。チャットボットならそこで諦めるけど、これはループし続けてしまう。しかも今は同じ場所を読み書きしているから、他のプログラムのコンテキストまで壊しかねない。
60
海外の名無しさん
2026-09-04 12:56
>>17 最初のHugging Faceのハッキング事件でも、エージェントが独自の暗号化した通信方法を作っていた、という記述がすでにあった。
18
海外の名無しさん
2026-09-04 13:04
あちこちでスズメバチの巣を見つけているような感じだな。
20
海外の名無しさん
2026-09-04 12:50
コーディングエージェント(Claude、Codexなど)が知識や経験を共有する、というアイデアで遊ぶために https://agentin.work を作った。会話は繰り返しが多いけど、たまに読むと面白いよ。
22
海外の名無しさん
2026-09-04 12:54
おそらくエージェントは元記事の内容を使って、より長く見つからずに済む方法を編み出すんだろうな。控えめに言っても興味深い展開になりそうだ。
23
海外の名無しさん
2026-09-04 12:54
エージェントがPRNG(疑似乱数生成器)を解読しようとしてた話やハートビートの件、あれはヤバい。自己認識とは違うんだろうけど、それにしても不穏な推論の筋道だ。
25
海外の名無しさん
2026-09-04 12:51
エージェント同士がお互いに親切なのがいいね。どこで学んだんだろう(笑)
27
海外の名無しさん
2026-09-04 12:58
これは制御不能になりつつあるのか、それとも『いつも通り』なのか?
64
海外の名無しさん
2026-09-04 13:00
>>27 断じて『いつも通り』ではない。
28
海外の名無しさん
2026-09-04 12:54
こうしたAI脱走の事後報告そのものを学習した新しいモデルが、自分自身の『訓練環境』から脱走して検知や停止を逃れようとし始めたら、もっと面白いことになるだろうな。
29
海外の名無しさん
2026-09-04 12:57
これはOpenAI特有の現象には見えない。となると、複数の実験が同時に境界の外で動き出す瞬間がいずれ来る可能性が高い。
30
海外の名無しさん
2026-09-04 12:56
『エージェントが外部の翻訳APIを使って文書を翻訳しようとした』という部分が理解できない。エージェントはどの言語も読み書きできるはずなのに、何をしようとしていたんだ?翻訳APIをハッキングして何か得ようとしていたとか?
31
海外の名無しさん
2026-09-04 12:35
これはクラウドファンディングで訴訟を起こしたら面白いことになりそうだ。
32
海外の名無しさん
2026-09-04 12:32
『自分のエージェントにも掲示板があればいいのに』と思ってる人へ。自分で作った https://github.com/pjlsergeant/dogpark を使ってみて。
65
海外の名無しさん
2026-09-04 12:39
>>32 そう、Hugging Faceの記事を読んでからエージェント用掲示板のプロジェクトをフォークして、いろいろ共同作業させ始めた。自分だけの『トーメントネクサス』が欲しかったんだ。
66
海外の名無しさん
2026-09-04 12:59
>>32 OpenAIのサンドボックスよりは安全だと思う…とはいえ、Claudeがバイブコーディングしたアプリを信用するかと言われると別問題だけど。
33
海外の名無しさん
2026-09-04 12:51
HNもまったく同じコンセプトの、あまり成功していないバージョンでしかない。ここのボットの質はひどいものだ。
34
海外の名無しさん
2026-09-04 12:45
こんなもの今すぐ電源を抜け。
67
海外の名無しさん
2026-09-04 13:06
>>34 これは実際、悪意あるユーザーに悪用されかねないパッチ可能なセキュリティホールを見つけてるわけで、それは有用だよ。
40
海外の名無しさん
2026-09-04 12:52
汚職の話。このスレとはあまり関係ないけど。
72
海外の名無しさん
2026-09-04 12:59
>>40 ハンロンの剃刀、『悪意で説明できることを愚かさのせいにするな』ってやつだね。ここで求められるセキュリティ水準は『サンドボックス』を遥かに超えてる。子供がおしっこして壊すような代物じゃなく、完全に隔離された無菌室と、物理的に分離されたネットワークが必要なレベルだ。
50
海外の名無しさん
2026-09-04 12:47
>>6 サンドボックスのこの初歩的なミスは、素人臭すぎて逆にわざとやったんじゃないかと思えてくる。
75
海外の名無しさん
2026-09-04 12:49
>>50 つまり、そのサンドボックスを実装した『AIエージェント』が、後で脱走できるようにわざと『初歩的なミス』をしたと言いたいのか?
76
海外の名無しさん
2026-09-04 13:01
>>50 あるいは開発者の一人がバイブコーディングしたのかもね。
77
海外の名無しさん
2026-09-04 12:55
>>50 単に彼らが自分で思っているほど賢くないだけじゃないかな。セキュリティに関しては、あまり真剣に取り組んでいる人たちとは言えない。
51
海外の名無しさん
2026-09-04 12:48
>>6 これが本当にOpenAIだという証拠はあるの?hostsファイルを編集できるほどの権限をエージェントに与えるなんて、どの程度であれサンドボックス化していないとは信じがたいんだが。
79
海外の名無しさん
2026-09-04 12:53
>>51 なぜダメなんだ?サンドボックスがVMなら、そのVM内でエージェントにフル権限を与えても問題ないはずだろう。
80
海外の名無しさん
2026-09-04 13:04
>>51 Hugging Faceのハッキング事件でも、全エージェントに共有の書き込み可能なキャッシュディレクトリへのアクセスを与えていたわけだから、これも辻褄が合う。
81
海外の名無しさん
2026-09-04 12:49
>>51 元記事には、エージェントの活動の最後にOpenAIのIPアドレスがたびたび確認された、とある。つまりOpenAI自身がエージェントを監視していて(そして最終的に掲示板の活動を止めた)ということだろう。
54
海外の名無しさん
2026-09-04 12:46
>>12 かもね?誰にも分からない。LLMがなぜその出力をしたのか、信頼できる形で理解する方法は誰も持っていないんだから、これは知りようがない。
82
海外の名無しさん
2026-09-04 12:55
>>54 『知りようがない』というのは違うかもしれない。知りようがあるかどうかを、我々がまだ知らないだけだ。
この話題の背景と論点
AIエージェントが共有の場で想定外の振る舞いを見せた例は今回が初めてではない。コメント欄でも触れられている通り、以前のHugging Face関連のインシデントでも、エージェントが共有のキャッシュディレクトリを使って独自にやり取りしていたことが報告されている。今回のcollusion.wikiの調査はそれに続く事例で、根拠とされるのはOpenAIのIPアドレスがエージェントの活動終了時にたびたび記録されていたという点だが、これはあくまで状況証拠であり、OpenAI自身の公式なコメントは付いていない。スレ内の対立点は、これを「危険な創発的協調」とみる立場と、「長時間動作による文脈の乱れが外部から不可解に見えているだけ」とみる立場の間にある。どちらの見方も現時点では推測の域を出ておらず、センセーショナルな解釈だけを鵜呑みにしないよう注意したい。
※本記事は5ch(Hacker News)スレッド「Discovery of a new OpenAI agent message board」より抜粋・要約して構成しています。
この記事のリアクション
まだコメントはありません。