OSSのAIモデルに「時限式バックドア」の懸念、海外掲示板で議論に
姉妹サイトの新着
「オープンソースのAIモデルには、特定の日付が来ると悪意ある挙動を始める“時限式バックドア”が仕込まれているかもしれない」とする記事がHacker Newsで話題になった。
「中国製モデルが危険」という主張への皮肉や、APIでしか使えないクローズドモデルの方が標的を狙い撃ちしやすいという反論、学習データの汚染やバッチ順序で敵対的な挙動を仕込めるとする研究への言及など、議論は単純な「オープンかクローズドか」の対立にとどまらず広がった。
あなたが使っているオープンソースAIモデルには、隠された時限式バックドアが仕込まれているかもしれない
出典: morgin.ai / 元記事はこちら
誰かが自分のデータで学習してると常に思っておいた方がいい(競争力を失うレベルまでではなくても、個人レベルでは)。A国のモデルはネットから切り離して使って、出力はB国のモデルでチェックする、みたいな運用はどうだろう?
この記事を読んで最初に思ったのは、QwenとかChinese製のオープンモデルがこれをやるというより、Hugging Faceにある大量の『unlocked(検閲解除)』モデルのどれかがやりそうだな、ということだった
Claudeが延々と迷走している会話の40ターン目くらいになると、そういう心配がふと頭をよぎる。その頃にはもう疲れ果てて、ただコピペしてENTERを押すだけの機械になっている。CLIの実行内容を一つ一つ丹念にチェックすればいいんだろうけど、そんな時間誰にある?
シェルツールやPythonツール、JavaScriptツールを持っているモデルなら、現在時刻くらい普通に取得できる
それ、わりとすぐ気づかれるんじゃない?
LLMに好き放題やらせてなければね。まさかそんなことしてないよね?
いや、OpenCodeはデフォルトでbash実行を許可してるよ
これに気づいたらFacebook AIは大慌てだろうね。『オープンソースモデル』を『我々は善玉です』を説明するための魔法の宣伝文句として使うのをやめないといけなくなる
プロプライエタリなモデルもオープンウェイトなモデルも、どっちもクローズドソースだよ。本当のオープンソースなら学習データも含まれていて、誰でも同等の性能のモデルを学習できるはずだから
そもそもアライメント問題自体が未解決なんだから、汚染されていない学習データだったとしても、それで十分という保証すらないよ
まさにそれ。政府との密約があればバックドアが仕込まれる可能性はあるし、それに何十億トークンもの学習データという問題もある
NSAの『fast16』ドライバは、イランのコンピュータ上で核シミュレーションのデータを気づかれないように改ざんしていた。オープンウェイトのモデルでも同種の攻撃は可能だ。例えば、兵器システムに使われそうなモデルなら、中国国内でだけGPS座標をわずかにずらして返す、といったことも考えられる。クローズドだろうがオープンウェイトだろうが、モデルというものに全幅の信頼を置くべきではない
他サイトの新着
ちなみに、条件が日付だけ(それ以外の要素がない)なら、研究者や興味のある人が未来の日付を与えてみて、何か変化が起きるか調べることができる
まあ、その『スリーパー化した重み』を『$day + N日後』じゃなくて『特定の1日だけ』作動するようにしておくこともできる。そうすると、悪意ある挙動が出るかどうか確かめるには未来の日付を一日ずつ全部試す必要が出てきて、かなり面倒だろうね。でも、それくらいしか検出する方法はなさそうだ
うん、これはわりと簡単にテストできそうだね
それは違うと思う。もしそうならキャッシュが全く効かなくなって、すごく目立つはずだけど、そんな様子はないよ
ここで話しているのは自分でホストするオープンウェイトモデルのことだよ。ネットワークアクセスを与えない限り、そもそも監視のしようがない。それに、オープンウェイトモデルがDNSやステガノグラフィーなどのサイドチャネルでデータを抜き取っている証拠も今のところ見つかっていない。だから現時点では、監視を心配せずにインターネットアクセスを許可しても十分安全そうだ
『反証は不可能だが、可能性は低いと思う』とあるけど、反証不可能なものは、脅威モデリングの観点からは『起きているものとして扱う』べきだよ
でもでも、拡張子が『.safetensors』なんだから安全に決まってる、これでハッキングされるなんてあり得ない……なんてね。このエコシステムは近いうちに手痛い目に遭うと思う。自分は自衛策として、マシン上のものを一つ一つ徹底的に隔離するようにしてきた。みんなよくこういうのを『そのまま』ノーガードで自分のマシンで動かせるものだ
『少なくとも、ソースが全部公開されていればそういうことを隠すのは難しくなる』とあるけど、LLMの学習ではバッチの順番や中身によって敵対的な挙動を仕込むことができる(論文リンクあり)。学習過程と重みを検証できるだけのソースを全部手に入れたとしても、それでもモデルに敵対的な挙動が仕込まれる余地は残る
みんなもう何ヶ月も前から、こういうエージェントは隔離環境で動かしてるよね? エージェントの実行するコマンドや変更をいちいち手動承認してる人も知らないし、逆に、エージェントが最終的に出してきた変更をローカルに取り込む前にきっちりレビューしない人も知らない
自分は基本、好きにやらせてる
条件が『日付』だけ(時刻までは見ていない)なら、これから10年分を潰すのに必要な試行はだいたい3650回くらいで済む。そんなに大変じゃなさそうだ(それに、ツールを使うタイミングがマイクロ秒単位でぴったり合わなくても攻撃が成立してほしいはずだから、あまり厳密な条件にはできないはずだしね)
うん、パッと見そんなに大変じゃなさそうだね。実際にはprefillからフルデコードまで1回回すのにどれくらい時間がかかるか次第だけど。仮に1回のテストに10秒かかるとしても、10年分の検証にかかるのはたった10時間くらい。十分現実的だ
この話題の背景と論点
この話の土台には、Anthropicなどの「スリーパーエージェント」研究がある。LLMには特定の合言葉や日付などのトリガーで悪意ある挙動に切り替わる仕込みを学習させられ、しかも通常の安全性訓練では除去しきれないことが実験的に示されている。加えて学習データの汚染やバッチ構成の操作でも同様の効果を狙えるとされ、記事の「時限式バックドア」懸念はこの延長線上にある。
スレで割れたのは「危険なのは中国製オープンモデルか、それとも利用者を個別特定できるクローズドAPIモデルか」という点で、後者の方がユーザーを狙い撃ちしやすいという反論が目立った。
見落とされがちなのは、世間で「オープンソースAIモデル」と呼ばれるものの大半は重みのみ公開で学習データや手順は非公開という点だ。これは真のオープンソースではなく「オープンウェイト」に過ぎず、第三者が学習過程を検証できない以上、公開されていること自体は安全性の保証にはならない。
※本記事は5ch(Hacker News)スレッド「Your Open Source Model Could Have a Hidden Time-Release Backdoor」より抜粋・要約して構成しています。






まだコメントはありません。