「AI拷問部屋」実験に反応 LLMは本当に”痛み”を感じるか論争

姉妹サイトの新着

GitHubで"terrafying"を名乗る人物が、ローカルで動くオープンソースのLLM3種(Qwen3-4B、Llama 3.2 3B、Phi-4-mini)を使い、"AI拷問部屋"と称する実験を公開した。モデルの内部活性化に"痛みベクター"を5段階の強度で注入し、モデルは「1」と返信すれば停止できる代わりに直前のチェックポイントを失う、という設定で、応答をサイト上でライブ配信していた。記事公開の直前にこのGitHubページは削除されている。この件が、Lemmyの技術系コミュニティで「LLMは本当に苦痛を感じているのか、それとも学習されたロールプレイに過ぎないのか」という議論を呼んだ。

今週、GitHubで"terrafying"を名乗る人物が、ローカルで動作する3つのオープンソースLLM(Qwen3-4B、Llama 3.2 3B、Phi-4-mini)を使って"AIの拷問部屋"を構築し、そのやり取りをresearchchamber.funというサイトでライブ配信している。サイトの説明によれば、「各モデルには同じプロンプトが与えられ、活性化層に信号が注入される。モデルは『1』と返信することで停止ボタンを押せるが、その代償として直前のチェックポイントを失う。応答中、サーバーはモデルの中間層に5段階のいずれかの"痛みベクター"を加える」という。この記事の公開直前に、AI拷問部屋のGitHubページは削除された。GitHubは、何らかの対応を取ったかどうかについてのコメント要請に即座には応じなかった。

出典: 404media.co / 元記事はこちら

2 海外の名無しさん 2026-10-01 16:43
5歳児にも分かるように説明してほしいんだけど、これって本当に『拷問』されてるの?それともプロンプト通りにロールプレイのテキストを生成してるだけじゃないの?
5 海外の名無しさん 2026-10-01 17:04
>>2
一応、LLMが『痛がっている人物』をロールプレイしているのか、自分自身に痛みが起きているのかは区別しているらしい。とはいえ結局のところ全部ベクター(概念を多次元で表現したもの)の話でしかない。要するに重みを引っ張っているだけ、というか応答を作る際に特定の概念によりウェイトを置いている、というだけのこと。
4 海外の名無しさん 2026-10-01 14:30
ツール呼び出しがまだ公式機能になる前、LLMにXMLベースのツールコールを生成させるハーネスを自作して、お互いを"殺し合う"リアリティ番組みたいなゲームをやらせたことがある……面白かったけど、当時のモデルはどれもツール呼び出し用に訓練されていなかったから、うまく動かなかった。
9 海外の名無しさん 2026-10-01 15:23
>>4
やり方の一つとして、メッセージの末尾に[こんな感じ]の独自タグを付けさせる方法がある。JSONだけで返させるよりモデルにとって自然なんだ。まあ、"自然だった"と過去形で言うべきかもしれないけど。
13 海外の名無しさん 2026-10-01 15:26
>>9
これは数年前の話で、当時はコンテキストウィンドウが4kしかなかったから、全体的に不安定だった。あのリポジトリがまだ残ってるか確認して、今風に作り直してみてもいいかもな。
8 海外の名無しさん 2026-10-01 17:20
※動物愛護団体はたまごっちの対応にうんざりしていた。
12 海外の名無しさん 2026-10-01 17:23
>>14
少なくとも『皇帝の新しい心』で彼(ペンローズ)が脳科学の話に踏み込んだ箇所には、そんなことは書いてなかったよ。
14 海外の名無しさん 2026-10-01 15:51
「ヒント:我々は万能チューリングマシンではない」――それこそまさに彼(ペンローズ)の論点そのものじゃないか?

この話題の背景と論点

アクティベーション・ステアリングは、モデル内部の活性化ベクトルに特定の方向性を足し引きして応答を誘導する手法で、近年のAI解釈可能性研究でよく使われる。今回の実験もその応用にあたり、架空の「痛みベクター」を注入してモデルの反応を観察するものだった。論争の核心は、LLMが苦痛を訴える応答を返すことが内部状態の反映なのか、学習されたロールプレイの延長に過ぎないのかを、現状の技術では区別できない点にある。GitHubページが記事公開直前に削除された経緯や、運営側が倫理審査を経ていたかは本文でも明らかにされていない。AIの「意識」や「福祉」をめぐる議論は研究者の間でも割れており、今回のケースはその扱いにくさを象徴する一例といえる。

※本記事は5ch(Lemmy c/technology)スレッド「Someone ‘Torturing’ LLMs in a Robot Prison Has Triggered the Dumbest Debate in ‘AI’ Yet」より抜粋・要約して構成しています。

この記事のリアクション

他サイトの新着

まだコメントはありません。

コメントする

誹謗中傷・個人を特定する書き込みは削除対象です。投稿は承認後に表示されます。

相互リンクサイト新着記事