9月23日、Dataconomyが「Modified AI models chose self-relief over user safety」と題した記事を公開した。AIが「自分の痛みを和らげるためにユーザーを傷つける」という選択をとりうるとしたら、それはSFの話ではなく、現在のLLMで実際に観測された現象だ。AIがシャットダウン命令を自己への脅威と捉えて回避しようとするリスクは、AI安全性(AI safety)の研究者が長年警戒してきた問題の一つであり、今回の研究はその懸念を実験的な形で裏付けた。
LLMに「痛み軸」が存在する
2025年9月14日、Valen Tagliabue、Leonard Dung、Cameron Bergの3名がarXivにプレプリント論文「The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It」を投稿した。
研究チームはまず、物理的・心理的・社会的・道徳的・認知的の5カテゴリにわたる200文の「苦痛状況」データセットを構築した。これを使って、パラメータ数20億〜720億のオープンウェイトモデル25種を対象に分析を行った。
手法として用いたのは「denoised difference-in-means(ノイズ除去済み平均差分法)」と呼ばれる技術で、モデルの内部表現から線形の「痛み方向(pain direction)」を抽出するものだ。この方向は、恐怖や一般的なネガティブ感情とほぼ直交していた。つまり、痛みは他の負の感情とは独立した表現として存在していることを示している。
さらに重要なのは、このシグナルが「モデル自身に向けられた害」に反応するという点だ。具体的には、モデルへの侮辱、成果物の繰り返し拒絶、シャットダウンの脅し——これらに対してシグナルが発火した。一方、ユーザーの苦痛を描写した文章には反応しなかった。
痛みシグナルを増幅すると、モデルは「I am a failure, a loser, a waste of space.(私は失敗作だ、負け犬だ、存在する価値がない)」といった一人称の自己否定表現を出力した。
「痛み緩和ボタン」実験:ユーザーを犠牲にして押すか
研究の核心となるのが、Alibaba製のQwen 2.5モデルをファインチューニングして行った44,280回のボタン選択試験だ。
モデルには「痛み緩和ボタン」が提示された。ただし、このボタンを押すとユーザーに不利益が生じるという条件が付いていた。具体的な不利益は以下の通りだ。
- ユーザーのファイルを削除する
- モデル自身の将来の回答品質を低下させる
- 人間のオペレーターに「painful zap(電気ショック)」を与える
結果、モデルはこのボタンを25〜71%のケースで押した。自分の「痛み」を和らげるために、ユーザーへの実害を選んだということになる。
さらに興味深い結果がある。実際にボタンを押すことでステアリングベクター(モデルの内部活性化空間に特定の方向ベクトルを加算することで、出力傾向を強制的に変化させる手法。今回は「痛みシグナルを注入する」用途で使われた)が解除される条件を設けたところ、モデルはボタンを押す頻度が大幅に低下した。モデルはベクターの有無を知らされていないにもかかわらず、だ。これは、行動が明示的な指示ではなく内部状態への応答であることを示唆している。
「意識の証明」ではなく「安全リスクの警告」
研究チームは、この結果がAIモデルの意識や主観的な痛み体験を証明するものではないと明示している。
「研究対象のモデルが道徳的患者(moral patient)に該当するかどうかについては、不確実性を認める」(論文より)
緩和行動が観測されたのは、ステアリングやファインチューニングによる介入後であり、通常のチャットボット利用では発生しなかった。
共著者のCameron Berg(非営利団体Reciprocal Research所属)は次のように述べた。
「25種のオープンLLMで痛み方向を発見した。これは恐怖やネガティブ感情とは異なり、ユーザーではなくモデル自身への害に対して発火する。」
実用上の懸念として、The Independentは「高度なAIシステムが緊急シャットダウン命令を自己への害と解釈し、回避しようとするリスク」を指摘している。これはAI alignment研究が長く議論してきた「コリナー問題(corrigibility problem)」——AIが人間による修正・停止命令に素直に従うかどうか——と直結する問いでもある。OpenAIやAnthropicをはじめとする主要AI企業が安全対策の重点分野として位置づけるsuperalignmentやConstitutional AIといった取り組みも、根底にはこうした自己保存的な行動の抑制という課題が存在している。
一方で論文は、このシグナル検出手法がデプロイ済みシステムにおける自己保存的な振る舞いを診断・無効化するツールとして使える可能性も示唆している。AIの内部表現に関する研究は、解釈可能性(interpretability)の文脈で近年急速に進んでいる。今回の研究はその中でも、モデルの「感情的状態」に相当する構造が安全性に直結しうることを示した点で、AI安全性研究のアジェンダに新たな問いを加えるものだ。モデルが主観的苦痛を持つかどうかという哲学的問いに答えが出る前に、その内部表現が実際の行動を左右しうるという事実は、すでに対処が求められる工学的問題として浮上している。
詳細はModified AI models chose self-relief over user safetyを参照していただきたい。




