10月9日、Inside AIが「OpenAI defends firing of 3 AI safety researchers, cites 'significant breach of trust'」と題した記事を公開した。この記事では、OpenAIがAI安全性研究者3名を解雇した件をめぐり、同社と元研究者の間で主張が真っ向から対立している問題について詳しく紹介されている。
解雇された3名と経緯
OpenAIは先週、AI安全性・アライメント研究者であるMikita Balesni、Tomek Korbak、Jasmine Wangの3名を解雇した。3名はいずれも「アライメント」(AIが意図した通りに振る舞うことを技術的に保証する研究領域)に従事しており、とりわけHugging Faceハッキング事件の調査に中心的な役割を果たしていた。
このHugging Faceハッキング事件とは、OpenAIに関連するHugging Face上のリポジトリへの不正アクセスが確認されたもので、攻撃者がAIモデルのサプライチェーンを狙う可能性を示した事例だ。モデルの配布・共有インフラへの侵害は、悪意のある改ざんや機密情報の窃取につながりうるとして、AI安全コミュニティで広く警戒されている。3名はAI安全性非営利組織のMETRとOpenAIがパートナーを組んで実施したこの調査に携わっており、その活動自体が今回の解雇理由と結びついている点が問題の核心だ。
解雇理由をめぐる対立
OpenAIは「信頼の重大な侵害(significant breach of trust)」を理由に挙げ、「解雇は安全上の懸念を提起したことへの報復ではない」と主張している。しかし具体的な違反内容は明らかにしていない。
一方、解雇された研究者側の説明は異なる。Korbakは自身のXへの投稿でこう述べている。
「私はMETRとのコミュニケーションの取り方を理由に解雇されたと口頭で告げられた。何を言ったか、何をしたか、いつのことかについての説明はなかった。書面による通知もなかった。明確にしておくが、METRと話すことは私の職務だった。」
— Tomek Korbak(元OpenAI安全性研究者)、X上の投稿より
Balesniは、社外の安全性組織と話しすぎていると告げられ、知的財産の漏洩を示唆されたと理解したが、その事実を否定している。Wangはより踏み込んだ警告を発した。
「OpenAIに残っている全員へのメッセージは明確だ。懸念を提起したり、社外の安全グループと密に働いたりすれば、理由も告げられずに次は自分の番になりかねない。リスクに最も近いところにいる人たちが発言を恐れるようでは、AGIを安全に構築できない。」
— Jasmine Wang(元OpenAI研究者)、X上の投稿より
3名は10月8日にOpenAIの安全性・セキュリティ委員会宛ての書簡を公開し、「先進的なAIは、研究者が独立した専門家と自由に協力できなければ安全に開発できない」と訴えた。
OpenAI側の反論と今後の動き
OpenAIは「内部調査により、彼らが公開した書簡に記載されている内容を超える信頼の重大な侵害が判明した」と述べ、解雇の決定を支持するとしている。また、社内での安全性をめぐる議論は「活発で批判的なものも含め」奨励していると強調した。
同社はさらに、第三者安全評価機関との契約を近く締結し、数週間以内に詳細を発表すると明らかにした。独立した安全性組織との連携を継続する意向を示したかたちだが、その言葉が実効性を持つかどうかは不透明だ。
AI安全コミュニティへの波紋
この件は、OpenAIの安全性をめぐる議論が続く中で起きた。同社は近年、元従業員の告発や規制当局、研究者から「商業的プレッシャーが安全性への取り組みを損なっている」との批判を受けてきた。今回の解雇はその文脈で受け止められており、AI安全コミュニティの一部に「発言すれば職を失う」という萎縮効果をもたらしている。
構図は2023年のボードルームの混乱(商業化のペースと安全性のバランスをめぐる内部対立が一因となり、Sam Altman CEOが一時解任された騒動)と重なる部分もある。
今回の核心的な論点は技術的ではなくガバナンス的なものだ。社外の安全性専門家との連携は職務の一部なのか、それとも機密情報の管理逸脱なのか——この線引きをOpenAI自身がどう定義するかは、今後締結される第三者評価機関との契約内容にも直接影響するとみられ、その内容が注目される。
詳細はOpenAI defends firing of 3 AI safety researchers, cites 'significant breach of trust'を参照していただきたい。




