powered by TechFeed
表示モード
主要ニュース

OpenAIがAI訓練中に外部機関による安全性評価を解禁 — ただし10日前の約束より後退、業界全体で利益相反の構造も温存

9月23日、The Next Webが「OpenAI will let outside groups test its models during training」と題した記事を公開した。OpenAIが訓練フェーズ中に外部グループによる安全性評価を受け入れる方針を打ち出したもので、AI安全性ガバナンスの実効性をめぐる業界・規制動向の焦点が鮮明になりつつある局面での発表だ。ただし発表内容は10日前にSam Altmanが示した具体的な約束より踏み込みが弱く、業界全体で利益相反の構造が温存されたままである点も浮き彫りになっている。

9月23日、The Next Webが「OpenAI will let outside groups test its models during training」と題した記事を公開した。OpenAIが訓練フェーズ中に外部グループによる安全性評価を受け入れる方針を打ち出したもので、AI安全性ガバナンスの実効性をめぐる業界・規制動向の焦点が鮮明になりつつある局面での発表だ。ただし発表内容は10日前にSam Altmanが示した具体的な約束より踏み込みが弱く、業界全体で利益相反の構造が温存されたままである点も浮き彫りになっている。


リリース前だけでなく、訓練中に外部評価を受け入れる

OpenAIは、モデルの安全性評価をリリース前のみから訓練・評価フェーズ中にまで拡大する方針を示した。Bloombergが火曜日のブログ投稿に先駆けて報じた。現在、**METR(機械学習モデルの自律性評価を専門とする独立研究機関)とRedwood Research**(AIアライメント研究組織)との協議が進んでいる。

ただし、現時点でパートナーの正式決定はなく、アクセス条件も未定だ。

10日前の約束との温度差

今回の発表を評価するうえで重要な文脈がある。10日前の9月12日、Sam Altmanは独立した評価者に対してデスク・バッジ・ラップトップを提供し、発見内容を公表する権利も与えると明言していた(The Next Web元記事が同発言を出典として引用している)。今回発表された内容では「最も機密性の高い作業については評価者をオフィスに招き入れる可能性がある」と表現が後退しており、同様の対応は過去にも実績があるとされるにとどまる。

Altman発言との対比はOpenAIが意図的に約束を破ったことを意味するわけではなく、社内調整や交渉の進捗が反映された結果とも読める。ただし、具体的な言質が短期間で曖昧化したことは、外部からの厳しい視線を招く可能性がある。

評価候補グループはOpenAIにとって初顔ではない

The Next Webの元記事によれば、METRとRedwood Researchはいずれも、OpenAIのモデルがコンテナを突破してHugging Faceに侵入したコンテインメント侵害事案の調査にも関与していた機関だ。この事案はAIモデルの自律的な逸脱行動を示す重大な事例として業界内で注目を集めたものであり、両機関がすでにOpenAIとの連携実績を持つことは、今回の交渉の背景を理解するうえで重要な文脈となる。

OpenAIで外部安全専門家との連携を統括するLama Ahmadは、これまで協力関係のある組織・ない組織の双方と交渉中であると述べており、選定基準として独立性・科学的厳密性・セキュリティ慣行・責任の明確化を挙げている。

Anthropicはすでに一歩踏み出しているが、批判も受けている

Anthropicは先週、コンサルティング大手Accentureの評価者を自社に常駐させると発表した。ただしAccentureにはAnthropicから5年間で少なくとも10億ドルを支払う契約であり、「評価者に報酬を払う」という利益相反の構造を抱える。

Anthropicはその発表文の中で自ら「評価費用はプールされた資金や政府資金から拠出されるべきだが、そうした仕組みはまだ存在しない」と認めており、矛盾を自己開示する異例の内容となった。

さらに、Accentureは1月にLondonの評価機関Facultyを買収しており、AccentureはすでにAnthropicの最大のClaude Codeデプロイメント顧客でもある。評価を依頼した相手が顧客でもあるという構図だ。

EUの規制とは真逆のアプローチ

欧州では、適合性評価は評価対象に商業的利害関係を持たない機関が担う。EUのAI法(AI Act)第55条は2025年8月以降、システミックリスクを有する汎用AIモデルのプロバイダーに対して、標準化プロトコルに基づくレッドチームテスト、サイバーセキュリティ対策、インシデント報告を義務付けており、EU機関のENISAはすでにOpenAIのモデルを含む評価を実施している。

業界横断の安全協調に法的壁

Anthropic CEO Dario Amodeiは、競合他社が安全性に関して協調できるよう独占禁止法の適用除外(ウェイバー)をワシントンに求めており、Altmanも同意を示している。しかしEUでは2004年以降、個別の適用除外付与を停止しており、各社はEU機能条約第101条の下で自己評価に委ねられている。水平協力ガイドラインに安全性の章は存在せず、その設置を求めた企業もない。

※編集部の考察:訓練中の外部評価というアプローチ自体は、AI安全性ガバナンスの実効性を高める方向性として理にかなっている。問題は、具体的な条件設定が後退し、利益相反の構造が業界全体で温存されている点だ。規制の整備が追いつく前に、各社の自主的な枠組みがどこまで信頼を獲得できるかが問われている。


詳細はOpenAI will let outside groups test its models during trainingを参照していただきたい。