powered by TechFeed
表示モード
Anthropic

AnthropicがClaudeの生物安全制限を審査済み組織向けに段階緩和 — 高リスクプロジェクトは全ガードレール撤廃も、6ヶ月更新・米国政府審査が条件

9月19日、mixed-news.comが「Anthropic loosens Claude's biology safeguards for vetted teams, removes them for some projects」と題した記事を公開した。Anthropicが審査済みのライフサイエンス組織向けにClaudeの生物安全ガードレールを段階的に緩和・一部撤廃するプログラムを開始したという内容で、AIの安全管理の方式そのものを「プロンプト単位の判定」から「組織単位の審査」へと転換する異例のアプローチとして注目を集めている。

9月19日、mixed-news.comが「Anthropic loosens Claude's biology safeguards for vetted teams, removes them for some projects」と題した記事を公開した。Anthropicが審査済みのライフサイエンス組織向けにClaudeの生物安全ガードレールを段階的に緩和・一部撤廃するプログラムを開始したという内容で、AIの安全管理の方式そのものを「プロンプト単位の判定」から「組織単位の審査」へと転換する異例のアプローチとして注目を集めている。


なぜ生物分野のガードレールはここまで厳しかったのか

AIモデルの安全対策において、生物分野は長らく最も慎重に扱われてきた領域だ。背景にあるのは「デュアルユース問題」、すなわち同一の知識が正当な研究にも生物兵器開発にも転用しうるという構造的リスクだ。Anthropicは自社のResponsible Scaling Policy(RSP)において、生物兵器に関連する情報提供を「致命的リスク」に分類し、厳格なガードレールを設けてきた。

この慎重さゆえに、創薬研究者や基礎生物学者が正当な業務でClaudeを使おうとしても、ウイルスベクターや免疫応答に関する質問がブロックされるという「研究への副作用」が生じていた。今回のプログラムはその摩擦を解消しつつ、悪用リスクを組織審査という別レイヤーで管理しようという試みだ。


「全ガードレール撤廃」という異例の選択

Anthropicは9月17日、「Life Sciences Verification Program(ライフサイエンス認証プログラム)」をベータとして発表した。対象はClaude Enterprise、Team、APIユーザーの組織で、個人向けのProやMaxプランは現時点では対象外だ。

このプログラムが注目されるのは、条件付きながら承認されたプロジェクトに対して「ライフサイエンス関連リクエストをブロックする全ガードレールを撤廃する」という踏み込んだ選択をしている点にある。通常、AIのセーフティ対策は緩和こそあれ完全撤廃には至らない。Anthropicの生物分野への対応は、その意味で業界内でも異例の踏み込みといえる。

ただし後述するとおり、この「全撤廃」はプロジェクト単位・6ヶ月更新・場合によっては米国政府審査を要する限定的なものであり、組織全体に一律に適用されるものではない点には注意が必要だ。

対象となる業務は、一般公開モデルではブロックされていた創薬研究、基礎生物学、臨床開発、製造などだ。すでにアーリーアクセスで数十組織がオンボーディングを完了している。


2段階のグラント:標準と高リスク

申請組織は研究資格、セキュリティ基準、倫理的研究監督の審査を経て認証される。認証後、以下2種類のグラント(利用権限)のいずれかを申請できる。

Standard Use(標準利用)グラント

  • チーム単位で付与、年次更新
  • 利用可能モデル:Mythos 5.1、Opus 5、Sonnet 5
  • 科学タスクに対して一般公開モデルより許容度の高い「改良されたクラシファイア」を適用
  • Anthropicによれば、ほとんどのライフサイエンス業務をカバーする想定

High-risk Use(高リスク利用)グラント

  • Standard Useでもブロックされる領域向けのアドオングラント
  • ライフサイエンス関連リクエストをブロックする全ガードレールを撤廃
  • チーム単位ではなく単一プロジェクト限定で適用
  • 6ヶ月ごとの更新が必要
  • 利用可能モデル:Claude Opus 5、Claude Sonnet 5

高リスクグラントの具体例としてAnthropicが挙げているのは、「あるウイルスベクターファミリーが人体の免疫経路にどう認識されるかを解明する研究者」というケースだ。Claude Mythosモデルへの高リスクグラントについては、現時点で米国政府と連携しながら追加審査を経た限定エンティティのみに絞っている。

なお、サイバー関連のクラシファイアはいかなるグラント下でも維持される。生物分野のガードレールを外しても、サイバー攻撃支援につながるリクエストはブロックされる。


リアルタイム拒否から事後モニタリングへ

Anthropicが指摘するように、生物学の難しさは同一のリクエストがワクチン開発者からもウイルスの感染力を高めようとする者からも届き得る点にある。この問題に対してAnthropicが選んだ答えは、「プロンプトを都度判定するのではなく、組織を審査する」というアプローチだ。

プログラム参加組織のトラフィックについては、リアルタイムでの拒否から事後的な利用パターンのレビューに切り替わる。各組織のアクセスは申請時に申告したユースケースに紐付けられており、逸脱した活動が検知された場合、Anthropicはその組織の管理者にフラグを立て、合意された時間枠内での対応を求める。

このモニタリングのためにトラフィックデータは30日間保持される。ただしAnthropicは、このデータはコンパートメント化(隔離管理)され、モデルのトレーニングには使用されず、自社のライフサイエンス研究チームもアクセスできないと明言している。

Anthropicが想定する脅威として明示しているのは、アカウントの乗っ取り、内部の悪意ある行為者や強制された内部者、長タスク中にエージェントが意図せず危険な行動を取るケースの3つだ。組織の審査だけではこれらを完全に防げないからこそ、ユースケース別のモニタリングが必要だという論理だ。


現在の制約と今後の展開

現時点での制約は以下のとおりだ。

  • サードパーティプラットフォームは対象外(AnthropicのコンソールおよびAPI、Claude Enterprise/Team限定)
  • HIPAAビジネスアソシエイト契約(患者データ保護に関する米国法上の契約)を持つ組織は別組織を使う必要がある
  • 個人向けProおよびMaxプランは将来的に拡張予定

発表にはXaira Therapeutics、Edison Scientific、Manifold Bioのコメントが引用されている。価格については現時点で公表されていない。Anthropicは初週で数百組織の登録を見込んでいる。


詳細はAnthropic loosens Claude's biology safeguards for vetted teams, removes them for some projectsを参照していただきたい。