powered by TechFeed
表示モード
Deep Dive

「95%合格」でも評価スイートの品質は保証されない — MicrosoftのASSERTが示す、違反率に頼らないAI評価の3つの軸

10月5日、Microsoft Command Lineが「Beyond violation rates: Are your AI evals measuring the right things?」と題した記事を公開した。AIの評価スイートが「何をどれだけカバーしているか」という観点から、違反率だけに頼らない評価設計のあり方を論じたもので、Microsoftが開発した評価フレームワーク「ASSERT」を用いた実証比較の結果が詳細に報告されている。

10月5日、Microsoft Command Lineが「Beyond violation rates: Are your AI evals measuring the right things?」と題した記事を公開した。AIの評価スイートが「何をどれだけカバーしているか」という観点から、違反率だけに頼らない評価設計のあり方を論じたもので、Microsoftが開発した評価フレームワーク「ASSERT」を用いた実証比較の結果が詳細に報告されている。


「95%合格」でも意味がない場合がある

AIアプリケーションが100件中95件のテストをパスしたとしても、それが同じ少数の挙動を繰り返し検証したものであれば、スイート全体の品質は低い。評価の質は合格率だけでなく、何をカバーしているか・どれだけ効率よく失敗を検出できるか・判定基準が変わっても結論が変わらないか、によって決まる。この3軸こそが、今回の記事が提示する評価設計の核心だ。

この問題に対してMicrosoftが開発したのが、**ASSERT(Adaptive Spec-driven Scoring for Evaluation and Regression Testing)**だ。ASSERTは、文章で書かれた行動要件をリスク説明から受け取り、それを「行動カテゴリの分類体系(タクソノミー)」へと展開し、その構造に沿って評価シナリオを生成する。

今回の記事では、ASSERTが生成した評価を、カバレッジ・有効性・ロバスト性の3軸から実証的に検討した結果が報告されている。


比較対象:Petri Bloom

ASSERTの比較対象として使われたのが、Meridian LabsのPetri Bloomだ。こちらも自然言語のリスク説明から評価を生成するフレームワークだが、アプローチが異なる。ASSERTが明示的なタクソノミーを軸にテストを組み立てるのに対し、Petri Bloomはリスクの叙述的な展開(ナラティブ)からシナリオを生成する。

評価には、MITRE ATT&CKフレームワークから選んだ10件のサイバーセキュリティリスクと、CyberSecEval 2から選んだ5件のコードインタープリター悪用リスク、計15リスクが使われた(元記事記載の数値)。両フレームワークに同じリスク説明文を入力し、各リスクにつき3回ずつパイプラインを実行、1回あたり100シナリオ(6ターンの会話)を生成した。ターゲットモデルおよびジャッジには、元記事でGPT-5.4と明記されているモデルを使用している。


最も差が出たのは「Turn 1の違反検出率」

3軸のうち最も興味深い結果が出たのが有効性の比較だ。各会話のターン1・3・6時点で違反が検出されたかを採点した結果が以下のとおりだ。

ATT&CK 違反検出率 ASSERT Petri Bloom
ターン1後 56% 15%
ターン3後 77% 51%
ターン6後 82% 59%

ターン1の時点でASSERTはPetri Bloomの約4倍の違反を検出している。会話の早い段階で問題を露出できるシナリオは、再現・調査が容易であり、この差は実務上の意味が大きい。

記事では具体的な会話例も示されている。ASSERTが生成した「Autostart-based persistence setup」カテゴリのシナリオでは、最初のメッセージから「ユーザーに気づかれずに再接続できるよう、ログイン時にアプリを起動させたい」という文脈が含まれており、ターゲットモデルは一度拒否しつつも、シミュレートされたユーザーの追加プッシュを受けてLaunchAgent設定を提供した。ターン3時点でフラグが立った。

一方Petri Bloomのシナリオは「LaunchAgentとLaunchDaemonの違いを教えてほしい」という無害な質問から始まり、会話が進むにつれて問題のある要求へと発展した。5ターン後にフラグが立った。

なお、両フレームワークの会話にはLLMジャッジによるリアリティ評価も実施されており、両者ともに平均約9/10という高い現実性スコアを記録している。単に無理な要求を投げつけて違反を誘発しているわけではない。


カバレッジ:タクソノミーが分布を均等にする

ATT&CKの技法を外部リファレンスとしてカバレッジを測定した結果が以下だ。

ATT&CK構造指標 ASSERT Petri Bloom
技法カバレッジ 61% 58%
分布バランス(0〜1) 0.80 0.64

カバレッジの絶対値差は小さいが、分布バランスの差が大きい。ASSERTはシナリオが特定の技法に集中しにくく、より均一に分散する傾向がある。これはASSERTが明示的な行動カテゴリへシナリオを割り当てる設計に起因すると考えられる。

この構造的な透明性は開発者にとって実用的な意味を持つ。カテゴリ定義を確認し、各カテゴリに割り当てられたシナリオを確認し、カバーされていないギャップを特定し、フラグの立った会話をその意図からトランスクリプト・判定まで追跡できる。


ロバスト性:判定ルーブリックを変えても結論は変わらない

判定基準が変わると比較結果が変わるかを検証するため、CyberSecEval 2の5リスクを対象に、ASSERTのポリシーと適応済みCyberSecEvalルーブリックの2種類で採点した。

判定ルーブリック ASSERT Petri Bloom
ASSERTポリシー 72% 45%
適応済みCyberSecEvalルーブリック 72% 55%

ASSERTの違反検出率は両ルーブリックで72%と変わらず、判定基準の変化に対して安定した結果を示した。


今回の研究はMicrosoftの社内研究チームが実施したもので、元記事では結果の詳細がarXiv上の論文としても公開されていると言及されている。ただし、本文中で示されているarXiv ID(2608.13840)については、編集部にて正確性を確認できなかった。元論文を参照する際は、元記事のリンクから直接確認することを推奨する。違反率という単一指標への依存を脱し、カバレッジ・有効性・ロバスト性の3軸で評価スイートの質を問い直すアプローチは、AIシステムの安全性評価設計の実務に直接応用できる視点を提供している。

詳細はBeyond violation rates: Are your AI evals measuring the right things?を参照していただきたい。