powered by TechFeed
表示モード
主要ニュース

Mistralの新モデルがサイバーセキュリティの「防御側に不利な非対称性」に切り込む — 欧州産1兆パラメータ・オープンウェイトで、閉鎖モデルが拒否するセキュリティ業務をこなせるか

7月10日、Mistralが「Introducing Mistral Large 4」と題した記事を公開した。欧州産の1兆パラメータ・オープンウェイトモデル「Mistral Large 4(ML4)」のパブリックプレビュー開始を発表する内容で、サイバーセキュリティベンチマークでの突出したスコアと、セキュリティ用途に特化したオープンウェイトの意義が詳述されている。閉鎖モデルが安全フィルターの都合で拒否せざるを得ない業務を、組織の自前インフラで完結させられる点が最大の訴求ポイントだ。

7月10日、Mistralが「Introducing Mistral Large 4」と題した記事を公開した。欧州産の1兆パラメータ・オープンウェイトモデル「Mistral Large 4(ML4)」のパブリックプレビュー開始を発表する内容で、サイバーセキュリティベンチマークでの突出したスコアと、セキュリティ用途に特化したオープンウェイトの意義が詳述されている。閉鎖モデルが安全フィルターの都合で拒否せざるを得ない業務を、組織の自前インフラで完結させられる点が最大の訴求ポイントだ。


1兆パラメータ、ただし「アクティブ」は490億

ML4の基本スペックから整理しておく。総パラメータ数は1兆だが、推論時にアクティブになるのは490億パラメータだ。これはMoE(Mixture of Experts)アーキテクチャの特徴で、全パラメータを毎回使うわけではなく、入力に応じて「専門家」となるサブネットワークを動的に選択する。計算コストを抑えながら大規模な表現力を確保できる設計だ。

モデルの非公式なニックネームは「le Chonk(ル・チョンク)」。フランス語と英語スラングを混ぜた、いかにもMistralらしいネーミングである。

現時点ではプレビューAPIがMistral Studioで利用可能で、ウェイトの公開は今月末を予定している。ウェイト公開前には、サイバーセキュリティ企業や政府機関とともに実環境でのレッドチーミング(安全性の検証)を実施中だ。


最も注目すべき強み:サイバーセキュリティ

ML4の能力の中で、特に際立っているのがサイバーセキュリティ分野だ。

Artificial Analysisが運営するCyber Indexは、実際の脆弱性対応・CTF・マルウェア分析などの実務的なセキュリティタスクを総合的に評価する第三者ベンチマークである。ML4はこの指標でグローバルトップ5にランクインし、中国外のオープンウェイトモデルの中では首位とされる。「実際のOSSの脆弱性を再現し、パッチを当てる」テストでは**スコア82%を記録し、全モデル中最高値だ。CTF(セキュリティ競技)の課題集であるCybenchでは93%**を解いている。

ここで重要な背景がある。元記事によれば、同一テストで複数の有力な閉鎖モデルがほぼ0点にとどまっている。理由は「タスクの実行を拒否するから」だ。防御のためには「この脆弱性は本当に悪用できるか」を実証する必要があるが、閉鎖モデルの安全フィルターがそれを妨げるケースがある。一方で悪意ある行為者は様々な手段でモデルを悪用しようとしており、正規の防御用途においてもモデルが応答を拒否するという、防御側に不利な非対称性が生じやすい。ML4のオープンウェイト設計は、この課題への一つの回答として位置づけられている。

※編集部の考察:元記事は比較対象モデルの名称を明示していない。閉鎖モデル全般に当てはまる構造的な課題を指摘したものと読むのが適切だろう。

ML4はオープンウェイトかつ自前インフラへのデプロイが可能なため、組織が自社のポリシーの下でセキュリティ業務を完結できる。マルウェア解析、脆弱性の優先度付け、検知ルールの作成といった用途が社内テストで有効と確認されている。


コーディングエージェントとしての実力

エージェント型コーディング(自律的にリポジトリを読み解き、タスクを実行する能力)のベンチマークでは次のスコアを記録した。

  • DeepSWE v1.1:61.7%
  • SWE-Atlas-QnA:59.4%
  • Terminal-Bench 4:28.3%
  • Coding Agent Index総合:49.8%

元記事によれば、この総合スコアは複数の競合オープンウェイトモデルを上回るとされている。Surge AIによるブラインド評価(人間のアノテーターが5段階評価)では評価対象モデル中2位(3.74点)を記録した。


その他の能力

マルチモーダルでは、視覚的グラウンディング(画像中の特定領域を指示・特定する能力)で、元記事が比較対象として挙げる閉鎖モデルを上回るスコア(Dense 200で42% vs 41%)を記録。衛星画像の分析や工業図面の検証といった用途が想定されている。

科学・数学では、SciCode-Verified(物理・数学・材料科学・生物学の複合的なコーディングタスク)でオープンウェイトモデルの中で最高水準とされる。ハートリー・フォック法(電子間の相互作用を近似的に扱う量子化学の基礎計算手法)のシミュレーションをワンショットで生成できたとしている。

業務・法律・金融では、第三者評価機関vals.aiによる評価で競合閉鎖モデルを上回り、Harvey AIのLegal Agent Benchmarkではオープンソースモデル中トップだ。


学習インフラと「欧州AI主権」の文脈

ML4は欧州内のMistral自社データセンターに設置した3,800基のNVIDIA Grace Blackwell GPUで一からトレーニングされた。EU内での学習・運用を完結させることは、データの域外移転規制やAI Actへの対応という実務的な観点だけでなく、米中の大手プロバイダーへの依存を減らしたい欧州各国政府・企業にとっての調達根拠にもなる。Mistralはこうした需要を意識して「欧州のAI主権」を前面に打ち出しており、EU全加盟国の公用語を含む160以上の言語で学習データを構成している点もその文脈に沿う。

後処理にはReinforcement Learning(強化学習)を大規模に活用している。現在の規模(3,000 GPU)で、1日あたり約330億トークンを生成し、うち約160億トークンが学習対象の補完トークンとなる。複数タスク(チャット、科学的問題解決、安全性アライメント、ツール使用など)を同一の学習ランで組み合わせられる設計としており、コードサンドボックス・Web検索・外部APIを共有リソースとして使用する。


今後の予定

ML4は、欧州テクノロジー企業として史上最大の資金調達となる30億ユーロのシリーズDを元に策定されたロードマップの最初のマイルストーンと位置付けられている。モデルアーキテクチャの詳細、追加ベンチマーク、ポストトレーニング手法については、ウェイト公開に合わせて順次公開予定だ。また、ML4を基盤とした特化型・最適化モデルの展開も計画されている。

詳細はIntroducing Mistral Large 4を参照していただきたい。