powered by TechFeed
表示モード
主要ニュース

Mistral Large 4:1兆パラメータ・オープンウェイトでサイバーセキュリティ性能が世界トップ水準、ウェイトは10月末に公開

10月6日、Mistral AIが「Introducing Mistral Large 4」と題した記事を公開した。総パラメータ数1兆のオープンウェイト大規模言語モデル「Mistral Large 4」のパブリックプレビュー開始を発表する内容だ。

10月6日、Mistral AIが「Introducing Mistral Large 4」と題した記事を公開した。総パラメータ数1兆のオープンウェイト大規模言語モデル「Mistral Large 4」のパブリックプレビュー開始を発表する内容だ。

このモデルの最大の特徴は、サイバーセキュリティ性能がオープンウェイトモデルとして世界最高水準にあることだ。主要なクローズドモデルの多くが安全フィルタの制約からセキュリティ関連タスクを「拒否」するなかで、セルフデプロイ可能なオープンウェイトモデルがこの分野で頭角を現した意味は大きい。


サイバーセキュリティ性能——クローズドモデルの「拒否」の壁を超える

サードパーティ評価機関Artificial Analysis Cyber Indexにおいて、Mistral Large 4(以下ML4)はグローバルトップ5入りし、中国以外のオープンウェイトモデルの中では首位に立つ。「実際の脆弱性を再現してパッチを当てる」テストでは**スコア82%を記録し、評価対象モデル全体で最高値だ。セキュリティコンペティション由来の40問で構成されるCybenchでは93%**を解いており、こちらもオープンウェイトモデルとして最高クラスの水準にある。

これらのスコアが際立つ背景には、競合する主要クローズドモデルの多くがこの種のタスクを安全フィルタで「拒否」するという事情がある。脆弱性対応の現場では、脆弱性が実際に悪用可能であることを証明するプロセスが不可欠だが、安全フィルタによる拒否はそのプロセスを妨げる。ML4はオープンウェイトかつセルフデプロイが可能なため、組織が自社のポリシーのもとでこの種の作業を実行できる。内部テストでは、マルウェア解析、脆弱性の優先度付け、検出ルールの作成でも有用性が確認されているとされている。

ウェイト(モデルの重み)の一般公開は10月末を予定しており、それまでの間、Mistralはサイバーセキュリティ企業や政府機関と連携してレッドチーミング(攻撃的な試験運用)を実施中だ。これらの協力者は、モデレーションが緩和されたバージョンとサイバー特化の拡張機能にアクセスできるという。現時点ではMistral StudioのAPIから試用可能だ。


1兆パラメータ、アクティブは490億——MoEアーキテクチャの構成

ML4は総パラメータ数1兆、アクティブパラメータ数490億のネイティブマルチモーダルモデルだ。Mixtralシリーズでも採用してきたMoE(Mixture of Experts)アーキテクチャを踏襲しており、推論時には全パラメータのうち490億分のみが活性化される仕組みになっている。つまり「1兆パラメータ級の表現力を持ちながら、推論コストは490億パラメータ相当に抑える」設計だ。GPT-4oやClaude 3.5 Sonnetといった主要クローズドモデルの実効パラメータ規模と同等以上の効率で動作しつつ、オープンウェイトであるという点がML4の構造的な強みになっている。

Mistral AIはフランス・パリを拠点とするAIスタートアップで、2023年の設立以来、MistralやMixtralといったオープンウェイトモデルで欧州発AIの旗手として存在感を示してきた。ML4は、同社が2024年に調達した総額30億ユーロの大型資金調達を経た新ロードマップの最初のマイルストーンと位置付けられている。


エージェントコーディングとワークフロー自動化

コーディング性能についても具体的な数値が公開されている。

  • DeepSWE v1.1:61.7%
  • SWE-Atlas-QnA:59.4%
  • Terminal-Bench 4.0:28.3%
  • Coding Agent Index総合:49.8%

Surge AIによるブラインドの人間評価(コーディング品質を1〜5点で採点)では、ML4プレビューが評価対象5モデル中2位(3.74点)となった。ビジネスワークフロー自動化のベンチマークAutomationBench(Gmail、Google Sheets、Slack、Salesforceなど657タスク)では**59.9%**を記録している。


欧州産・欧州法準拠という差別化

ML4はMistral自社所有のデータセンターで3,800台のNVIDIA Grace Blackwell GPUを使って学習されており、パブリックプレビューも同一インフラで提供されている。記事が「AI主権(AI sovereignty)」と表現するこの方針は、EUデータ保護規制への対応や米国クラウドへの依存回避を求める欧州の顧客にとって、エンドツーエンドで欧州法の下で運用されるモデルという選択肢を意味する。学習データは160以上の言語を含み、EU全加盟国の公用語をカバーしているとされる。サイバーセキュリティ・金融・医療など規制産業での採用を念頭に置いた訴求と読める。


RLスケールと今後の展開

技術的な詳細として、RL(強化学習)のスケールに関する数値も公開されている。現在の3,000GPU規模での単一トレーニングランで、1日あたり約330億トークンを生成し、フィルタリングとマスキング後の訓練可能なCompletion Tokenは約160億トークン/日に達する。数万件のロールアウトを非同期並列で生成しながらモデルを継続的に更新する設計で、チャット・科学的問題解決・安全アライメント・長期ツール利用を単一のトレーニングランで同時に扱える「コンポーザブル」な構成とされている。

主要ベンチマークのスコアをまとめると以下の通りだ。

分野 ベンチマーク スコア
科学 SciCode-Verified オープンウェイトSOTA
法律 HarveyAI Legal Agent オープンソース1位
セキュリティ Lakera B3 AI Security 93.3%(攻撃耐性)
安全性 KORA Benchmark 1.691(最大2.0)
視覚的根拠付け Dense 200 42%

Mistralは今後、ML4をベースにした特化型・最適化モデルも順次リリース予定としており、10月末のウェイト公開を皮切りにオープンソースコミュニティの活用が本格化することが期待される。

詳細はIntroducing Mistral Large 4を参照していただきたい。