10月9日、pbxscience.comが「Microsoft Brings a 137B-Parameter Coding AI to Windows PCs With "Hybrid Intelligence"」と題した記事を公開した。この記事では、Microsoftがローカル実行とクラウドを組み合わせた「Hybrid Intelligence」プラットフォームをWindowsに導入し、137Bパラメータのコーディング用AIモデルをPC上で動かせるようにすると発表したことについて詳しく紹介されている。以下に、その内容を紹介する。
137Bパラメータのコーディングモデルがローカルで動く
中核となるのは MAI Code 1.1 Flash だ。Microsoftが2026年のBuild(開発者向け年次カンファレンス)で初公開したコーディング特化モデルで、総パラメータ数は137B(1370億)、同時に有効化されるパラメータは約6.8B(68億)というMoE(Mixture of Experts)構成をとる。
約3bitの量子化(モデルの重みを低精度で表現してサイズを圧縮する手法)を適用することで、モデルサイズを約80%削減しつつ、コーディング品質と256Kトークンのコンテキストウィンドウを維持しているとMicrosoftは説明する。
ただし、メモリ要件はシビアだ。量子化後のモデルは約53GB、256Kコンテキストをフルに使う場合のピーク使用量はSurface Laptop Ultra上で約75.5GBに達する。64GBメモリ搭載機では、コンテキスト長を短くして使う必要があると見られる。Microsoftは「すべてのWindows PCで動作する」とは明言していない。
コスト面での訴求も明確で、GitHub Copilot内でローカルモデルに推論を任せた場合は推論料金がかからないとされている。CEO Satya Nadellaもローカルへのオフロードによってプロジェクトコストを大幅に削減できると述べている。
ハイブリッドの仕組み:タスクに応じてローカルとクラウドを切り替える
Microsoftが「Hybrid Intelligence」と呼ぶアーキテクチャの要がルーティング技術 HydraFusion だ。各タスクに適したモデルを自動選択する仕組みで、今回の発表でWindowsのローカルモデルも選択肢として追加される。GitHub Copilotアプリ、GitHub Copilot CLI、Visual Studio Codeへの試験的プレビューは10月中に予定されている。
ランタイム側では、GPUだけでなくNPU・CPUにもモデルをデプロイできるWindows MLがllama.cppのサポートを追加する。オープンソースモデルをWindows上で動かすための障壁が下がる。
ローカルで動かせるモデルはMAI Code 1.1 Flashだけではない。
- Nemotron(NVIDIA共同開発中):70B超のパラメータを2bitに量子化し、約20GB超のメモリに収まる設計
- DeepSeek V4 Flash:約284Bパラメータのモデル。RTX Sparkハードウェアでのローカル実行を想定
AIエージェントのセキュリティ:Microsoft Execution Containers
AIエージェントはコードを書き、ファイルを操作し、長時間自律的に動く。人間がすべての操作をレビューするのは現実的でない。Microsoftがその答えとして提示するのが Microsoft Execution Containers(MXC) だ。
MXCは10月7日にWindows 11上でGA(一般提供開始)となった。エージェントがアクセスできるファイルやネットワークを組織側が定義し、Windowsがランタイムで強制する仕組みだ。Windows 365(クラウドPC)上でも同様のアプローチが利用できる。OpenClawユーザー向けにはMXCと統合したWindowsネイティブゲートウェイも提供される。
ハードウェア:Surface Laptop UltraとDev Box
Microsoftは同発表に合わせ、NVIDIAのRTX Sparkチップ搭載ラップトップの先行予約を開始した。
| 機種 | メモリ | 出荷時期 |
|---|---|---|
| Surface Laptop Ultra | 最大128GB | 10月中旬〜 |
| Surface RTX Spark Dev Box(米国) | 128GB | 11月 |
| DGX Station for Windows | 未公表 | 2026年内 |
Microsoftによると、テストしたRTX Spark PCは16インチMacBook Pro(M5 Pro / 64GBメモリ)と比べて最大2.1倍高速なTime to First Tokenを記録したとしている。ただし、これはMicrosoftの自社計測値であり、第三者による独立した検証は行われていない。
今後の課題
Copilotのローカル実行機能(ファイル整理、デバイス診断、コーディング補助、ネイティブWindowsアプリ生成など)やHydraFusionのプレビューは、いずれも今後数週間〜数カ月以内の段階的ロールアウトとなる。本機能の利用にはWindowsアップデートが必要だ。
この戦略の成否は、メモリ要件の現実解・ハードウェア価格・ローカルとクラウドの切り替えの滑らかさにかかっている。
詳細はMicrosoft Brings a 137B-Parameter Coding AI to Windows PCs With "Hybrid Intelligence"を参照していただきたい。




