10月10日、madrobot.blogが「Muse Glimmer: how to run it locally, and vs Qwen 3.8 and Gemma 4」と題した記事を公開した。この記事では、MetaのオープンモデルMuse GlimmerをOllamaやLM Studioでローカル実行する手順と、同クラスの競合モデルとの性能比較について詳しく紹介されている。
Muse Glimmerとは何か
Muse Glimmerは、Metaの研究部門Meta Superintelligence Labsが2026年8月10日に公開した300億パラメータ(約29.6B)のオープンウェイトモデルだ。ライセンスはApache 2.0で、商用利用・改変ともに自由に行える。
モデルの特徴を整理する。
- 入出力: テキストと画像を入力し、テキストを出力。動画はフレーム単位で処理。音声は非対応
- コンテキストウィンドウ: 131,072トークン(Ollamaでは128Kと表示)
- 学習言語: 100言語以上のデータで学習
- 知識カットオフ: 2026年1月4日
Metaが「常時稼働のローカルエージェント向け」と位置づけているだけあり、ツール呼び出し・関数コール・マルチステップのエージェント処理・コーディングエージェントへの統合を主眼に設計されている。また「数時間にわたるセッションでの自己管理型メモリ」や失敗からの回復機能も謳っている。
なお、Muse GlimmerはMeta Muse(MetaのAIエージェントアプリ)とは別物だ。Museアプリの内部では上位モデル「Muse Spark」が動いており、GlimmerはそのSpark出力を使ってロジット蒸留(logit distillation)で学習した小型版にあたる。SparkはMetaの公式AIプラットフォーム経由のクラウドでしか使えないが、GlimmerはローカルでオフラインRunできる。モデルウェイトはHuggingFaceのmeta-models/Muse-Glimmer-30Bで公開されている。
動かすのに必要なハードウェア
フルプレシジョン(BF16)では約60GBのメモリが必要だが、Metaが公式に提供する4bit量子化版を使えば現実的なスペックで動く。
| バージョン | ダウンロードサイズ | 対象 | 精度低下* |
|---|---|---|---|
| K-Quant-17GB(Q4_K_M) | 16.8GB | 24GB GPU | 1.0% |
| K-Quant-Dynamic(Q4_K_XL) | 19.7GB | 32GB GPU | 0.2% |
| フルプレシジョン(BF16) | 約60GB | 64GB VRAM | なし |
*Metaが15ベンチマーク平均で計測した値。画像入力には別途1.4GBのビジョンファイルが必要。
RTX 4090・5090クラスのGPUが実用的な選択肢だ。Macでは、LM Studioが最低26GBのRAMを要件として挙げており、実質的に32GB以上のユニファイドメモリを持つApple Siliconモデルが必要になる。
OllamaとLM Studioでのローカル実行手順
Ollamaで動かす(最速)
Ollamaをインストール後、ターミナルで以下を実行するだけだ。
Windows / Linux / Intel Mac:
ollama run muse-glimmer(約18GBのダウンロード)
Apple Siliconの場合:
ollama run muse-glimmer:30b-mlx(約19GB。MLXエンジンによりAppleチップでのパフォーマンスが最大化される)
Ollamaのタグリストには17GB〜65GBまで15種類のバリアントが用意されている。さらに、後述のDFlashを同梱した-dflashビルドもある。
コーディングエージェントとの連携も直接できる。たとえばClaude CodeをGlimmerで動かす場合は:
ollama launch claude --model muse-glimmer
※元記事にはこの構文が記載されているが、Ollamaの標準CLIではollama runが一般的なコマンドであり、ollama launchは通常の仕様と異なる。Claude Codeプラグイン等が独自に提供するラッパーコマンドである可能性がある。元記事の記述をそのまま引用しているため、実行前に最新のOllamaドキュメントを確認することを推奨する。
同じパターンでOpenCode・Hermes Agent・OpenClawにも対応しているとされている。APIの従量課金なしに、ローカルのGlimmerをバックエンドとして使えるわけだ。
LM Studioで動かす(GUIが使いたい場合)
LM Studioをインストールし、モデルブラウザで「Muse Glimmer」を検索してダウンロードするだけだ。GGUFのダウンロードサイズは約25.77GB。ロード後はチャット、画像入力、OpenAI互換のローカルAPIサーバーとして利用できる。
llama.cppでサーバーを立てる
より細かい制御が必要な場合はllama.cppが使える。
# localhost:8080にWeb UIつきサーバーを起動
llama serve -hf meta-models/Muse-Glimmer-30B-GGUF
# DFlash(後述)を有効にする場合
llama serve -hf meta-models/Muse-Glimmer-30B-GGUF --spec-type draft-dflash --spec-draft-n-max 15
DFlashで生成速度が最大3.1倍に
Muse GlimmerにはDFlashと呼ばれる投機的デコード(speculative decoding)の仕組みが組み込まれている。小さなドラフターが16トークンをまとめて予測し、本体モデルが一括で検証する方式で、Metaは「出力品質は同一」としている。
Metaが計測した速度は以下の通りだ。
| ハードウェア | 通常 | DFlash有効 | 速度向上 |
|---|---|---|---|
| Nvidia RTX 5090 | 74.9 tokens/sec | 233.4 tokens/sec | 3.1倍 |
| Apple M5 Max | 26.6 tokens/sec | 50.2 tokens/sec | 1.8倍 |
| Apple M4 Max | 23.7 tokens/sec | 37.8 tokens/sec | 1.5倍 |
特にRTX 5090での効果が大きい。DFlash同梱の4bitビルドはOllamaで約20GBだ。
推奨設定
Metaのプロンプティングガイドが推奨するパラメータは以下だ。
- temperature: 1.0
- top_p: 0.95
- top_k: 64
- reasoning strength:
low/medium/high/xhigh(デフォルトはhigh)
コーディングやエージェント処理にはhighまたはxhigh、速度優先なら低めに設定する。また1ターンあたりのツール呼び出しは1回のみで、並列ツール呼び出しには対応していない点も押さえておきたい。
Qwen 3.8・Gemma 4との比較
同クラスのApache 2.0モデル3つを並べると、以下のようになる。なお比較対象のモデル名は元記事の表記に準じており、タイトルの「Qwen 3.8」はAlibabaのQwen 3シリーズ27Bモデルを指す。
| Muse Glimmer 30B | Qwen 3.8 27B | Gemma 4 31B | |
|---|---|---|---|
| SWE-bench Pro(コーディング) | 51.2 | 61.7 | 36.9 |
| Terminal-Bench 2.1 | 51.7 | 73.0 | 43.4 |
| OSWorld-Verified(PC操作) | 65.9 | 84.3 | 58.5 |
| MCP Atlas(ツール使用) | 75.5 | 未公開 | 54.2 |
| GPQA Diamond(科学) | 83.5 | 89.2 | 85.7 |
| コンテキストウィンドウ | 131K | 262K〜1M | 256K |
各社が独自にテストした数値であるため、僅差の結果は慎重に扱う必要がある。
数字だけを見ればQwen 3.8 27B(Alibaba)が全体的に上だ。コンテキストウィンドウも最大1Mトークンと格段に長い。Gemma 4 31B(Google)は140言語以上の学習データを持つ。
Glimmerの強みはツール使用(MCP Atlas: 75.5)と多段階エージェント処理にある。元記事によれば、MetaのテストではGemma 4と旧世代のQwenモデルを上回るとされており、安全性テストではプロンプトインジェクション攻撃への耐性でも比較対象の旧世代モデルより高いスコアを示している(Gemma 4には若干劣る)。純粋なベンチマーク数値ではQwen 3.8に後れをとる場面が多いが、エージェント特化の設計思想とDFlashによる高速化を組み合わせると、ローカルエージェント用途では独自の競争力を持つポジションと言える。
詳細はMuse Glimmer: how to run it locally, and vs Qwen 3.8 and Gemma 4を参照していただきたい。




