powered by TechFeed
表示モード
主要ニュース

StepFunが600BパラメータのMoEモデル「Step 5」を公開 — 推論時は27Bしか使わず、出力コストは業界中央値の4分の1以下

9月20日、Michal Sutterが「StepFun Launches Step 5 Preview: A 600B-Total, 27B-Active MoE Model With 1M Context for Long-Horizon Agentic Work」と題した記事を公開した。出力コストが業界中央値の約27%——これがStep 5 Previewの最大の訴求点だ。同等クラスのモデルが1Mトークンあたり$10.00の出力コストを取る中、StepFunは$2.70に抑えた。600Bという総パラメータ規模を持ちながら、推論時に動かすのはそのうち27B(約4.5%)のみというMoEアーキテクチャの妙がこのコスト構造を支えている。

9月20日、Michal Sutterが「StepFun Launches Step 5 Preview: A 600B-Total, 27B-Active MoE Model With 1M Context for Long-Horizon Agentic Work」と題した記事を公開した。出力コストが業界中央値の約27%——これがStep 5 Previewの最大の訴求点だ。同等クラスのモデルが1Mトークンあたり$10.00の出力コストを取る中、StepFunは$2.70に抑えた。600Bという総パラメータ規模を持ちながら、推論時に動かすのはそのうち27B(約4.5%)のみというMoEアーキテクチャの妙がこのコスト構造を支えている。


価格:業界中央値の4分の1以下の出力コスト

Step 5 PreviewのAPI価格は以下のとおりだ。

トークン種別 価格(1Mトークンあたり)
入力(キャッシュなし) $1.00
入力(キャッシュヒット) $0.05
出力(推論込み) $2.70

Artificial Analysisが示す同等モデルの中央値は入力$1.88・出力$10.00であり、出力コストは中央値の約27%という水準だ。

ただし一点注意がある。Artificial Analysisの計測では、Step 5 Previewの出力トークン数が1億6000万トークンに達した(中央値は9200万)。推論トークンが冗長なため、単純なトークン単価の安さがそのままコスト削減に直結するわけではない。実際の利用コストはワークロードの性質によって変わる点には留意が必要だ。


600Bパラメータ、ただし推論時は27Bしか使わない

Step 5 PreviewはMixture-of-Experts(MoE)アーキテクチャを採用する。MoEとは、大量のパラメータを持ちながらも、各トークン処理時には一部の「エキスパート」ネットワークだけを起動する構造だ。全パラメータを常時使うDenseモデルに比べ、推論コストを抑えられる点が特徴である。

Step 5 Previewの場合、総パラメータは約600B、1トークンあたりの活性化パラメータは約27B——全体の約4.5%に留まる。GPT-4oやClaude 3系もMoEと推定されているが、StepFunはここまで明示的に数字を公開している。

アーキテクチャの設計思想も特徴的だ。ネットワークを横に広げるのではなく、Transformerを92層積み上げた「狭くて深い」構造を採用している。研究チームは、深いスタックほど暗黙的なマルチホップ推論(複数ステップの論理連鎖)のパスが長くなると主張する。エージェントがWeb検索・コード実行・ツール呼び出しを繰り返すような長い処理(long prefill)で効果を発揮する設計だ。


コンテキスト1Mトークン、エージェント用途を正面から狙う

モデルの主要スペックは以下のとおりだ。

項目 仕様
モデルID step-5-preview
コンテキスト長 1Mトークン
入力 テキスト・画像・動画
出力 テキスト
Reasoning effort low / medium / high
機能 ストリーミング、ツール呼び出し、JSONモード、プロンプトキャッシュ

対象ワークロードとしてStepFunが明示しているのはソフトウェアエンジニアリング、専門知識作業、金融の3分野だ。エージェントが1回のアクション中に950回のWebフェッチを実行したとも報告されている。Claude Codeとの統合もStep Plan経由でドキュメント化されている。

学習面では、長期的な行動系列を最適化するオンポリシーの強化学習(long-horizon RL)を採用。MTP-3投機的デコード、FP8 MoE、KVキャッシュオフロードなどの最適化も組み合わせており、long-horizon RL全体で3倍以上のエンドツーエンド高速化を達成したと報告している。元記事には比較基準の明示はないが、文脈からはlong-horizon RL訓練の初期実装(最適化前)との比較と読める。


ベンチマーク:ライバルより低いeffortで近い数字を出す

StepFunが公開したベンチマーク結果で注意すべき点がある。Step 5 PreviewはHigh effortで実行し、比較対象のClaude Opus 5とGPT-6 AstraはMaxで実行している

ここで言うeffortとは、モデルが推論に費やす計算量の段階設定だ。Highは最大値(Max)より少ない計算量で動作するため、Step 5 Previewは競合より有利な条件——すなわち低コスト寄りの設定——でこれらのスコアに近づいていることになる。逆に言えば、同条件で比較した場合にスコア差が縮まる可能性も、広がる可能性もあり、現時点では断定できない点に注意が必要だ。

なお、Claude Opus 5はAnthropicが2025年後半にリリースした最上位モデル、GPT-6 AstraはOpenAIが2026年に投入したフラッグシップモデルである。いずれも執筆時点での最高性能クラスに位置する。

ベンチマーク Step 5 Preview (High) Claude Opus 5 (Max) GPT-6 Astra (Max)
FrontierFinance 66.4 69.7 55
DRACO 83.3 87.6 76.8

コーディングでは DeepSWE v1.1が67.7、ProgramBenchが80.5を記録。ただしいずれもGPT-6 AstraとClaude Opus 5が上回る。StepCodeBench(StepFun自社ベンチマーク)は49.0。

第三者機関のArtificial AnalysisによるIntelligence Indexでは44点を記録。同価格帯の推論モデルの中央値が24点であることを考えると、相対的には高い位置づけだ。API上の出力速度は99.8トークン/秒と計測されている。

エージェント実験として24時間連続タスクも2件実施している。1件目はH100カーネルのチューニングで508 TFLOPS(Claude Opus 5は493 TFLOPS)、2件目はQwen3-30B-A3BのAIME24スコアを自動ポストトレーニングで53.3%から60%に改善した。


オープンウェイトは2026年10月15日公開予定

現時点ではホストAPIとStepFunプラットフォーム経由での利用のみで、セルフホストはできない。オープンウェイトの公開は2026年10月15日が予定されている。

600BパラメータをBF16で格納すると約1.2TBになる計算だ(KVキャッシュは別途)。ウェイト公開後にセルフホストするにはマルチGPUサーバー構成が前提となる。

詳細はStepFun Launches Step 5 Preview: A 600B-Total, 27B-Active MoE Model With 1M Context for Long-Horizon Agentic Workを参照していただきたい。