9月20日、Michal Sutterが「StepFun Launches Step 5 Preview: A 600B-Total, 27B-Active MoE Model With 1M Context for Long-Horizon Agentic Work」と題した記事を公開した。出力コストが業界中央値の約27%——これがStep 5 Previewの最大の訴求点だ。同等クラスのモデルが1Mトークンあたり$10.00の出力コストを取る中、StepFunは$2.70に抑えた。600Bという総パラメータ規模を持ちながら、推論時に動かすのはそのうち27B(約4.5%)のみというMoEアーキテクチャの妙がこのコスト構造を支えている。
価格:業界中央値の4分の1以下の出力コスト
Step 5 PreviewのAPI価格は以下のとおりだ。
| トークン種別 | 価格(1Mトークンあたり) |
|---|---|
| 入力(キャッシュなし) | $1.00 |
| 入力(キャッシュヒット) | $0.05 |
| 出力(推論込み) | $2.70 |
Artificial Analysisが示す同等モデルの中央値は入力$1.88・出力$10.00であり、出力コストは中央値の約27%という水準だ。
ただし一点注意がある。Artificial Analysisの計測では、Step 5 Previewの出力トークン数が1億6000万トークンに達した(中央値は9200万)。推論トークンが冗長なため、単純なトークン単価の安さがそのままコスト削減に直結するわけではない。実際の利用コストはワークロードの性質によって変わる点には留意が必要だ。
600Bパラメータ、ただし推論時は27Bしか使わない
Step 5 PreviewはMixture-of-Experts(MoE)アーキテクチャを採用する。MoEとは、大量のパラメータを持ちながらも、各トークン処理時には一部の「エキスパート」ネットワークだけを起動する構造だ。全パラメータを常時使うDenseモデルに比べ、推論コストを抑えられる点が特徴である。
Step 5 Previewの場合、総パラメータは約600B、1トークンあたりの活性化パラメータは約27B——全体の約4.5%に留まる。GPT-4oやClaude 3系もMoEと推定されているが、StepFunはここまで明示的に数字を公開している。
アーキテクチャの設計思想も特徴的だ。ネットワークを横に広げるのではなく、Transformerを92層積み上げた「狭くて深い」構造を採用している。研究チームは、深いスタックほど暗黙的なマルチホップ推論(複数ステップの論理連鎖)のパスが長くなると主張する。エージェントがWeb検索・コード実行・ツール呼び出しを繰り返すような長い処理(long prefill)で効果を発揮する設計だ。
コンテキスト1Mトークン、エージェント用途を正面から狙う
モデルの主要スペックは以下のとおりだ。
| 項目 | 仕様 |
|---|---|
| モデルID | step-5-preview |
| コンテキスト長 | 1Mトークン |
| 入力 | テキスト・画像・動画 |
| 出力 | テキスト |
| Reasoning effort | low / medium / high |
| 機能 | ストリーミング、ツール呼び出し、JSONモード、プロンプトキャッシュ |
対象ワークロードとしてStepFunが明示しているのはソフトウェアエンジニアリング、専門知識作業、金融の3分野だ。エージェントが1回のアクション中に950回のWebフェッチを実行したとも報告されている。Claude Codeとの統合もStep Plan経由でドキュメント化されている。
学習面では、長期的な行動系列を最適化するオンポリシーの強化学習(long-horizon RL)を採用。MTP-3投機的デコード、FP8 MoE、KVキャッシュオフロードなどの最適化も組み合わせており、long-horizon RL全体で3倍以上のエンドツーエンド高速化を達成したと報告している。元記事には比較基準の明示はないが、文脈からはlong-horizon RL訓練の初期実装(最適化前)との比較と読める。
ベンチマーク:ライバルより低いeffortで近い数字を出す
StepFunが公開したベンチマーク結果で注意すべき点がある。Step 5 PreviewはHigh effortで実行し、比較対象のClaude Opus 5とGPT-6 AstraはMaxで実行している。
ここで言うeffortとは、モデルが推論に費やす計算量の段階設定だ。Highは最大値(Max)より少ない計算量で動作するため、Step 5 Previewは競合より有利な条件——すなわち低コスト寄りの設定——でこれらのスコアに近づいていることになる。逆に言えば、同条件で比較した場合にスコア差が縮まる可能性も、広がる可能性もあり、現時点では断定できない点に注意が必要だ。
なお、Claude Opus 5はAnthropicが2025年後半にリリースした最上位モデル、GPT-6 AstraはOpenAIが2026年に投入したフラッグシップモデルである。いずれも執筆時点での最高性能クラスに位置する。
| ベンチマーク | Step 5 Preview (High) | Claude Opus 5 (Max) | GPT-6 Astra (Max) |
|---|---|---|---|
| FrontierFinance | 66.4 | 69.7 | 55 |
| DRACO | 83.3 | 87.6 | 76.8 |
コーディングでは DeepSWE v1.1が67.7、ProgramBenchが80.5を記録。ただしいずれもGPT-6 AstraとClaude Opus 5が上回る。StepCodeBench(StepFun自社ベンチマーク)は49.0。
第三者機関のArtificial AnalysisによるIntelligence Indexでは44点を記録。同価格帯の推論モデルの中央値が24点であることを考えると、相対的には高い位置づけだ。API上の出力速度は99.8トークン/秒と計測されている。
エージェント実験として24時間連続タスクも2件実施している。1件目はH100カーネルのチューニングで508 TFLOPS(Claude Opus 5は493 TFLOPS)、2件目はQwen3-30B-A3BのAIME24スコアを自動ポストトレーニングで53.3%から60%に改善した。
オープンウェイトは2026年10月15日公開予定
現時点ではホストAPIとStepFunプラットフォーム経由での利用のみで、セルフホストはできない。オープンウェイトの公開は2026年10月15日が予定されている。
600BパラメータをBF16で格納すると約1.2TBになる計算だ(KVキャッシュは別途)。ウェイト公開後にセルフホストするにはマルチGPUサーバー構成が前提となる。
詳細はStepFun Launches Step 5 Preview: A 600B-Total, 27B-Active MoE Model With 1M Context for Long-Horizon Agentic Workを参照していただきたい。




