powered by TechFeed
表示モード
主要ニュース

画像生成「FLUX」のBlack Forest Labs、ロボット向けAIをオープンリリース — 7Bパラメータで既存モデルの半分以下のサイズながら推論速度3.95倍、RoboLab-120リーダーボードで首位

9月25日、Matthias Bastianが「Black Forest Labs launches FLUX 3 Action, an open robotics AI model」と題した記事を公開した。画像生成モデル「FLUX」シリーズで知られるBlack Forest Labs(BFL)が、ロボティクス向けAIモデル「FLUX 3 Action」をオープンリリースした。パラメータ数わずか70億(7B)という軽量構成でありながら、NVIDIAのRoboLab-120リーダーボードでトップの成功率を記録し、推論速度は従来のオープンモデル最高峰に対して最大3.95倍に達するという。

9月25日、Matthias Bastianが「Black Forest Labs launches FLUX 3 Action, an open robotics AI model」と題した記事を公開した。画像生成モデル「FLUX」シリーズで知られるBlack Forest Labs(BFL)が、ロボティクス向けAIモデル「FLUX 3 Action」をオープンリリースした。パラメータ数わずか70億(7B)という軽量構成でありながら、NVIDIAのRoboLab-120リーダーボードでトップの成功率を記録し、推論速度は従来のオープンモデル最高峰に対して最大3.95倍に達するという。


FLUX 3 Actionとは何か――ワールド・アクションモデルの概要

FLUX 3 Actionは、BFLが開発したマルチモーダルモデルFLUX 3をベースとしている。FLUX 3は動画データを主軸に学習しつつ、画像・音声データも取り込んだモデルであり、映像の時間的変化を高精度に把握することを得意とする。FLUX 3 Actionはその能力をロボティクスに転用した派生モデルと位置づけられる。

FLUX 3 Actionはいわゆる「ワールド・アクションモデル」として機能する。ワールド・アクションモデルとは、エージェント(ここではロボット)が置かれた環境の状態を観測し、次にどのような行動を取るべきかを出力するとともに、その行動の結果として環境がどう変化するかを予測するモデルの総称だ。単に「次の動作を出力する」だけでなく、「行動後の世界の状態」まで予測する点が従来の行動予測モデルとの違いといえる。

具体的には、ロボットの作業空間に設置された複数カメラの映像をリアルタイムで入力として受け取り、ロボットアームの次の動作指令と環境変化の予測を同時に生成する。このアーキテクチャにより、ロボットは単なるルールベースの動作ではなく、状況を理解した上での柔軟な行動選択が可能になる。


7Bパラメータで首位――RoboLab-120の数字が示すもの

性能面での数字が際立っている。NVIDIAが公開しているRoboLab-120リーダーボードは、ロボット操作タスクを120種類のシナリオで評価するベンチマークだ。多腕ロボットによる把持・組み立て・整理整頓など、実環境を模したタスク群で各モデルの成功率を競う形式となっている。

このリーダーボードにおいて、FLUX 3 Actionは7Bパラメータでトップの成功率を記録した。比較対象となる従来のオープンモデル最高峰であるCosmos-3 Nano(約15B)の半分以下のパラメータ数でありながら、推論速度は最大3.95倍に達する。


「大規模推論モデルは計画が得意だが、ロボットには重すぎる」

BFLはこの効率性の重要性をこう説明している。大規模な推論モデルは高度な計画立案が可能だが、動作が遅くサイズが大きすぎるため、ロボットへのオンデバイス展開には向かない。FLUX 3 Actionはその課題を正面から攻めた設計といえる。

ロボティクスAIの文脈では、モデルの推論速度はそのままロボットの応答性に直結する。工場の製造ラインや精密作業を想定すると、数百ミリ秒の遅延が致命的になるケースもある。7Bという規模でリーダーボード首位を取ったことは、単なるベンチマーク上の数字以上の意味を持つ。オンデバイス推論が現実的な選択肢になることで、クラウド依存を排した自律型ロボットの実用化が一歩近づく。

また、BFLがロボティクス領域に踏み込んだ背景には、FLUX 3で培った動画理解能力がある。動画は本質的に「時間軸上の状態変化の連続」であり、ロボットが置かれた環境の変化を予測するという課題と構造的に親和性が高い。画像生成から動画理解、そしてロボット行動予測という流れは、モデルアーキテクチャの観点から見れば自然な延長線上にある。


デジタル環境への応用も視野に

BFLはロボット実機への応用にとどまらず、デジタル環境での活用も視野に入れている。

具体的には、ビデオゲームをナビゲーションのテスト環境として活用するユースケースが挙げられている。ゲーム内の仮想空間はロボット実機の試験場よりもコストが低く、多様なシナリオを高速に反復できるため、行動モデルの事前学習や評価環境として有望視されている。また、コンピュータのGUI操作を高速にこなすエージェントへの展開も想定されており、PC上でのタスク自動化といった分野への応用が期待される。物理空間と仮想空間の両方を対象とした設計は、FLUX 3 Actionを汎用的なアクションモデルとして位置づけようとするBFLの意図を示している。


ウェイトはHugging Faceで公開中

モデルの重みはHugging Face上のコレクションとして公開されている。オープンリリースであるため、研究者や開発者はそのまま利用・改変が可能だ。

ロボティクスAI分野では、Google DeepMindのRT-2やPhysical Intelligenceのπ0など、大手・スタートアップ各社が独自モデルを投入している。BFLはもともと画像生成で名を上げた企業であり、ロボティクス領域への進出はその事業展開として注目される動きだ。効率性を武器に新興プレイヤーが既存モデルを上回るという構図は、ロボティクスAIのオープンエコシステム全体にとっても刺激になりうる。

詳細はBlack Forest Labs launches FLUX 3 Action, an open robotics AI modelを参照していただきたい。