powered by TechFeed
表示モード
主要ニュース

Black Forest LabsがFlux 3を公開 — 映像・音声を1モデルで同時学習し、Luma比93%の選好率でLuma・Runwayを上回る動画生成品質を主張

7月24日、The Decoderが「Flux 3 generates videos with native audio up to 20 seconds long, a first for Black Forest Labs」と題した記事を公開した。ドイツのAI企業Black Forest Labsが画像・動画・音声を同時に学習するマルチモーダル基盤モデル「Flux 3」を発表し、同社初となるネイティブ音声付き動画生成を実現した。なかでも注目すべきは競合比較の数字で、Luma Ray 3.2に対して**ユーザー選好率93%、Runway Gen-4.5に対して77%**という初期評価を報告している点だ。

7月24日、The Decoderが「Flux 3 generates videos with native audio up to 20 seconds long, a first for Black Forest Labs」と題した記事を公開した。ドイツのAI企業Black Forest Labsが画像・動画・音声を同時に学習するマルチモーダル基盤モデル「Flux 3」を発表し、同社初となるネイティブ音声付き動画生成を実現した。なかでも注目すべきは競合比較の数字で、Luma Ray 3.2に対して**ユーザー選好率93%、Runway Gen-4.5に対して77%**という初期評価を報告している点だ。


音声・映像を統合学習する「Flux 3」の何が新しいか

これまでの動画生成モデルは映像と音声を別々のパイプラインで扱うことが多かった。Black Forest Labs(BFL)が今回リリースしたFlux 3は、画像・動画・音声の3モダリティを単一モデルで同時学習することで、それぞれが持つ情報の欠落を補い合う設計になっている。

BFLの主張はシンプルだ。「画像は空間構造を示し、動画は時間変化を捉え、音声は物理的な出来事と音の対応関係を明らかにする。3つを同時に学習することで、個別に学習するより多くの情報を得られる」というものだ。

最大20秒・ネイティブ音声付き動画生成

Flux 3の目玉機能は、ネイティブ音声付きの動画生成だ。BFL製品として初の対応となり、最長20秒のクリップを生成できる。対応する生成モードは以下の通り。

  • テキスト→動画(text-to-video)
  • 画像→動画(image-to-video)
  • 動画→動画(video-to-video)
  • キーフレームベースのトランジション
  • 多言語ダイアログ
  • エージェント駆動によるクリップ間の連結(マルチショットシーケンス)

BFLは特に「人物の表情表現」と「物理的イベントへの音声マッチング(例:衝突音・足音など現実の物理現象と音声を対応させる能力)」を得意とすると説明している。

競合比較の数字

BFLが720p・10秒クリップで実施した初期評価では、以下の結果が報告されている。


Flux 3の動画モデルを8つの競合と比較したユーザー選好率。50%が同率を示す。(画像: Black Forest Labs)

比較対象 Flux 3の選好率
Luma Ray 3.2 93%
Runway Gen-4.5 77%
Grok Imagine Video 69%
Kling v3 Pro 60%
Happy Horse v1 59%
Happy Horse 1.1 57%
Seedance 2.0 52%
Gemini Omni Flash 52%

Luma・Runwayに対しては大きく上回る一方、Seedance 2.0やGemini Omni Flashとはほぼ拮抗している。BFL自身も「結果は暫定的」と断っており、独立した第三者による検証はまだない。

なお、Happy Horse v1・1.1は比較表に登場する中国系の動画生成モデルで、日本ではあまり知られていないが、グローバルなベンチマーク文脈では比較対象として用いられることがある。SeedanceはすでにHollywoodスタジオでの利用が話題になっているモデルだ(関連記事)。Gemini Omni Flashと並ぶ水準であれば、現時点のトップ層に位置するとも言える。

アーキテクチャ:Self-FlowとマルチモーダルTransformer

Flux 3は、BFLが開発したSelf-Flowと呼ぶ学習手法に基づく。生成と理解を同一モデルで同時に学習させるアプローチで、従来のflow-matching手法より生成品質・物理世界の理解度の両面で優れると主張している。

flow-matchingとは、ノイズから目標データへの変換経路(フロー)を学習する生成モデルの手法で、拡散モデル(diffusion model)が段階的なノイズ除去を繰り返すのに対し、より直接的な変換経路を学習することでサンプリングの効率化を図るアプローチだ。Self-Flowはそのflow-matchingをベースに、生成タスクと理解タスクを単一モデルで同時最適化する点が特徴となっている。


Flux 3は画像・動画・音声・アクション専用のエンコーダ・デコーダを持つマルチモーダルTransformerを採用。(画像: Black Forest Labs)

アーキテクチャはマルチモーダルTransformerで、各モダリティ専用のエンコーダ・デコーダが出力をひとつの内部表現に変換・復元する構造だ。さらに「アクション」コンポーネントも備えており、将来的な用途への拡張が可能な設計になっている。

ロボティクスへの展開

BFLはMimic Roboticsと共同でFlux-mimic(動画アクションモデル)を開発しており、Audiの生産ラインでテスト中だという。

リリース計画:段階展開とオープンウェイト

BFLは段階的なロールアウトを予定している。

  • Flux 3 Videoすでに利用可能
  • Flux 3 Image:数週間以内にリリース予定(複雑なプロンプトや多言語テキスト描画の改善も期待)
  • アクション予測:当初は選定パートナー経由での提供
  • Flux 3 Dev(オープンウェイト版):マルチモーダルバックボーンを公開予定

長期的には、知覚・アクション・言語予測を単一モデルに統合した次世代モデルの開発も進めているとのことだ。


詳細はFlux 3 generates videos with native audio up to 20 seconds long, a first for Black Forest Labsを参照していただきたい。