FLUX 3 – 現実世界モデル: ビジュアル インテリジェンスのバックボーンとしてのマルチモーダル フロー モデルを目指して。
FLUX 3 は現在早期アクセスで利用可能です。
FLUX 3 は、新しいマルチモーダル基盤モデルです。学習する必要があるのは、これらの要素のいずれかが単独ではないため、統一されたアーキテクチャで画像、ビデオ、オーディオから一緒に学習します。代わりに、モデルは世界の表現、つまり物体がどのように結合するか、物体がどのように動くか、イベントがどのように聞こえるかを学習する必要があります。
完全な説明を提供する方法はありません。それぞれは、異なるセンサーによって捕捉された、同じ根底にある現実の投影であり、それぞれのセンサーはその過程で一部の情報を失います。画像は、特定の瞬間の空間構造と関係を捉えます。ビデオは時間の次元を復元し、時間の力学と物理法則を明らかにします。音声は、視覚だけでは検出できない機械的現象と音響的現象の間の因果関係を明らかにします。言語は、これらの認識を目標、抽象化、指示に結び付けます。
1 つから学び、その投影の適切なモデルを取得します。それらすべてから一度に学び、相互の制約からさらに多くのことがわかります。音は衝撃に一致する必要があり、動きは質量に従わなければならず、未来は過去に従う必要があります。モダリティはもはや別々のものではなく、根底にある現実の証拠となり始めます。
FLUX 3 は、完全にこの原則に基づいて構築された当社の最初のモデルであり、現実世界における視覚的インテリジェンス、つまり物理環境とデジタル環境で認識、予測、動作するモデルを開発するという当社の使命におけるチェックポイントです。コンテンツ作成と物理 AI における初期の結果は、それが進むべき道であることを示唆しています。
FLUX 3: 1 つのモデルで複数の機能。

FLUX 3 は、同一の基礎となるアーキテクチャ内でマルチモーダルな生成と理解を効率的に調整するためのアプローチである Self-Flow に基づいています。このアプローチに基づいて、ビデオ、画像、オーディオを同時に使用して FLUX 3 をトレーニングするために、コンピューティング リソースとデータ リソースを大幅に増加しました。

オートフラックスとフローマッチング (FM)。左: モードごとの生成誤差 (フレシェ距離)。それぞれ FM = 100 に正規化されています (小さいほど優れています)。右: 微調整による 4 つのタスク グループにわたる操作タスクの平均成功率 (高いほど良い)。
能力と早期評価
その結果、FLUX 3 はモダリティを混合し、結合画像とビデオ + オーディオを生成することができます。プレーンテキストリクエストの場合と、画像やビデオなどの入力参照を提供する場合の両方です。以下では、モデルの主要な機能のいくつかを取り上げます。
ビデオ
FLUX 3 は、1 世代で最大 20 秒のサウンドを含む非常に多様なビデオを作成できます。
そのコア機能には次のものが含まれます (すべての出力にネイティブ オーディオ生成が付属しています)。
- テキストからビデオへの生成。
- 画像からビデオへの生成。開始フレーム (「アニメーション」) から継続するか、視覚的な参照として画像を使用します。
- リファレンス クリップからのビデオ間生成。ソース ビデオの中心要素 (同じキャラクターなど) を新しいシーンまたはコンテキストに運びます。
- ビデオおよびオーディオ入力からの生成的なビデオとオーディオの継続。
- 定義された瞬間間のトランジションを制御するためのキーフレームからビデオの生成。
- 多言語ダイアログ。
- 従来の映画制作をはるかに超えた、幅広いビジュアル スタイルとアスペクト比。
- エージェントが個々のクリップをより長いマルチショット シーケンスに連鎖させます。
- スタイルの多様性が高い — FLUX 3 Video は、率直なビデオカメラの映像からアニメーションや映画まで、幅広いスタイルを簡単に処理できます。
- タイポグラフィーと漫画の強力な生成。
以下の予備分析のために、音声付きの 10 秒の 720p テキストからビデオへのクリップを生成しました。

レビューは早い段階であり、さらなる改善が期待されます
モデルとその周囲の配線はまだ開発中であるため、これらの結果は暫定的なものであり、早期アクセス段階でさらなる改善が期待されます。初期の評価では、比較の最大 69% で Grok Imagine Video よりも FLUX 3 が好まれ、60% で Kling v3 Pro、59% で Happy Horse v1、57% で Happy Horse 1.1、52% で Gemini Omni Flash が好まれました。 FLUX 3 は、比較の 77% で Runway Gen-4.5 よりも、比較の 93% で Luma Ray 3.2 よりも好まれました。
FLUX 3 Video はまだ開発中ですが、人間の表情のキャプチャ、音と物理的なイベントの関連付け、および多言語機能においてすでに特に強力です。さらに、これらの機能を組み合わせて数分間続くシーケンスを作成することもでき、視覚的な参照により、シーン間でキャラクターの一貫性を保つことができます。
FLUX 3 ビデオはこちらから早期アクセスで利用可能です
画像
FLUX 3 は、さまざまなスタイル、アスペクト比、解像度の画像を合成および編集できます。中程度のトレーニング中に実行された予備評価では、FLUX 3 は、以前のバージョンの FLUX に比べて大幅な改善がすでに示されており、複雑なリクエストとテキスト生成を処理する能力が大幅に向上しています。このモデルは幅広い出力スタイル (次の例を参照) を生成し、複数の言語で高精度のテキストをレンダリングできます。

ビデオの評価と同様、これらは暫定的な結果であり、リリースまでにさらなる改善が期待されます。今後数週間以内に FLUX 3 Image の早期アクセス フェーズを開始する予定です。
アクション
FLUX 3 の世界理解は行動予測にも及びます。私たちはこれに向けて 2 つの道を選びました。ネイティブ アクション予測を FLUX 3 に直接統合し、Self-Flow での初期作業を拡張しました。また、事前トレーニングされたビデオ バックボーンをダイナミクス認識ベースとして使用し、そこから限定されたタスク固有のデータを使用して特殊なアクション モデルを調整できます。
2 つ目は、mimic robotics が FLUX 3 に早期アクセスした最初のパートナーの 1 つでした。私たちは共同で FLUX-mimic を開発しました。これは、FLUX 3 のバックボーンと、製造に重点を置いた操作と実装のためのロボット学習における mimic の専門知識を組み合わせたビデオ アクション モデルです。物理的な AI とコンテンツ作成が同じ立場で機能する理由と、それがアウディの実際の生産タスクでどのようにテストされるかについての論文をお読みください。
打ち上げ計画
今後数週間から数か月かけて、次の機能を展開していきます。それぞれの機能は、スムーズな展開、フィードバックの収集、厳格なセキュリティ テストを確実にするための早期アクセス フェーズに続きます。すべての機能は、同じマルチモーダル フロー マッチング モデルから構築されています。これらの機能とモデルには次のものが含まれます。
- API およびプライベート ウェイト アクセスを介したビデオとオーディオの生成と編集。 (「FLUX 3 ビデオ」)
- 模倣ロボティクス(「FLUX-mimic および FLUX 3 Action」)をはじめとする研究と厳選された商業パートナーによるアクション予測
- API およびプライベート ウェイト アクセスを介した画像の合成と編集。 (「イメージフラックス3」)
- コンテンツ作成 (ビデオ、オーディオ、画像) とアクション予測のためのマルチモーダル バックボーンへのオープン アクセス。 (「FLUX 3 開発」)
また、基本的なアプローチに関する技術的な詳細も公開する予定です。
早期アクセスのリクエストはこちらから
次は何でしょうか?
私たちは、多用途で有能な、統合されたマルチモーダル モデルと、それによって何が可能になるのかの表面をなぞり始めたばかりです。インタラクティブな画像やビデオの編集、シミュレーションからコンピューターの使用、物理的な AI まで、フロンティアは広く開かれています。これらの新機能を段階的に展開する一方で、すでに次世代モデルの開発に取り組んでいます。私たちの目標は、知覚、行動、言語の予測を同じ統一モデルに統合することです。
FLUX 3 の探索と構築に興味がある場合は、ここからご連絡ください。私たちの使命に貢献することに興味があれば、ぜひご参加ください。ドイツとアメリカで採用を行っています。