Flux 3 は画像、動画、音声、行動を一つのワールドモデルに統合します。
Flux 3 は Black Forest Labs によるマルチモーダル基盤モデルで、画像、動画、ネイティブ音声、行動予測を実現します。ここで一貫したシーンブリーフを作成し、Flux3.co で利用可能なワークフローを確認しましょう。
外部プレイグラウンド · Flux3.co を開きます
セラミックのロボットが夜明けの温室を修理している。温かなガラスの反射と同一キャラクターを全カットで維持。カメラはワイドから手元へ移動。柔らかなサーボ音、外の鳥の声、一言のセリフを追加。
キャラクター · 素材 · 照明
動き · カメラ · 連続性
会話 · 環境音 · 効果音
接触 · 原因 · 反応
4種類の信号
画像、動画、音声、行動
最大20秒
ネイティブ音声付き動画を1回生成
720p
公開初期動画評価に使用
アーリーアクセス
利用可能性と制御はまだ進化中
アーキテクチャがブリーフを変える
異なるモダリティが、同じシーンを捉えます。
個別の生成モデルは手作業をモデル間で引き継ぎます。Flux 3 は、外観、動き、音が1つの基盤内で相互に制約し合うように学習されています。実用的な目標は、スイッチを減らすことではなく、シーンの各部分間の矛盾を減らすことです。
個別生成スタック
- 静止画でルックを確立
- 動画モデルが動きを再構築
- 音声は映像の後でレイヤー
- 連続性をツール間で修正
Flux 3 ワールドブリーフ
- リファレンスが1つの共有シーンを導く
- 動きは物体と素材に従う
- 音は目に見えるイベントに属する
- 行動は予測された変化に基づく
統合されるもの
4つの能力、1つのクリエイティブな方向性。
Flux 3 は単なる画像アップグレードではありません。各能力は、同じ想像上の世界に異なる制約をもたらします。
画像合成と編集
多様なスタイル、アスペクト比、解像度で静止画像を作成または修正。Black Forest Labs は、複雑なプロンプト処理と多言語テキストが従来の Flux 世代よりも優れていると報告しています。
シーン連続性のある動画
テキスト、開始フレーム、ビジュアルリファレンス、既存のクリップ、定義されたキーフレームから生成。モデルは、主要な被写体とシーンロジックを動きを通して保持するように設計されています。
ネイティブ同期音声
映像と共に会話、環境音、効果音を生成可能。これにより、音をイベントに結びつけ、独立した最終レイヤーとして扱うのではなく、原因となる出来事に音を関連付けます。
行動と物理的予測
同じバックボーンが Flux-mimic などの専門システムを通じて行動予測をサポート。クリエイターにとって、この研究は接触、重量、原因、反応の強調を説明します。
実用的なプロンプトシーケンス
1つのワールドブリーフを4パスで記述。
すべてのアイデアを形容詞の雲に圧縮しないでください。固定すべきものを確立し、時間の経過とともに変化するものを指示します。
- 01
世界を固定する
被写体、環境、時間帯、素材、ビジュアルスタイルを定義。すべてのショットや編集で維持すべき詳細を指定。
- 02
時間経過に伴う変化を指示
再生順にアクションを記述。被写体の動きとカメラの動きが混同されないよう、カメラの動きは別途追加。
- 03
音をイベントに結びつける
会話、環境音、重要な効果音のみを指定。各効果音を目に見える原因に結びつけ、音楽の開始・終了を指示。
- 04
リファレンスに役割を与える
各画像やクリップが、アイデンティティ、スタイル、レイアウト、動き、連続性のどれを制御するかを説明。同じ指示を繰り返すだけのリファレンスは削除。
統合モデルが活きる場面
映像と音声が一致しなければならないところから始めましょう。
Flux 3 は、成果物がモダリティをまたぐ場合に最も際立ちます。単一の独立したアセットには、専用ツールの方が適している場合もあります。
映画やキャンペーンのプレビジュアライゼーション
撮影、最終アニメーション、フルポストプロダクションパイプラインに着手する前に、シーンの構図、動き、会話、雰囲気を一緒に探求。
プロダクトストーリー
製品、マテリアルランゲージ、ブランドムードをヒーロースティルからローンチクリップ、デモ、音響を考慮したソーシャルコンセプトまで一貫して表現。
キャラクターと世界観の開発
ビジュアルリファレンスを使用して、世界をゼロから説明し直すことなく、繰り返し登場するキャラクター、ロケーション、カメラランゲージ、マルチショットシーケンスをテスト。
インタラクティブおよび物理プロトタイピング
世界や物体がアクションにどう反応するかをスケッチ。探索として扱い、プロダクションレベルの制御やロボティクスは別の専門ワークフローに委ねる。
プロンプトの構造
各モダリティに明確な役割を与える。
このコンパクトな構造でシーンを読みやすくします。必要な行のみを使用してください。
セラミック製の修理ロボットが、日の出直後の湿度の高い温室で作業している。
全ショットで同一ロボット、欠けた釉薬、植物の配置、暖かいガラスの反射を維持。
銅製のバルブを締め、蒸気が漏れたときに一時停止し、近くの苗を覆う。
ワイドから始め、手元へ移動し、蒸気が晴れるまでクローズの横顔をキープ。
静かなサーボのクリック音、ガラスの向こうの鳥の声、バルブに同期した柔らかなヒス音。
プロダクション計画の前に
発表された機能と一般的な利用可能性は同じではありません。
Flux 3 はアーリーアクセスプログラムとして開始されました。期限、予算、ローカル展開計画を立てる前に、現在のプロダクト制御を確認してください。
段階的なロールアウト
Flux 3 動画はアーリーアクセスで利用可能。Black Forest Labs によると、画像アクセス、追加API、プライベートウェイト、Flux 3 Dev は別のロールアウト段階で順次提供予定。
評価は暫定的
公開された比較は開発中に実行され、モデルや評価手法の改善に伴い変更される可能性があります。恒久的なベンチマーク結論ではなく、初期シグナルとして扱ってください。
ローカル要件は未確定
オープンウェイトのマルチモーダルバックボーンが計画されていますが、最終的なモデルサイズ、ハードウェア要件、ライセンス、実用的な消費者展開の詳細はまだ確定していません。
初回カットは仕上げが必要
ネイティブ音声と連続性によりアセンブリ作業は削減できますが、正確なタイミング、編集、安全レビュー、権利クリアランス、最終マスタリングはプロダクションの責任です。
実用的な回答
よくある質問
Flux 3 とは何ですか?
Flux 3 は Black Forest Labs によるマルチモーダル基盤モデルで、画像、動画、音声を共同で学習し、行動予測にも関連しています。シーンの見た目、変化、音、反応をモデル化するよう設計されており、各モダリティを独立したタスクとして扱いません。
このページで Flux 3 を生成できますか?
いいえ。これは独立した編集ガイドであり、隠れたジェネレーターではありません。メインボタンは Flux3.co を開き、現在利用可能なプレイグラウンド、アカウント要件、制御、価格を確認できます。
Flux 3 動画は何を生成できますか?
公式資料では、テキストから動画、画像から動画、リファレンスガイド動画、動画から動画、動画と音声の継続、キーフレーム遷移、多言語会話、ネイティブ音声が説明されています。個別の制御は現在のアーリーアクセスサーフェスに依存します。
Flux 3 の動画はどのくらいの長さですか?
Black Forest Labs によると、Flux 3 はネイティブ音声付きで最大20秒の動画を1回で生成できます。公開された予備評価では、10秒、720pのテキスト→動画クリップが使用されました。
Flux 3 はオープンソースですか?
Black Forest Labs は Flux 3 Dev をオープンウェイトのマルチモーダルバックボーンとして計画しています。それは自動的にオープンソースライセンスを意味するわけではなく、最終的なライセンス、サイズ、ハードウェア要件はウェイト公開時に確認する必要があります。
Flux 3 画像は現在利用可能ですか?
執筆時点では、Black Forest Labs によると Flux 3 画像のアーリーアクセスは数週間以内に開始予定です。利用可能性は急速に変化する可能性があるため、リンク先のプレイグラウンドと公式発表で最新状況を確認してください。
ワールドブリーフから最初の生成へ
画像、動き、音声を同じ会話に保ちましょう。
1つの焦点を絞ったシーンから始め、すべてのリファレンスに目的を与え、Flux3.co に進んで現在の Flux 3 ワークフローを探索する準備ができたら実行しましょう。
Flux 3 を試すNanabanana を離れ、Flux3.co を開きます。