Flux 3 將影像、影片、音訊與動作整合於一個世界模型中。
Flux 3 是 Black Forest Labs 的多模態基礎模型,專為影像、影片、原生音訊與動作預測而設計。在此建立一個連貫的場景簡報,然後前往 Flux3.co 探索可用的工作流程。
外部遊樂場 · 開啟 Flux3.co
一個陶瓷機器人在黎明時分修復溫室。保持溫暖的玻璃反射,並在各個鏡頭中維持相同的角色。攝影機從廣角緩緩移動到它的雙手。加入柔和的伺服馬達聲、外面的鳥鳴,以及一句口白。
角色 · 材質 · 光線
動作 · 攝影 · 連續性
對話 · 環境音 · 效果
接觸 · 因果 · 反應
4 種訊號
影像、影片、音訊與動作
最長 20 秒
單次生成含原生音訊的影片
720p
用於已發布的早期影片評估
搶先體驗
可用性與控制項仍在演進中
架構改變了簡報方式
不同模態共同描述同一個場景。
獨立生成器將工作從一個模型移交給另一個。Flux 3 經過訓練,使得外觀、動態與聲音在一個基礎模型內相互約束。實際目標不是增加更多開關,而是減少場景各部分之間的矛盾。
獨立生成堆疊
- 一張靜態圖建立外觀
- 一個影片模型重建動態
- 音訊在圖片之後疊加
- 工具之間的連續性需要修復
Flux 3 世界簡報
- 參考資料引導一個共享場景
- 動態遵循物體與材質
- 聲音屬於可見的事件
- 動作基於預測的變化
正在整合什麼
四項能力,一個創作方向。
Flux 3 不僅僅是影像升級。每項能力都為同一個想像世界貢獻不同的限制條件。
影像合成與編輯
以多種風格、寬高比與解析度建立或修改靜態影像。Black Forest Labs 報告指出,其處理複雜提示與多語言文字的能力比先前的 Flux 世代更強。
具場景連續性的影片
從文字、起始幀、視覺參考、現有片段或定義的關鍵影格生成。模型設計旨在於動作中維持主要主題與場景邏輯。
原生同步音訊
對話、環境音與音效可隨視覺內容一同產生。這將聲音與引發它的事件連結,而非將音訊視為獨立的最後修飾層。
動作與物理預測
同一個基礎架構可透過專門系統(如 Flux-mimic)支援動作預測。對創作者而言,這項研究解釋了為何強調接觸、重量、因果與反應。
實用的提示序列
分四個步驟撰寫一個世界簡報。
不要將所有想法壓縮成一堆形容詞。先確定必須固定的元素,然後指導隨時間變化的部分。
- 01
錨定世界
定義主題、環境、時間、材質與視覺風格。指出每個鏡頭或編輯中都應保留的細節。
- 02
指導隨時間的變化
按播放順序描述動作。分別加入攝影機移動,以免主體動作與攝影機動作混淆。
- 03
將聲音連結到事件
指定對話、環境音以及重要的音效。將每個音效與可見的原因連結,並說明音樂應何時進入或淡出。
- 04
有明確用途地使用參考
解釋每張圖片或片段是控制身份、風格、佈局、動作還是連續性。移除重複相同指令但未增加資訊的參考。
統一模型的適用場景
從圖像與聲音必須一致的場景開始。
當交付成果跨越模態時,Flux 3 最為突出。對於單一孤立資產,專用工具可能仍是較佳選擇。
電影與廣告前視覺化
在投入拍攝、最終動畫或完整後製流程之前,同時探索場景的構圖、動作、對話與氛圍。
產品故事
將產品、材質語言與品牌氛圍從主打靜態圖延續到宣傳影片、示範與具聲音感知的社群概念。
角色與世界開發
使用視覺參考來測試重複出現的角色、地點、攝影機語言與多鏡頭序列,無需從頭重新描述世界。
互動與物理原型製作
草擬世界或物體如何對動作做出反應。將其視為探索;生產控制與機器人技術仍是獨立且專業的工作流程。
提示結構
為每個模態賦予明確任務。
此精簡結構能讓場景易於理解。只使用你的交付成果所需的行。
一個陶瓷維修機器人在日出後潮濕的溫室中工作。
在所有鏡頭中保持相同的機器人、釉面裂紋、植物佈局與溫暖的玻璃反射。
它旋緊一個銅閥門,在蒸汽噴出時暫停,然後護住附近的幼苗。
從廣角開始,向雙手滑行,然後在蒸汽散去時保持近距離側面。
使用安靜的伺服馬達點擊聲、玻璃外的鳥鳴,以及與閥門同步的一次輕柔嘶嘶聲。
在規劃生產之前
公布的能力不等於普遍可用。
Flux 3 以搶先體驗計畫推出。在根據它制定截止日期、預算或本地部署計劃之前,請先閱讀當前產品控制項。
推出是分階段的
Flux 3 影片可透過搶先體驗取得。Black Forest Labs 表示影像存取、其他 API、私有權重與 Flux 3 Dev 將在後續階段分別推出。
評估為初步結果
已發表的比較是在開發期間進行的,並可能隨著模型與評估工具的改進而變化。請將其視為早期訊號,而非永久的基準結論。
本地需求未知
計畫推出開放權重的多模態基礎架構,但最終模型大小、硬體需求、授權與實際消費者部署細節尚未確定。
初步成果仍需後製
原生音訊與連續性可減少組裝工作,但精確的時間點、剪輯、安全審查、版權清理與最終母帶處理仍是生產端的責任。
實用解答
常見問題
什麼是 Flux 3?
Flux 3 是 Black Forest Labs 的多模態基礎模型,聯合訓練於影像、影片與音訊,並包含動作預測的相關工作。它旨在模擬場景的外觀、變化、聲音與反應,而非將每個模態視為獨立任務。
我可以在這個頁面上用 Flux 3 生成內容嗎?
不行。這是一份獨立的編輯指南,並非偽裝的生成器。主要按鈕會開啟 Flux3.co,你可以在那裡查看目前可用的遊樂場、帳戶需求、控制項與定價。
Flux 3 影片能生成什麼?
官方資料描述包含文字轉影片、圖片轉影片、參考引導影片、影片轉影片、影片與音訊延續、關鍵影格轉場、多語言對話與原生音訊。個別控制項取決於當前的搶先體驗介面。
Flux 3 影片可以多長?
Black Forest Labs 表示 Flux 3 可在單次生成中產生最長 20 秒含原生音訊的影片。其已發表的初步評估使用了 10 秒、720p 的文字轉影片片段。
Flux 3 是開源的嗎?
Black Forest Labs 計劃推出 Flux 3 Dev 作為開放權重的多模態基礎架構。這並不一定意味著開源授權,最終的授權、大小與硬體需求應在權重發布時查詢。
Flux 3 影像現在可用嗎?
在撰寫本文時,Black Forest Labs 表示 Flux 3 影像搶先體驗將在未來幾週開放。可用性可能快速變化,請查閱連結的遊樂場與官方公告以了解最新狀態。
從世界簡報到首次生成
將圖片、動作與聲音保持在同一個對話中。
從一個聚焦的場景開始,為每個參考賦予目的,然後在準備好探索當前 Flux 3 工作流程時前往 Flux3.co。
試用 Flux 3你將離開 Nanabanana 並開啟 Flux3.co。