Flux 3 统一图像、视频、音频和动作,成为一个世界模型。
Flux 3 是 Black Forest Labs 的多模态基础模型,用于图像、视频、原生音频和动作预测。在此构建一个连贯的场景摘要,然后继续前往 Flux3.co 探索可用工作流程。
外部体验 · 打开 Flux3.co
一个陶瓷机器人在黎明时分修理温室。保持温暖的玻璃反射和同一角色在多个镜头中。镜头从广角滑到其手部。添加柔和的伺服电机声、窗外鸟鸣和一句台词。
角色 · 材质 · 光照
运动 · 镜头 · 连续性
对话 · 环境音 · 效果
接触 · 原因 · 反应
4种信号
图像、视频、音频和动作
最长20秒
视频与原生音频一次生成
720p
用于已发布的初步视频评估
早期访问
可用性和控制仍在演进中
架构改变了摘要
不同模态共同描述同一个场景。
独立生成器将工作从一个模型传递给另一个模型。Flux 3 经过训练,使得外观、运动和声音在一个基础模型内部相互约束。实际目标不是增加更多开关——而是减少场景各部分之间的矛盾。
独立生成堆栈
- 静态画面确定外观
- 视频模型重建运动
- 音频在画面之后叠加
- 连续性在工具之间修复
Flux 3 世界摘要
- 参考引导共享场景
- 运动跟随物体和材质
- 声音属于可见事件
- 动作基于预测变化
统一的内容是什么
四种能力,一个创意方向。
Flux 3 不仅仅是一个图像升级。每种能力都为一个想象的世界贡献不同的约束。
图像合成与编辑
创建或修改静态图像,支持多种风格、宽高比和分辨率。Black Forest Labs 报告称,与早期 Flux 版本相比,复杂提示处理和多语言文本能力更强。
具有场景连续性的视频
从文本、起始帧、视觉参考、现有片段或定义的关键帧生成。该模型设计用于在运动中携带中心主体和场景逻辑。
原生同步音频
对话、环境音和音效可与视觉内容一起生成。这将声音与其引发的事件连接起来,而不是将音频视为独立的后期层。
动作与物理预测
同一骨干网络可通过专用系统(如 Flux-mimic)支持动作预测。对创作者而言,该研究解释了为什么强调接触、重量、原因和反应。
实用的提示词序列
分四步编写一个世界摘要。
不要将每个想法压缩成一堆形容词。先确定必须保持不变的内容,再指导随时间变化的内容。
- 01
锚定世界
定义主体、环境、时间、材质和视觉风格。明确应贯穿每个镜头或编辑的细节。
- 02
指导随时间的变化
按播放顺序描述动作。单独添加镜头移动,以避免主体运动和镜头运动混淆。
- 03
将声音与事件连接
指定对话、环境音以及仅重要的音效。将每个音效与可见原因关联,并说明音乐何时进入或减弱。
- 04
赋予参考明确职责
说明每张图像或片段是控制身份、风格、布局、运动还是连续性。移除重复相同指令且无新增信息的参考。
统一模型的应用场景
从画面和声音必须一致的地方开始。
当交付成果跨越多种模态时,Flux 3 最具特色。对于单个独立资产,专用工具可能仍然是更好的选择。
电影与广告预可视化
在投入拍摄、最终动画或完整后期制作前,共同探索场景的构图、运动、对话和氛围。
产品故事
将产品、材质语言和品牌调性从主视觉延伸到发布视频、演示和注重声音的社交概念中。
角色与世界开发
使用视觉参考测试重复角色、地点、镜头语言和多镜头序列,而无需从零重新描述世界。
交互与物理原型
草拟世界或物体对动作的反应方式。将其视为探索;生产控制和机器人仍然是独立的专业工作流程。
提示词结构
为每种模态分配明确职责。
此紧凑结构保持场景清晰易懂。仅使用交付所需的行。
一个陶瓷机器人在刚日出时在一个潮湿的温室内工作。
在每个镜头中保持相同的机器人、有缺口的釉面、植物布局和温暖的玻璃反射。
它旋紧一个铜阀,当蒸汽喷出时暂停,然后保护附近的幼苗。
从广角开始,滑向手部,然后在蒸汽散去时保持近距离侧面。
使用安静的伺服电机咔嗒声、窗外的鸟鸣以及与阀门同步的柔和的嘶嘶声。
在规划生产之前
宣布的能力并不等同于广泛可用性。
Flux 3 作为早期访问项目发布。在将其用于截止日期、预算或本地部署计划之前,请阅读当前产品控制信息。
发布是分阶段的
Flux 3 视频可通过早期访问获取。Black Forest Labs 表示图像访问、额外 API、私有权重和 Flux 3 Dev 将在后续阶段推出。
评估是初步的
已发布的比较是在开发过程中运行的,可能随模型和评估工具的改进而变化。将其视为早期信号,而非最终基准结论。
本地需求未知
计划推出开源权重多模态骨干,但最终模型大小、硬件要求、许可和实际消费者部署细节尚未确定。
初版仍需后期加工
原生音频和连续性可减少组装工作,但精确的时间、剪辑、安全审查、版权清理和最终母版制作仍是生产责任。
实用解答
常见问题
什么是 Flux 3?
Flux 3 是 Black Forest Labs 的多模态基础模型,联合训练图像、视频和音频,并在动作预测方面有相关工作。其设计目标是建模场景的外观、变化、声音和反应,而不是将每种模态视为独立任务。
我可以在此页面上使用 Flux 3 生成内容吗?
不能。这是一个独立的编辑指南,而非伪装的生成器。主要按钮将打开 Flux3.co,您可以在那里查看当前可用的体验平台、账户要求、控制和定价。
Flux 3 视频能生成什么?
官方资料显示支持文本到视频、图像到视频、参考引导视频、视频到视频、视频和音频延续、关键帧过渡、多语言对话和原生音频。具体控制取决于当前的早期访问界面。
Flux 3 视频最长时长?
Black Forest Labs 表示 Flux 3 可在单次生成中生成带原生音频的视频,最长 20 秒。其发布的初步评估使用了 10 秒、720p 的文本到视频片段。
Flux 3 是开源的吗?
Black Forest Labs 计划推出 Flux 3 Dev 作为开源权重的多模态骨干。但这并不自动意味着开源许可证,最终许可证、大小和硬件要求需在权重发布时确认。
Flux 3 图像现在可用吗?
截至撰写时,Black Forest Labs 表示 Flux 3 图像早期访问将在未来几周内开放。可用性可能快速变化,请查看链接的体验平台和官方公告以了解最新状态。
从世界摘要到首次生成
让画面、运动和声音保持在同一个对话中。
从一个聚焦的场景开始,赋予每个参考一个目的,当准备好探索当前 Flux 3 工作流程时,继续前往 Flux3.co。
尝试 Flux 3您将离开 Nanabanana 并打开 Flux3.co。