🔥LIMITED OFFER
01:58:23
GET 50% OFF
一个模型 · 四种信号

Flux 3 统一图像、视频、音频和动作,成为一个世界模型。

Flux 3 是 Black Forest Labs 的多模态基础模型,用于图像、视频、原生音频和动作预测。在此构建一个连贯的场景摘要,然后继续前往 Flux3.co 探索可用工作流程。

外部体验 · 打开 Flux3.co

多模态场景摘要
00:00 — 00:12
提示词

一个陶瓷机器人在黎明时分修理温室。保持温暖的玻璃反射和同一角色在多个镜头中。镜头从广角滑到其手部。添加柔和的伺服电机声、窗外鸟鸣和一句台词。

图像

角色 · 材质 · 光照

视频

运动 · 镜头 · 连续性

音频

对话 · 环境音 · 效果

动作

接触 · 原因 · 反应

Flux 3 场景摘要的可视化模型——并非实时生成器。

4种信号

图像、视频、音频和动作

最长20秒

视频与原生音频一次生成

720p

用于已发布的初步视频评估

早期访问

可用性和控制仍在演进中

架构改变了摘要

不同模态共同描述同一个场景。

独立生成器将工作从一个模型传递给另一个模型。Flux 3 经过训练,使得外观、运动和声音在一个基础模型内部相互约束。实际目标不是增加更多开关——而是减少场景各部分之间的矛盾。

独立生成堆栈

  • 静态画面确定外观
  • 视频模型重建运动
  • 音频在画面之后叠加
  • 连续性在工具之间修复

Flux 3 世界摘要

  • 参考引导共享场景
  • 运动跟随物体和材质
  • 声音属于可见事件
  • 动作基于预测变化

统一的内容是什么

四种能力,一个创意方向。

Flux 3 不仅仅是一个图像升级。每种能力都为一个想象的世界贡献不同的约束。

01

图像合成与编辑

创建或修改静态图像,支持多种风格、宽高比和分辨率。Black Forest Labs 报告称,与早期 Flux 版本相比,复杂提示处理和多语言文本能力更强。

02

具有场景连续性的视频

从文本、起始帧、视觉参考、现有片段或定义的关键帧生成。该模型设计用于在运动中携带中心主体和场景逻辑。

03

原生同步音频

对话、环境音和音效可与视觉内容一起生成。这将声音与其引发的事件连接起来,而不是将音频视为独立的后期层。

04

动作与物理预测

同一骨干网络可通过专用系统(如 Flux-mimic)支持动作预测。对创作者而言,该研究解释了为什么强调接触、重量、原因和反应。

实用的提示词序列

分四步编写一个世界摘要。

不要将每个想法压缩成一堆形容词。先确定必须保持不变的内容,再指导随时间变化的内容。

  1. 01

    锚定世界

    定义主体、环境、时间、材质和视觉风格。明确应贯穿每个镜头或编辑的细节。

  2. 02

    指导随时间的变化

    按播放顺序描述动作。单独添加镜头移动,以避免主体运动和镜头运动混淆。

  3. 03

    将声音与事件连接

    指定对话、环境音以及仅重要的音效。将每个音效与可见原因关联,并说明音乐何时进入或减弱。

  4. 04

    赋予参考明确职责

    说明每张图像或片段是控制身份、风格、布局、运动还是连续性。移除重复相同指令且无新增信息的参考。

统一模型的应用场景

从画面和声音必须一致的地方开始。

当交付成果跨越多种模态时,Flux 3 最具特色。对于单个独立资产,专用工具可能仍然是更好的选择。

电影与广告预可视化

在投入拍摄、最终动画或完整后期制作前,共同探索场景的构图、运动、对话和氛围。

产品故事

将产品、材质语言和品牌调性从主视觉延伸到发布视频、演示和注重声音的社交概念中。

角色与世界开发

使用视觉参考测试重复角色、地点、镜头语言和多镜头序列,而无需从零重新描述世界。

交互与物理原型

草拟世界或物体对动作的反应方式。将其视为探索;生产控制和机器人仍然是独立的专业工作流程。

提示词结构

为每种模态分配明确职责。

此紧凑结构保持场景清晰易懂。仅使用交付所需的行。

world-brief.txt提示词结构
01世界

一个陶瓷机器人在刚日出时在一个潮湿的温室内工作。

02连续性

在每个镜头中保持相同的机器人、有缺口的釉面、植物布局和温暖的玻璃反射。

03运动

它旋紧一个铜阀,当蒸汽喷出时暂停,然后保护附近的幼苗。

04镜头

从广角开始,滑向手部,然后在蒸汽散去时保持近距离侧面。

05声音

使用安静的伺服电机咔嗒声、窗外的鸟鸣以及与阀门同步的柔和的嘶嘶声。

当结果偏离时,先强化一条连续性规则,再添加更多风格词汇。

在规划生产之前

宣布的能力并不等同于广泛可用性。

Flux 3 作为早期访问项目发布。在将其用于截止日期、预算或本地部署计划之前,请阅读当前产品控制信息。

发布是分阶段的

Flux 3 视频可通过早期访问获取。Black Forest Labs 表示图像访问、额外 API、私有权重和 Flux 3 Dev 将在后续阶段推出。

评估是初步的

已发布的比较是在开发过程中运行的,可能随模型和评估工具的改进而变化。将其视为早期信号,而非最终基准结论。

本地需求未知

计划推出开源权重多模态骨干,但最终模型大小、硬件要求、许可和实际消费者部署细节尚未确定。

初版仍需后期加工

原生音频和连续性可减少组装工作,但精确的时间、剪辑、安全审查、版权清理和最终母版制作仍是生产责任。

实用解答

常见问题

什么是 Flux 3?

Flux 3 是 Black Forest Labs 的多模态基础模型,联合训练图像、视频和音频,并在动作预测方面有相关工作。其设计目标是建模场景的外观、变化、声音和反应,而不是将每种模态视为独立任务。

我可以在此页面上使用 Flux 3 生成内容吗?

不能。这是一个独立的编辑指南,而非伪装的生成器。主要按钮将打开 Flux3.co,您可以在那里查看当前可用的体验平台、账户要求、控制和定价。

Flux 3 视频能生成什么?

官方资料显示支持文本到视频、图像到视频、参考引导视频、视频到视频、视频和音频延续、关键帧过渡、多语言对话和原生音频。具体控制取决于当前的早期访问界面。

Flux 3 视频最长时长?

Black Forest Labs 表示 Flux 3 可在单次生成中生成带原生音频的视频,最长 20 秒。其发布的初步评估使用了 10 秒、720p 的文本到视频片段。

Flux 3 是开源的吗?

Black Forest Labs 计划推出 Flux 3 Dev 作为开源权重的多模态骨干。但这并不自动意味着开源许可证,最终许可证、大小和硬件要求需在权重发布时确认。

Flux 3 图像现在可用吗?

截至撰写时,Black Forest Labs 表示 Flux 3 图像早期访问将在未来几周内开放。可用性可能快速变化,请查看链接的体验平台和官方公告以了解最新状态。

从世界摘要到首次生成

让画面、运动和声音保持在同一个对话中。

从一个聚焦的场景开始,赋予每个参考一个目的,当准备好探索当前 Flux 3 工作流程时,继续前往 Flux3.co。

尝试 Flux 3

您将离开 Nanabanana 并打开 Flux3.co。

研究依据: 能力和发布说明已对照 Black Forest Labs 的 Flux 3 公告、Flux 3 x mimic 研究文章、mimic 机器人合作报告、Flux3.co 以及最近的创作者讨论进行了审查。早期访问详情可能发生变化。

研究依据