🔥LIMITED OFFER
01:58:23
GET 50% OFF
Un modelo · cuatro señales

Flux 3 unifica imagen, vídeo, audio y acción en un único modelo de mundo.

Flux 3 es el modelo fundacional multimodal de Black Forest Labs para predicción de imagen, vídeo, audio nativo y acción. Crea aquí un resumen de escena coherente y continúa en Flux3.co para explorar el flujo de trabajo disponible.

Entorno externo · Abre Flux3.co

Resumen multimodal de escena
00:00 — 00:12
Prompt

Un robot de cerámica repara un invernadero al amanecer. Mantén los reflejos cálidos del vidrio y el mismo personaje en todos los planos. La cámara se desliza desde una vista general hasta sus manos. Añade suaves sonidos de servo, pájaros fuera y una línea hablada.

Imagen

personaje · material · luz

Vídeo

movimiento · cámara · continuidad

Audio

diálogo · ambiente · efectos

Acción

contacto · causa · respuesta

Una representación visual de un resumen de escena de Flux 3 — no un generador en vivo.

4 señales

imagen, vídeo, audio y acción

Hasta 20 s

vídeo con audio nativo en una generación

720p

usado en la evaluación preliminar publicada

Acceso anticipado

la disponibilidad y los controles aún están evolucionando

La arquitectura cambia el resumen

Cada modalidad aporta información sobre la misma escena.

Los generadores separados transfieren el trabajo de un modelo a otro. Flux 3 se entrena para que la apariencia, el movimiento y el sonido se restrinjan mutuamente dentro de un único modelo fundacional. El objetivo práctico no es más interruptores, sino menos contradicciones entre las partes de una escena.

Pila de generación separada

  • Un Still establece la apariencia
  • Un modelo de vídeo reconstruye el movimiento
  • El audio se añade después de la imagen
  • La continuidad se repara entre herramientas

Resumen de mundo de Flux 3

  • Las referencias guían una misma escena compartida
  • El movimiento sigue a los objetos y materiales
  • El sonido pertenece a los eventos visibles
  • La acción se fundamenta en el cambio previsto

Qué se está unificando

Cuatro capacidades, una dirección creativa.

Flux 3 es más amplio que una actualización de imagen. Cada capacidad aporta una restricción diferente al mismo mundo imaginado.

01

Síntesis y edición de imágenes

Crea o modifica imágenes fijas en varios estilos, relaciones de aspecto y resoluciones. Black Forest Labs reporta un manejo más sólido de prompts complejos y texto multilingüe que en generaciones anteriores de Flux.

02

Vídeo con continuidad de escena

Genera a partir de texto, un fotograma inicial, referencias visuales, un clip existente o fotogramas clave definidos. El modelo está diseñado para mantener sujetos centrales y lógica de escena a través del movimiento.

03

Audio nativo sincronizado

El diálogo, el ambiente y los efectos de sonido pueden producirse junto con lo visual. Esto conecta un sonido con el evento que lo causa, en lugar de tratar el audio como una capa final independiente.

04

Predicción de acciones y física

El mismo backbone puede soportar la predicción de acciones a través de sistemas especializados como Flux-mimic. Para los creadores, esa investigación explica el énfasis en contacto, peso, causa y respuesta.

Una secuencia práctica de prompts

Escribe un resumen de mundo en cuatro pasos.

No comprimas cada idea en una nube de adjetivos. Establece lo que debe permanecer fijo, luego dirige lo que cambia con el tiempo.

  1. 01

    Ancla el mundo

    Define el sujeto, el entorno, la hora del día, los materiales y el estilo visual. Nombra los detalles que deben sobrevivir a cada plano o edición.

  2. 02

    Dirige el cambio en el tiempo

    Describe la acción en orden de reproducción. Añade el movimiento de cámara por separado para no confundir el movimiento del sujeto con el de la cámara.

  3. 03

    Conecta el sonido a los eventos

    Especifica diálogo, ambiente y solo los efectos importantes. Asocia cada efecto a una causa visible e indica cuándo la música debe entrar o retroceder.

  4. 04

    Usa referencias con un propósito

    Explica si cada imagen o clip controla identidad, estilo, diseño, movimiento o continuidad. Elimina referencias que repiten la misma instrucción sin añadir información.

Donde importa el modelo unificado

Empieza donde la imagen y el sonido deben coincidir.

Flux 3 es más distintivo cuando un entregable cruza modalidades. Una herramienta dedicada puede seguir siendo la mejor opción para un activo aislado.

Previsualización de cine y campañas

Explora la composición, el movimiento, el diálogo y la atmósfera de una escena juntos antes de comprometerte con un rodaje, una animación final o una postproducción completa.

Historias de producto

Lleva un producto, su lenguaje de materiales y el ambiente de marca desde un still principal hasta clips de lanzamiento, demostraciones y conceptos sociales conscientes del sonido.

Desarrollo de personajes y mundos

Usa referencias visuales para probar personajes recurrentes, localizaciones, lenguaje de cámara y secuencias de múltiples planos sin tener que describir el mundo desde cero.

Prototipado interactivo y físico

Boceta cómo un mundo u objeto podría responder a una acción. Trátalo como exploración; el control de producción y la robótica siguen siendo flujos de trabajo separados y especializados.

Anatomía del prompt

Dale a cada modalidad un trabajo claro.

Esta estructura compacta mantiene la escena legible. Usa solo las líneas que tu entregable necesite.

world-brief.txtAnatomía del prompt
01Mundo

Un robot de cerámica repara dentro de un invernadero húmedo justo después del amanecer.

02Continuidad

Mantén el mismo robot, el esmalte astillado, la disposición de plantas y los reflejos cálidos del vidrio en todos los planos.

03Movimiento

Aprieta una válvula de cobre, se detiene cuando sale vapor, luego protege una plántula cercana.

04Cámara

Empieza con un plano general, deslízate hacia las manos, luego mantén un perfil cercano cuando el vapor se despeje.

05Sonido

Usa clics de servo silenciosos, pájaros al otro lado del vidrio y un suave silbido sincronizado con la válvula.

Cuando el resultado se desvíe, refuerza una regla de continuidad antes de añadir más palabras de estilo.

Antes de planificar producción

Capacidad anunciada no es lo mismo que disponibilidad general.

Flux 3 se lanzó como programa de acceso anticipado. Lee los controles de producto actuales antes de construir un plazo, presupuesto o plan de implementación local en torno a él.

El despliegue es por fases

Flux 3 Vídeo está disponible en acceso anticipado. Black Forest Labs dice que el acceso a imagen, APIs adicionales, pesos privados y Flux 3 Dev llegarán en fases separadas.

Las evaluaciones son preliminares

Las comparaciones publicadas se realizaron durante el desarrollo y pueden cambiar a medida que el modelo y el entorno de evaluación mejoren. Trátalas como señales tempranas, no como conclusiones de benchmark permanentes.

Los requisitos locales son desconocidos

Se planea un backbone multimodal de pesos abiertos, pero el tamaño final del modelo, los requisitos de hardware, la licencia y los detalles de implementación práctica para consumidores aún no están establecidos.

Un primer corte aún necesita acabado

El audio nativo y la continuidad pueden reducir el trabajo de ensamblaje, pero el tiempo exacto, las ediciones, la revisión de seguridad, la autorización de derechos y la masterización final siguen siendo responsabilidad de producción.

Respuestas prácticas

Preguntas frecuentes

¿Qué es Flux 3?

Flux 3 es el modelo fundacional multimodal de Black Forest Labs entrenado conjuntamente en imágenes, vídeo y audio, con trabajo relacionado en predicción de acciones. Está diseñado para modelar cómo se ve, cambia, suena y responde una escena, en lugar de tratar cada modalidad como una tarea aislada.

¿Puedo generar con Flux 3 en esta página?

No. Esta es una guía editorial independiente, no un generador disfrazado. Los botones principales abren Flux3.co, donde puedes revisar el playground disponible actualmente, los requisitos de cuenta, los controles y los precios.

¿Qué puede generar Flux 3 Vídeo?

Los materiales oficiales describen texto a vídeo, imagen a vídeo, vídeo guiado por referencias, vídeo a vídeo, continuación de vídeo y audio, transiciones de fotogramas clave, diálogo multilingüe y audio nativo. Los controles individuales dependen de la superficie de acceso anticipado actual.

¿Qué duración pueden tener los vídeos de Flux 3?

Black Forest Labs dice que Flux 3 puede generar vídeo con audio nativo de hasta 20 segundos en una sola generación. Su evaluación preliminar publicada utilizó clips de texto a vídeo de 10 segundos a 720p.

¿Es Flux 3 de código abierto?

Black Forest Labs planea Flux 3 Dev como un backbone multimodal de pesos abiertos. Eso no significa automáticamente una licencia de código abierto, y la licencia final, el tamaño y los requisitos de hardware deben consultarse cuando se publiquen los pesos.

¿Está disponible Flux 3 Imagen ahora?

En el momento de escribir esto, Black Forest Labs dice que el acceso anticipado a Flux 3 Imagen se abrirá en las próximas semanas. La disponibilidad puede cambiar rápidamente, así que consulta el playground vinculado y el anuncio oficial para conocer el estado actual.

Del resumen de mundo a la primera generación

Mantén la imagen, el movimiento y el sonido en la misma conversación.

Empieza con una escena enfocada, da a cada referencia un propósito, y continúa en Flux3.co cuando estés listo para explorar el flujo de trabajo actual de Flux 3.

Probar Flux 3

Saldrás de Nanabanana y abrirás Flux3.co.

Base de investigación: Las capacidades y notas de despliegue se revisaron contrastando con el anuncio de Flux 3 de Black Forest Labs, la publicación de investigación de Flux 3 x mimic, el informe de colaboración de mimic robotics, Flux3.co y discusiones recientes de creadores. Los detalles de acceso anticipado pueden cambiar.

Base de investigación