Modelo de video e imagen con IA Flux 3

Modelo de video e imagen con IA Flux 3

Flux 3 es el modelo multimodal de Black Forest Labs para video, imágenes, audio nativo y predicción de acciones. Explora las funciones confirmadas de Flux 3 y sus planes de acceso anticipado.

  • Video nativo con audio sincronizado: Flux 3 puede generar videos variados con audio nativo en una sola pasada, con clips de hasta 20 segundos durante el acceso anticipado. Black Forest Labs destaca la sincronización de voz, efectos de sonido y eventos físicos, aunque las evaluaciones publicadas siguen siendo preliminares.
  • Entradas y referencias multimodales: Flux 3 admite texto a video, imagen a video, video a video y continuación de video con audio. Las imágenes pueden servir como fotogramas iniciales o referencias visuales, mientras que los clips de origen pueden llevar un personaje o elemento central a una escena nueva.
  • Fotogramas clave, secuencias largas y tipografía: Flux 3 incluye transiciones de fotograma clave a video, diálogos multilingües, tipografía animada, distintas relaciones de aspecto y encadenamiento autónomo de clips. Black Forest Labs afirma que las referencias visuales pueden ayudar a conservar los personajes entre varias tomas, aunque las pruebas independientes aún son limitadas.
  • Una sola base más allá del video: Flux 3 también apunta a la síntesis y edición de imágenes y a la predicción de acciones desde la misma base multimodal. El acceso anticipado a imágenes está previsto después de la vista previa de video, mientras que las acciones comienzan con socios seleccionados como mimic robotics.
  • Un modelo multimodal de pesos abiertos previsto: Flux 3 Dev está previsto como una base de pesos abiertos para video, audio, imágenes y predicción de acciones. Black Forest Labs todavía no ha publicado la fecha de lanzamiento, la licencia, el tamaño del modelo, los requisitos de hardware, los precios de la API ni las métricas finales de producción.
  • Define la escena y las referencias: Empieza por el sujeto, el entorno, la acción, el movimiento de cámara, la duración, la relación de aspecto, el diálogo y el sonido. Cuando el acceso a Flux 3 admita referencias, añade una imagen inicial, un fotograma clave o un clip de origen e indica qué detalles deben mantenerse coherentes.
Modelo multimodal de Black Forest Labs

Modelo de video e imagen con IA Flux 3

Flux 3 es el modelo multimodal de Black Forest Labs para video, imágenes, audio nativo y predicción de acciones. Explora las funciones confirmadas de Flux 3 y sus planes de acceso anticipado.

Explorar video con IA

Muestra oficial de vídeo de Flux 3

Descubre cuatro muestras de lanzamiento publicadas por Black Forest Labs el 23 de julio de 2026. Estos clips oficiales de Flux 3 muestran clima costero, una carrera en primera persona, una secuencia de baile entre espejos y una cálida animación de plastilina.

Dinámica oceánica de Flux 3

Muestra oficial de Flux 3 con olas de tormenta, espuma y aves marinas en una escena costera.

Movimiento en primera persona con Flux 3

Muestra oficial de Flux 3 que sigue una motocicleta por un circuito mojado, con cámara rápida, asfalto húmedo y barreras junto a la pista.

Espejos, agua y baile

Muestra oficial de Flux 3 con un baile de salón entre arquitectura de espejos, agua, velas y reflejos superpuestos.

Animación de personajes estilizada con Flux 3

Muestra oficial de Flux 3 con animación de plastilina cálida, materiales táctiles y movimiento físico centrado en el personaje.

Qué hace diferente a Flux 3

01 / Video • Audio

Video nativo con audio sincronizado

Flux 3 puede generar videos variados con audio nativo en una sola pasada, con clips de hasta 20 segundos durante el acceso anticipado. Black Forest Labs destaca la sincronización de voz, efectos de sonido y eventos físicos, aunque las evaluaciones publicadas siguen siendo preliminares.

02 / Texto • Imagen • Video

Entradas y referencias multimodales

Flux 3 admite texto a video, imagen a video, video a video y continuación de video con audio. Las imágenes pueden servir como fotogramas iniciales o referencias visuales, mientras que los clips de origen pueden llevar un personaje o elemento central a una escena nueva.

03 / Control • Continuidad

Fotogramas clave, secuencias largas y tipografía

Flux 3 incluye transiciones de fotograma clave a video, diálogos multilingües, tipografía animada, distintas relaciones de aspecto y encadenamiento autónomo de clips. Black Forest Labs afirma que las referencias visuales pueden ayudar a conservar los personajes entre varias tomas, aunque las pruebas independientes aún son limitadas.

04 / Imagen • Acción

Una sola base más allá del video

Flux 3 también apunta a la síntesis y edición de imágenes y a la predicción de acciones desde la misma base multimodal. El acceso anticipado a imágenes está previsto después de la vista previa de video, mientras que las acciones comienzan con socios seleccionados como mimic robotics.

05 / Dev • Pesos abiertos

Un modelo multimodal de pesos abiertos previsto

Flux 3 Dev está previsto como una base de pesos abiertos para video, audio, imágenes y predicción de acciones. Black Forest Labs todavía no ha publicado la fecha de lanzamiento, la licencia, el tamaño del modelo, los requisitos de hardware, los precios de la API ni las métricas finales de producción.

Cómo encaja Flux 3 en un flujo de producción de vídeo

Este flujo se basa en las funciones anunciadas por Black Forest Labs y está destinado a usuarios aprobados para el acceso anticipado. Las funciones, interfaces y condiciones de uso pueden cambiar antes de la disponibilidad general.

Define la escena y las referencias

Empieza por el sujeto, el entorno, la acción, el movimiento de cámara, la duración, la relación de aspecto, el diálogo y el sonido. Cuando el acceso a Flux 3 admita referencias, añade una imagen inicial, un fotograma clave o un clip de origen e indica qué detalles deben mantenerse coherentes.

Genera y evalúa el plano principal

Usa Flux 3 para crear el plano principal y revisa después la anatomía, la persistencia de objetos, la sincronización labial, los tiempos de audio, el movimiento físico, la tipografía y la continuidad de cámara. Cambia una sola variable cada vez en lugar de reescribir todo el prompt tras cada vista previa.

Amplía, encadena y finaliza

Black Forest Labs afirma que las referencias visuales y los fotogramas clave pueden ayudar a encadenar clips en secuencias más largas de varias tomas. El uso en producción y la publicación están sujetos a las condiciones y permisos de acceso aplicables a Flux 3.

Preguntas frecuentes sobre Flux 3

Explora el video con IA mientras se despliega Flux 3

Explorar video con IA