Generador de video con IA FLUX 3

El primer modelo de video de Black Forest Labs: clips de 20 segundos con audio sincronizado, hasta 10 fotogramas clave fijados y estilos que van desde acción real hasta stop-motion. Escribe un prompt abajo y pruébalo.

Modelo
Subir imagen
Haz clic o suelta aquí una imagen JPG, JPEG, PNG o WEBP de hasta 10 MB
Prompt
0/5000
Relaciones de aspecto de salida
Auto
Resolución
Auto
Duración(segundos)
Auto
Muestra de video
 

Desarrollador

Black Forest Labs

Tipo

Multimodal (video ahora, imagen pronto)

Audio

Nativo, sincronizado, misma contraseña

Duración

Hasta 20 s por pasada

Fotogramas clave

Hasta 10 fijados + primero/último

Abrir pesos

Desarrollo planificado, finales de 2026

Nivel aquí

Créditos de pago + modo borrador

Nuestro veredicto en una línea: la opción de storyboard. Cuando sabes exactamente qué fotogramas debe alcanzar la toma — o quieres un aspecto que no sea “video de IA cinematográfico” — empieza aquí.

FLUX 3 viene del laboratorio de Friburgo cuyos fundadores construyeron la arquitectura detrás de Stable Diffusion, y es su primer modelo que se mueve: una sola red entrenada conjuntamente con imágenes, video, audio y acción, lanzando video primero. Dos cosas lo distinguen en un mes saturado — puedes fijar hasta diez fotogramas exactos y dejar que el modelo anime entre ellos, y la salida no queda bloqueada al aspecto brillante de “cine de IA”. Crudo, nostálgico, hecho a mano, extraño: el rango es lo importante.

Opinión sincera

Dónde gana FLUX 3 — y dónde no

Primeras impresiones de nuestros renderizados de prueba más el material publicado por BFL — con sus propias salvedades transmitidas intactas. Lo revisaremos cuando lleguen cifras independientes.

Realmente fuerte

  • • Control de fotogramas clave.

    Fija hasta 10 fotogramas exactos más el primero y el último, y el modelo genera movimiento, cámara, diálogo y audio entre ellos. El storyboard como formato de entrada — nada más de lo que alojamos acepta tantos anclajes.

  • • Gama estética.

    Stop-motion, macro, time-lapse, video casero nostálgico, deliberadamente extraño — escapa del brillo cinematográfico uniforme al que recurre por defecto la mayoría de los modelos de video. Si la imagen de tu marca no es "tráiler de película", esto importa.

  • • Audio en la misma pasada.

    Hasta 20 segundos con una banda sonora sincronizada — diálogos incluidos — y una extensión consciente de la unión que mantiene el movimiento, la cámara y el audio a través del punto de unión cuando amplías un clip.

  • • Economía del modo borrador.

    Cada punto de conexión tiene una variante de borrador rápida para vistas previas económicas. Itera en el borrador, gasta créditos reales una sola vez en la versión final — el flujo de trabajo que predica todo este sitio, integrado en la familia de modelos.

Límites conocidos

  • • La parte de la imagen aún no está aquí.

    El nombre FLUX es famoso por las imágenes, pero la generación de imágenes de FLUX 3 todavía se está implementando. Si viniste aquí para crear imágenes, faltan semanas — consulta las FAQ antes de quemar créditos para descubrirlo.

  • • Los benchmarks son números de casa.

    El gráfico de lanzamiento fue etiquetado como una evaluación preliminar de un candidato temprano, y las tasas de victoria más llamativas se dieron contra modelos que no están marcando el ritmo actual. Las afirmaciones posteriores de BFL son más sólidas, pero siguen siendo internas.

  • • 20 segundos, no 30.

    Wan 3.0 y Seedance 2.5 llegan ambos a 30 en una sola pasada. FLUX 3 responde con una extensión que respeta la unión — pero si el encargo pide un único medio minuto ininterrumpido, no es la opción adecuada.

  • • Ponderaciones de desarrollo: planificadas, sin fecha.

    El lanzamiento con pesos abiertos está anunciado para más adelante en 2026, sin fecha ni términos de licencia. El historial de código abierto de BFL es realmente bueno, pero un plan sigue siendo un plan.

Recetas de prompts

Tres prompts que mostrar para qué sirve

Uno para el aspecto, uno para los fotogramas clave, uno para la costura. Copia, intercambia los corchetes, renderiza — primero en modo borrador.

Lo anticinematográfico — gama de estilos en exhibición

"Una escena de stop-motion hecha a mano: un [astronaut] de arcilla planta una diminuta bandera de papel en una luna de mesa de cocina hecha de harina. Huellas dactilares visibles en la arcilla, movimiento 12fps ligeramente entrecortado, suave luz de ventana, sonidos de pasos de fieltro y una línea de diálogo amortiguada con voz chillona."

Por qué funciona

Nombrar las imperfecciones — huellas dactilares, velocidad de fotogramas entrecortada — es lo que aleja a FLUX 3 del brillo predeterminado. La mayoría de los modelos se resisten a lo “hecho a mano”; este lo trata como un objetivo de estilo.

Bloqueo del storyboard — fotogramas clave como script

Subir: 4 fotogramas clave (producto en caja → sin caja → en mano → tarjeta con logo)

"Un unboxing de 20 segundos que muestra estos cuatro fotogramas en orden, con unos 5 segundos de separación. Sensación natural de cámara en mano, sonidos de papel rasgándose y cinta adhesiva, alegría discreta de una voz fuera de pantalla en el tercer fotograma."

Por qué funciona

Los fotogramas sostienen la composición, por lo que el prompt solo tiene que dirigir el timing, el movimiento y el sonido. Las indicaciones de espaciado ("aproximadamente con 5 segundos de separación") evitan que el modelo apresure los momentos clave. Este es el flujo de trabajo que los equipos que empiezan por el storyboard estaban esperando.

La extensión fluida

Empezar desde: un clip que ya generaste

"Extender 10 segundos: [dancer] completa el giro en el que termina el clip, la cámara sigue desplazándose hacia la izquierda a la misma velocidad, la música continúa sin tropiezos — sin corte, sin reinicio."

Por qué funciona

La extensión lee el movimiento y el audio de los fotogramas finales, por lo que la instrucción debe describir una continuación, no una escena nueva. "Completa el giro en el que termina el clip" le da el hilo físico del que tirar; indicar la velocidad de la cámara protege la deriva a través de la unión.

Cara a cara

FLUX 3 vs Veo vs Seedance 2.5

Tres modelos audio-native, tres filosofías de control. Los mismos prompts en los tres, evaluados según lo que lanzaríamos — provisionalmente para los dos más recientes. Compáralos tú mismo desde un único cuadro de prompt.

JobFLUX 3VeoSeedance 2.5
Fotograma clave / control estructural 10 fijados + primero/último Solo prompt Primer/último fotograma
Estilos no cinematográficos Lo mejor — del stop-motion a lo extraño Regular Bueno
Metraje realista Bueno (temprano) Mejor Bueno (temprano)
Longitud máx. del clip 20 s + extensión con detección de costuras 8 s 30 s nativo
Ritmo impulsado por audio desde una pista No No
Iteración económica Variantes de borrador integradas Sin nivel de borrador Borrador mediante elementos hermanos rápidos
Hoja de ruta de pesos abiertos Desarrollo planificado, sólido historial Ninguno Ninguno
Historial comprobado Semanas de edad Establecido Semanas
Historial de versiones

Del laboratorio de imágenes a lo multimodal

jul 2026 · Actualidad

FLUX 3

anunciado el 23 de julio: una arquitectura única para imagen, video, audio y acción. El video se lanzó primero (20 s, audio nativo, fotogramas clave); la generación de imágenes se implementará en las semanas siguientes; el lanzamiento Dev de pesos abiertos está previsto para más adelante este año. La versión en esta página.

Antes

FLUX.2 y la familia FLUX.1

la era de la imagen que dio renombre al nombre: FLUX.1 dev se convirtió en una de las versiones de difusión abiertas más descargadas y ajustadas en todo el mundo, la columna vertebral de innumerables flujos de trabajo de la comunidad.

Origen

Antes de FLUX

el equipo fundador creó la arquitectura de difusión latente detrás de Stable Diffusion. La credibilidad de código abierto que aporta esa historia es la razón por la que "FLUX 3 Dev" tiene más peso como promesa que la mayoría de los compromisos de pesos abiertos.

Preguntas frecuentes

FLUX 3 preguntas, respuestas directas

1. ¿Qué es FLUX 3?

El primer modelo fundacional multimodal de Black Forest Labs, anunciado el 23 de julio de 2026 — una arquitectura única entrenada conjuntamente con imágenes, vídeo, audio y predicción de acciones, del equipo de Friburgo cuyos fundadores construyeron la arquitectura detrás de Stable Diffusion. La parte con la que puedes generar hoy es vídeo: hasta 20 segundos con una banda sonora sincronizada en la misma pasada, a partir de texto, una imagen inicial, fotogramas clave fijados o un clip existente que quieras ampliar.

Otros modelos

¿No es la herramienta adecuada? Prueba sus vecinos

Veo

El realista. Cuando el clip debe pasar por metraje real, con audio.

Seedance 2.5

La toma larga. Tomas de 30 segundos montadas con tu banda sonora.

Wan 3.0

El lector de documentos. Presentaciones, PDF y hojas de cálculo entran, video sale.