Generador de videos con IA Grok Imagine 1.5

El especialista de xAI en imagen a video: tu imagen estática se convierte en el primer fotograma — composición, luz e identidad preservadas — con música, efectos y diálogo sincronizado con los labios generados en la misma pasada. Escribe un prompt abajo y pruébalo.

Modelo
Imagen: 0/1
Subir imagen del fotograma inicial
(JPG, JPEG, PNG, WEBP, máx. 30 MB)
Prompt
0/5000
Muestra de video
 

Desarrollador

xAI

Tipo

Primero la imagen · también T2V

Duración

Hasta 15 s

Salida máx.

720p (oficial)

Audio

Música · SFX · sincronización labial, en una sola pasada

Velocidad

Renderiza en segundos

Arena

#1 i2v en el lanzamiento (Elo 1473)

Nuestro veredicto en una línea: la opción para convertir imagen a video. Cuando la toma empieza con una imagen fija que ya tienes — una foto de producto, un retrato, un fotograma — nada aquí la anima más rápido ni con mayor fidelidad.

Grok Imagine Video 1.5 es el modelo que se llevó la corona de imagen a video en junio: lanzado a finales de mayo, debutó como #1 en la arena i2v colaborativa con 1473 Elo — un salto de 52 puntos sobre su predecesor, por delante de Seedance 2.0 y Veo. Su arquitectura explica su especialidad: Aurora genera fotogramas de forma secuencial, cada uno condicionado por todo lo anterior, de modo que la imagen fija que subes — tratada como el primer fotograma literal — mantiene su composición, iluminación e identidad del sujeto en lugar de desviarse. La música, los efectos de sonido y el diálogo sincronizado con los labios se renderizan en la misma pasada, y los clips llegan en segundos en lugar de minutos. Una aclaración antes de gastar: este es el modelo de video de xAI, no el chatbot Grok — misma marca, producto diferente.

Opinión honesta

Dónde gana Grok Imagine 1.5 — y dónde no

Evaluado a partir de nuestros propios renders y del registro publicado, revisado a medida que cambian los hechos — esa es una característica de esta página, no un descargo de responsabilidad.

Realmente fuerte

  • • Fidelidad de imagen por arquitectura.

    La fuente sigue siendo el primer fotograma, no una referencia suelta — el condicionamiento secuencial de Aurora mantiene la composición, la luz y la identidad durante todo el clip. La corona de la arena i2v se ganó exactamente por esto.

  • • Audio en una sola pasada, diálogos incluidos.

    La música de fondo, los efectos de sonido y el habla sincronizada con los labios se generan junto con la imagen. La sincronización labial es la mejora más destacada respecto a la versión 1.0 — un clip de persona hablando no necesita una segunda pasada.

  • • Control de toma con marca de tiempo.

    Escribe el prompt como una línea de tiempo — '(0-5s) plano medio... (5-10s) acercamiento de cámara...' — y los momentos clave caen donde los pongas. Prompting con lista de planos, nativo.

  • • La velocidad como función del flujo de trabajo.

    Los renderizados suelen terminar en segundos. Los ciclos de iteración que en otros lugares requieren minutos aquí avanzan al ritmo de una conversación — el multiplicador de calidad más económico que existe.

Límites conocidos

  • • 720p es el límite oficial.

    La propia línea de xAI es de 720p (algunas pasarelas exponen una resolución superior). En un campo en el que los rivales ofrecen de 1080p a 4K, esta es la especificación que pone fin a algunos briefs antes de tiempo.

  • • Text-to-video es la mitad más débil.

    La propia orientación de xAI: t2v es 'más generativo y menos controlado' que la ruta de imagen. Si no tienes una imagen fija inicial, los modelos insignia prompt-first encajan mejor.

  • • El impuesto a la confusión de marca.

    Comparte nombre con el chatbot Grok, pero es un producto independiente — el razonamiento del chatbot no te dice nada sobre este modelo, ni en un sentido ni en el otro. Júzgalo por sus renders.

  • • Rango de arena ≠ registro de producción.

    El Elo mide la preferencia del público en pares i2v, y el modelo tiene varias semanas. Trata la corona como una señal fuerte, no como un veredicto definitivo.

Recetas de prompts

Tres prompts que mostrar para qué sirve

Copia en el generador de arriba, cambia los corchetes, renderiza.

La imagen fija del producto, cobrada vida

Subir: la foto de tu producto

"(0-4s) la [botella] permanece en una suave luz del amanecer mientras motas de polvo flotan. (4-9s) lento acercamiento mientras una cálida luz principal aumenta gradualmente desde la izquierda. (9-12s) detenerse en un primer plano mientras la etiqueta atrapa la luz. Banda sonora ambiental tranquila, un suave repique al final."

Por qué funciona

Las marcas de tiempo convierten el prompt en una lista de tomas, y la arquitectura de imagen fija como primer fotograma mantiene el producto exactamente como fue fotografiado. La demo junto al generador es este prompt.

El retrato parlante

Subir: una foto de retrato

"Ella levanta la vista del cuaderno y dice, con calidez: 'Me llevó años aprender esto.' Luego una pequeña sonrisa, vuelve a escribir. Ambiente de la habitación, rasguño del lápiz, sin música."

Por qué funciona

El diálogo entre comillas activa la sincronización labial — la corrección más orgullosa de la generación 1.5. Mantén las líneas cortas y deja que el prompt nombre la acción de antes y después, para que la interpretación tenga un punto de llegada.

La secuencia encadenada

Genera un primer clip → Extiende desde su fotograma final → "Continuar: la cámara sigue desplazándose suavemente hacia la derecha más allá de la ventana; afuera, ha empezado la lluvia. La música continúa sin cortes."

Por qué funciona

La extensión se basa en el último fotograma exacto, por lo que el movimiento, la luz y el audio continúan en lugar de reiniciarse. Encadena dos o tres extensiones y un límite de 15 segundos se convierte discretamente en una secuencia de 40 segundos.

Cara a cara

Grok Imagine 1.5 vs. Seedance 2.0 vs. Veo

El podio de image-to-video según la clasificación de la arena de junio — el nuevo líder frente a los dos que superó. Las mismas imágenes fijas y prompts en los tres, evaluados según lo que lanzaríamos. Los tres se pueden seleccionar en el generador de arriba.

JobGrok Imagine 1.5Seedance 2.0Veo
clasificación de la arena i2v en su lanzamiento #1 (Elo 1473) Aprobado Aprobado
Fidelidad a la imagen de origen Mejor — la imagen fija es el primer fotograma Bueno Bueno
Velocidad de renderizado Segundos Minutos 1–3 minutos
Audio de una sola pasada Música + SFX + sincronización labial Audio nativo Ambiente + diálogo
Control de tomas con marca de tiempo Sintaxis nativa No No
Resolución máx. 720p oficial 1080p + canalización de alta resolución 1080p
Realismo bajo escrutinio Bueno Bueno Mejor
Historial comprobado Semanas Era de la arena, meses Establecido
Historial de versiones

Cómo llegó aquí

jun 2026 · Actual

Grok Imagine Vídeo 1.5

vista previa 30–31 de mayo, debut #1 en i2v arena, GA en la xAI API para mediados de junio como grok-imagine-video-1.5. Clips de 15 segundos, audio de una sola pasada con sincronización labial mejorada, extensión y guía de referencia. La versión en el generador de arriba.

Antes en 2026

Grok Imagine Video 1.0

el primer lanzamiento de 10 segundos que puso a xAI en el mapa del video; el salto de 1.5 en la arena se midió frente a él.

Origen

Aurora

La arquitectura troncal de imagen autorregresiva de xAI, cuya fortaleza en la coherencia de personajes es la razón arquitectónica por la que la línea de video trata tu imagen fija como verdad de referencia.

Preguntas frecuentes

Preguntas sobre Grok Imagine 1.5, respondidas directamente

1. ¿Qué es Grok Imagine 1.5?

El modelo de generación de vídeo de xAI — formalmente Grok Imagine Video 1.5, lanzado a finales de mayo de 2026 y disponible de forma general en la API de xAI a mediados de junio. Prioriza la imagen: sube una imagen fija, describe el movimiento y anima la escena usando la fuente como el primer fotograma literal, generando música, efectos de sonido y diálogo sincronizado con los labios en la misma pasada. Los clips duran hasta 15 segundos y se renderizan en segundos.