Gerador de vídeos com IA Grok Imagine 1.5

O especialista da xAI em imagem para vídeo: sua imagem estática se torna o primeiro quadro — composição, luz e identidade preservadas — com música, efeitos e diálogo sincronizado labialmente gerados na mesma etapa. Digite um prompt abaixo e experimente.

Modelo
Imagem: 0/1
Carregar imagem do quadro inicial
(JPG, JPEG, PNG, WEBP, máx. 30 MB)
Prompt
0/5000
Amostra de vídeo
 

Desenvolvedor

xAI

Tipo

Imagem primeiro · também T2V

Duração

Até 15 s

Saída máx.

720p (oficial)

Áudio

Música · SFX · sincronização labial, em uma só passagem

Velocidade

Renderiza em segundos

Arena

#1 i2v no lançamento (Elo 1473)

Nosso veredito em uma linha: a escolha para transformar imagem em vídeo. Quando a tomada começa a partir de uma imagem estática que você já tem — uma foto de produto, um retrato, um quadro — nada aqui a anima mais rápido ou com mais fidelidade.

Grok Imagine Video 1.5 é o modelo que conquistou a coroa de imagem-para-vídeo em junho: lançado no fim de maio, estreou em 1º lugar na arena i2v colaborativa com 1473 Elo — um salto de 52 pontos em relação ao seu antecessor, ultrapassando Seedance 2.0 e Veo. Sua arquitetura explica a especialidade: Aurora gera quadros sequencialmente, cada um condicionado por tudo o que veio antes, de modo que a imagem estática enviada por você — tratada como o primeiro quadro literal — mantém sua composição, iluminação e identidade do sujeito, em vez de se desviar. Música, efeitos sonoros e diálogos sincronizados com os lábios são renderizados na mesma passagem, e os clipes ficam prontos em segundos, não em minutos. Uma distinção antes de você gastar: este é o modelo de vídeo da xAI, não o chatbot Grok — mesma marca, produto diferente.

Leitura honesta

Onde o Grok Imagine 1.5 se destaca — e onde não

Avaliado com base nas nossas próprias renderizações e no registro publicado, revisado à medida que os fatos mudam — isso é um recurso desta página, não uma isenção de responsabilidade.

Realmente forte

  • • Fidelidade da imagem por arquitetura.

    A fonte ainda é o primeiro quadro, não uma referência solta — o condicionamento sequencial da Aurora mantém a composição, a luz e a identidade durante todo o clipe. A coroa da arena i2v foi conquistada exatamente com isso.

  • • Áudio em uma única passagem, diálogos incluídos.

    A música de fundo, os efeitos sonoros e a fala sincronizada com os lábios são gerados junto com a imagem. A sincronização labial é a principal melhoria em relação à versão 1.0 — um clipe de cabeça falante não precisa de uma segunda etapa.

  • • Controle de captura com carimbo de data/hora.

    Escreva o prompt como uma linha do tempo — '(0-5s) plano médio... (5-10s) aproximação de câmera...' — e os pontos-chave acontecem onde você os coloca. Prompting por lista de planos, nativo.

  • • Velocidade como recurso de fluxo de trabalho.

    As renderizações normalmente terminam em segundos. Os ciclos de iteração que levam minutos em outros lugares aqui rodam no ritmo de uma conversa — o multiplicador de qualidade mais barato que existe.

Limites conhecidos

  • • 720p é o limite oficial.

    A própria linha da xAI é 720p (alguns gateways expõem valores mais altos). Em um campo em que os rivais oferecem de 1080p a 4K, esta é a especificação que encerra alguns briefs mais cedo.

  • • Text-to-video é a metade mais fraca.

    A própria orientação da xAI: t2v é 'mais generativo e menos controlado' do que o caminho de imagem. Se você não tiver uma imagem estática inicial, os modelos carro-chefe prompt-first se encaixam melhor.

  • • O imposto sobre a confusão de marca.

    Ele compartilha o nome com o chatbot Grok, mas é um produto separado — o raciocínio do chatbot não diz nada sobre este modelo, nem num sentido nem no outro. Julgue-o pelos renders.

  • • Classificação da arena ≠ registro de produção.

    O Elo mede a preferência do público em pares i2v, e o modelo tem algumas semanas. Trate a coroa como um sinal forte, não como um veredito definitivo.

Receitas de prompts

Três prompts que mostrar para que serve

Copie para o gerador acima, troque os colchetes, renderize.

A imagem estática do produto, trazida à vida

Carregar: a foto do seu produto

"(0-4s) a [garrafa] permanece sob a suave luz do amanhecer enquanto partículas de poeira flutuam. (4-9s) aproximação lenta enquanto uma luz principal quente aumenta gradualmente a partir da esquerda. (9-12s) estabilizar em um close-up enquanto o rótulo capta a luz. Trilha ambiente tranquila, um toque suave de sino no final."

Por que funciona

Os timestamps transformam o prompt em uma lista de tomadas, e a arquitetura de imagem estática como primeiro quadro mantém o produto exatamente como foi fotografado. A demonstração ao lado do gerador é este prompt.

O retrato falante

Carregar: uma foto de retrato

"Ela levanta os olhos do caderno e diz, calorosamente: 'Levei anos para aprender isto.' Depois um pequeno sorriso, volta a escrever. Som ambiente do cômodo, arranhar do lápis, sem música."

Por que funciona

O diálogo entre aspas ativa a sincronização labial — a correção de que a geração 1.5 mais se orgulha. Mantenha as falas curtas e deixe o prompt nomear a ação antes e depois, para que a entrega tenha um ponto de chegada.

A sequência encadeada

Gere um primeiro clipe → Estenda a partir do quadro final → "Continuar: a câmera continua se deslocando suavemente para a direita, passando pela janela; lá fora, a chuva começou. A música continua sem emendas."

Por que funciona

A extensão se baseia no último quadro exato, então movimento, luz e áudio continuam em vez de serem redefinidos. Encadeie duas ou três extensões e um limite de 15 segundos se transforma discretamente em uma sequência de 40 segundos.

Confronto direto

Grok Imagine 1.5 vs. Seedance 2.0 vs. Veo

O pódio de image-to-video conforme a classificação da arena de junho — o novo líder contra os dois que ultrapassou. As mesmas imagens estáticas e prompts nos três, avaliados pelo que lançaríamos. Todos os três podem ser selecionados no gerador acima.

JobGrok Imagine 1.5Seedance 2.0Veo
classificação da arena i2v no lançamento #1 (Elo 1473) Aprovado Aprovado
Fidelidade à imagem de origem Melhor — a imagem estática é o primeiro quadro Bom Bom
Velocidade de renderização Segundos Minutos 1–3 minutos
Áudio de passagem única Música + SFX + sincronização labial Áudio nativo Ambiente + diálogo
Controle de capturas com carimbo de data/hora Sintaxe nativa Não Não
Resolução máx. 720p oficial 1080p + pipeline de alta resolução 1080p
Realismo sob escrutínio Bom Bom Melhor
Histórico comprovado Semanas Era da arena, meses Estabelecido
Histórico de versões

Como chegou aqui

jun de 2026 · Atual

Grok Imagine Vídeo 1.5

prévia 30–31 de maio, estreia em #1 no i2v arena, GA na xAI API até meados de junho como grok-imagine-video-1.5. Clipes de 15 segundos, áudio em uma única passagem com sincronização labial aprimorada, extensão e orientação de referência. A versão no gerador acima.

Mais cedo em 2026

Grok Imagine Video 1.0

o primeiro lançamento de 10 segundos que colocou a xAI no mapa do vídeo; o salto de 1.5 na arena foi medido em relação a ele.

Origem

Aurora

O backbone de imagem autorregressivo da xAI, cuja força de consistência de personagens é a razão arquitetural pela qual a linha de vídeo trata sua imagem estática como verdade de referência.

Perguntas frequentes

Perguntas sobre Grok Imagine 1.5, respondidas diretamente

1. O que é Grok Imagine 1.5?

O modelo de geração de vídeo da xAI — formalmente Grok Imagine Video 1.5, lançado no final de maio de 2026 e em disponibilidade geral na API da xAI em meados de junho. Ele prioriza imagens: carregue uma imagem estática, descreva o movimento, e ele anima a cena usando a fonte como o primeiro quadro literal, gerando música, efeitos sonoros e diálogo sincronizado com os lábios na mesma etapa. Os clipes duram até 15 segundos e são renderizados em segundos.