O especialista da xAI em imagem para vídeo: sua imagem estática se torna o primeiro quadro — composição, luz e identidade preservadas — com música, efeitos e diálogo sincronizado labialmente gerados na mesma etapa. Digite um prompt abaixo e experimente.
Desenvolvedor
xAI
Tipo
Imagem primeiro · também T2V
Duração
Até 15 s
Saída máx.
720p (oficial)
Áudio
Música · SFX · sincronização labial, em uma só passagem
Velocidade
Renderiza em segundos
Arena
#1 i2v no lançamento (Elo 1473)
Nosso veredito em uma linha: a escolha para transformar imagem em vídeo. Quando a tomada começa a partir de uma imagem estática que você já tem — uma foto de produto, um retrato, um quadro — nada aqui a anima mais rápido ou com mais fidelidade.
Grok Imagine Video 1.5 é o modelo que conquistou a coroa de imagem-para-vídeo em junho: lançado no fim de maio, estreou em 1º lugar na arena i2v colaborativa com 1473 Elo — um salto de 52 pontos em relação ao seu antecessor, ultrapassando Seedance 2.0 e Veo. Sua arquitetura explica a especialidade: Aurora gera quadros sequencialmente, cada um condicionado por tudo o que veio antes, de modo que a imagem estática enviada por você — tratada como o primeiro quadro literal — mantém sua composição, iluminação e identidade do sujeito, em vez de se desviar. Música, efeitos sonoros e diálogos sincronizados com os lábios são renderizados na mesma passagem, e os clipes ficam prontos em segundos, não em minutos. Uma distinção antes de você gastar: este é o modelo de vídeo da xAI, não o chatbot Grok — mesma marca, produto diferente.
Avaliado com base nas nossas próprias renderizações e no registro publicado, revisado à medida que os fatos mudam — isso é um recurso desta página, não uma isenção de responsabilidade.
• Fidelidade da imagem por arquitetura.
A fonte ainda é o primeiro quadro, não uma referência solta — o condicionamento sequencial da Aurora mantém a composição, a luz e a identidade durante todo o clipe. A coroa da arena i2v foi conquistada exatamente com isso.
• Áudio em uma única passagem, diálogos incluídos.
A música de fundo, os efeitos sonoros e a fala sincronizada com os lábios são gerados junto com a imagem. A sincronização labial é a principal melhoria em relação à versão 1.0 — um clipe de cabeça falante não precisa de uma segunda etapa.
• Controle de captura com carimbo de data/hora.
Escreva o prompt como uma linha do tempo — '(0-5s) plano médio... (5-10s) aproximação de câmera...' — e os pontos-chave acontecem onde você os coloca. Prompting por lista de planos, nativo.
• Velocidade como recurso de fluxo de trabalho.
As renderizações normalmente terminam em segundos. Os ciclos de iteração que levam minutos em outros lugares aqui rodam no ritmo de uma conversa — o multiplicador de qualidade mais barato que existe.
• 720p é o limite oficial.
A própria linha da xAI é 720p (alguns gateways expõem valores mais altos). Em um campo em que os rivais oferecem de 1080p a 4K, esta é a especificação que encerra alguns briefs mais cedo.
• Text-to-video é a metade mais fraca.
A própria orientação da xAI: t2v é 'mais generativo e menos controlado' do que o caminho de imagem. Se você não tiver uma imagem estática inicial, os modelos carro-chefe prompt-first se encaixam melhor.
• O imposto sobre a confusão de marca.
Ele compartilha o nome com o chatbot Grok, mas é um produto separado — o raciocínio do chatbot não diz nada sobre este modelo, nem num sentido nem no outro. Julgue-o pelos renders.
• Classificação da arena ≠ registro de produção.
O Elo mede a preferência do público em pares i2v, e o modelo tem algumas semanas. Trate a coroa como um sinal forte, não como um veredito definitivo.
Copie para o gerador acima, troque os colchetes, renderize.
Carregar: a foto do seu produto
"(0-4s) a [garrafa] permanece sob a suave luz do amanhecer enquanto partículas de poeira flutuam. (4-9s) aproximação lenta enquanto uma luz principal quente aumenta gradualmente a partir da esquerda. (9-12s) estabilizar em um close-up enquanto o rótulo capta a luz. Trilha ambiente tranquila, um toque suave de sino no final."
Os timestamps transformam o prompt em uma lista de tomadas, e a arquitetura de imagem estática como primeiro quadro mantém o produto exatamente como foi fotografado. A demonstração ao lado do gerador é este prompt.
Carregar: uma foto de retrato
"Ela levanta os olhos do caderno e diz, calorosamente: 'Levei anos para aprender isto.' Depois um pequeno sorriso, volta a escrever. Som ambiente do cômodo, arranhar do lápis, sem música."
O diálogo entre aspas ativa a sincronização labial — a correção de que a geração 1.5 mais se orgulha. Mantenha as falas curtas e deixe o prompt nomear a ação antes e depois, para que a entrega tenha um ponto de chegada.
Gere um primeiro clipe → Estenda a partir do quadro final → "Continuar: a câmera continua se deslocando suavemente para a direita, passando pela janela; lá fora, a chuva começou. A música continua sem emendas."
A extensão se baseia no último quadro exato, então movimento, luz e áudio continuam em vez de serem redefinidos. Encadeie duas ou três extensões e um limite de 15 segundos se transforma discretamente em uma sequência de 40 segundos.
O pódio de image-to-video conforme a classificação da arena de junho — o novo líder contra os dois que ultrapassou. As mesmas imagens estáticas e prompts nos três, avaliados pelo que lançaríamos. Todos os três podem ser selecionados no gerador acima.
prévia 30–31 de maio, estreia em #1 no i2v arena, GA na xAI API até meados de junho como grok-imagine-video-1.5. Clipes de 15 segundos, áudio em uma única passagem com sincronização labial aprimorada, extensão e orientação de referência. A versão no gerador acima.
o primeiro lançamento de 10 segundos que colocou a xAI no mapa do vídeo; o salto de 1.5 na arena foi medido em relação a ele.
O backbone de imagem autorregressivo da xAI, cuja força de consistência de personagens é a razão arquitetural pela qual a linha de vídeo trata sua imagem estática como verdade de referência.
O modelo de geração de vídeo da xAI — formalmente Grok Imagine Video 1.5, lançado no final de maio de 2026 e em disponibilidade geral na API da xAI em meados de junho. Ele prioriza imagens: carregue uma imagem estática, descreva o movimento, e ele anima a cena usando a fonte como o primeiro quadro literal, gerando música, efeitos sonoros e diálogo sincronizado com os lábios na mesma etapa. Os clipes duram até 15 segundos e são renderizados em segundos.