xAI's specialist in beeld-naar-video: je stilstaande beeld wordt het eerste frame — compositie, licht en identiteit blijven behouden — met muziek, effecten en lipgesynchroniseerde dialoog die in dezelfde run worden gegenereerd. Typ hieronder een prompt en probeer het.
Ontwikkelaar
xAI
Type
Afbeelding eerst · ook T2V
Duur
Tot 15 s
Max. uitvoer
720p (officieel)
Audio
Muziek · SFX · lipsynchronisatie, in één keer
Snelheid
Rendert in seconden
Arena
#1 i2v bij lancering (Elo 1473)
Ons oordeel in één regel: de keuze voor afbeelding-naar-video. Wanneer de opname begint met een stilstaand beeld dat je al hebt — een productfoto, een portret, een frame — is er hier niets dat het sneller of getrouwer animeert.
Grok Imagine Video 1.5 is het model dat in juni de kroon voor image-to-video veroverde: gelanceerd eind mei, debuteerde het op #1 in de crowdsourced i2v-arena met 1473 Elo — een sprong van 52 punten ten opzichte van zijn voorganger, voorbij Seedance 2.0 en Veo. De architectuur verklaart de specialiteit: Aurora genereert frames sequentieel, waarbij elk frame wordt geconditioneerd op alles wat eraan voorafging, zodat je geüploade stilstaande beeld — behandeld als het letterlijke eerste frame — zijn compositie, belichting en identiteit van het onderwerp behoudt in plaats van af te dwalen. Muziek, geluidseffecten en lipsynchrone dialogen worden in dezelfde pass gerenderd, en clips zijn binnen enkele seconden klaar in plaats van minuten. Eén verduidelijking voordat je geld uitgeeft: dit is het videomodel van xAI, niet de Grok-chatbot — hetzelfde merk, een ander product.
Beoordeeld op basis van onze eigen renders en het gepubliceerde dossier, herzien naarmate de feiten veranderen — dat is een kenmerk van deze pagina, geen disclaimer.
• Beeldgetrouwheid per architectuur.
De bron is nog steeds het eerste frame, geen losse referentie — Aurora's sequentiële conditionering behoudt compositie, licht en identiteit gedurende de hele clip. De kroon van de i2v-arena werd precies hiermee gewonnen.
• Audio in één keer, dialogen inbegrepen.
Achtergrondmuziek, geluidseffecten en lipgesynchroniseerde spraak worden samen met de afbeelding gegenereerd. Lipsynchronisatie is de belangrijkste verbetering ten opzichte van 1.0 — een talking-headclip heeft geen tweede bewerking nodig.
• Tijdgestempelde opnamebediening.
Schrijf de prompt als een tijdlijn — '(0-5s) medium shot... (5-10s) push-in...' — en de beats landen waar je ze plaatst. Shotlist-prompting, ingebouwd.
• Snelheid als workflowfunctie.
Renderingen zijn meestal binnen enkele seconden klaar. Iteratielussen die elders minuten kosten, lopen hier op gesprekstempo — de goedkoopste kwaliteitsmultiplier die er is.
• 720p is de officiële bovengrens.
De eigen lijn van xAI is 720p (sommige gateways bieden hoger). In een veld waar rivalen 1080p tot 4K leveren, is dit de specificatie die sommige briefs vroegtijdig beëindigt.
• Text-to-video is de zwakkere helft.
xAI's eigen richtlijn: t2v is 'generatiever en minder gecontroleerd' dan het beeldpad. Als je geen stilstaand startbeeld hebt, passen de prompt-first-vlaggenschepen beter.
• De merkverwarringsbelasting.
Het deelt een naam met de Grok-chatbot, maar is een afzonderlijk product — de redeneervaardigheid van de chatbot zegt je niets over dit model, in geen van beide richtingen. Beoordeel het op de renders.
• Arena-rang ≠ productierecord.
De Elo meet de voorkeur van het publiek bij i2v-paren, en het model is enkele weken oud. Beschouw de kroon als een sterk signaal, niet als een definitief oordeel.
Kopieer naar de generator hierboven, verwissel de haakjes, render.
Uploaden: je productfoto
"(0-4s) de [fles] staat in zacht ochtendlicht terwijl stofdeeltjes zweven. (4-9s) langzaam inzoomen terwijl een warm hoofdlicht van links opkomt. (9-12s) tot rust komen op een close-up terwijl het etiket het licht vangt. Rustige ambient soundtrack, één zachte belklank aan het einde."
Tijdstempels zetten de prompt om in een shotlist, en de architectuur met stilstaand beeld als eerste frame houdt het product precies zoals het is gefotografeerd. De demo naast de generator is deze prompt.
Uploaden: een portretfoto
"Ze kijkt op van het notitieboek en zegt warm: 'Het kostte me jaren om dit te leren.' Dan een kleine glimlach, terug naar het schrijven. Ruimtegeluid, potloodgekras, geen muziek."
Dialoog tussen aanhalingstekens activeert de lipsynchronisatie — de meest trotse oplossing van generatie 1.5. Houd regels kort en laat de prompt de actie ervoor en erna benoemen, zodat de voordracht ergens kan landen.
Genereer een eerste clip → Verleng vanaf het laatste frame → "Doorgaan: de camera blijft naar rechts langs het raam drijven; buiten is de regen begonnen. De muziek loopt naadloos door."
De uitbreiding baseert zich op exact het laatste frame, zodat beweging, licht en audio doorgaan in plaats van opnieuw te beginnen. Keten twee of drie uitbreidingen aan elkaar en een limiet van 15 seconden wordt stilletjes een sequentie van 40 seconden.
Het image-to-video-podium zoals de juni-arena het rangschikte — de nieuwe leider tegenover de twee die hij voorbijging. Dezelfde stilstaande beelden en prompts voor alle drie, beoordeeld op wat we zouden uitbrengen. Alle drie zijn selecteerbaar in de generator hierboven.
preview 30–31 mei, debuut als #1 in i2v arena, GA in de xAI API tegen half juni als grok-imagine-video-1.5. Clips van 15 seconden, one-pass audio met verbeterde lipsynchronisatie, extensie en referentiebegeleiding. De versie in de generator hierboven.
de eerste release van 10 seconden die xAI op de videokaart zette; de arenasprong van 1.5 werd eraan afgemeten.
De autoregressieve image-backbone van xAI, waarvan de kracht in karakterconsistentie de architecturale reden is waarom de videolijn je stilstaande beeld als ground truth behandelt.
Het videogeneratiemodel van xAI — formeel Grok Imagine Video 1.5, eind mei 2026 uitgebracht en half juni algemeen beschikbaar in de xAI API. Het is image-first: upload een stilstaand beeld, beschrijf de beweging, en het animeert de scène met de bron als letterlijk eerste frame, waarbij het in dezelfde stap muziek, geluidseffecten en lipsynchrone dialoog genereert. Clips duren tot 15 seconden en worden in enkele seconden gerenderd.