xAI:s specialist på bild-till-video: din stillbild blir den första bildrutan — komposition, ljus och identitet bevaras — med musik, effekter och läppsynkad dialog genererade i samma körning. Skriv en prompt nedan och prova.
Utvecklare
xAI
Typ
Bild först · även T2V
Varaktighet
Upp till 15 s
Max utdata
720p (officiell)
Ljud
Musik · SFX · läppsynk, ett enda pass
Hastighet
Renderar på några sekunder
Arena
#1 i2v vid lansering (Elo 1473)
Vårt omdöme på en rad: valet för bild-till-video. När tagningen börjar från en stillbild du redan har — ett produktfoto, ett porträtt, en bildruta — finns det inget här som animerar den snabbare eller mer troget.
Grok Imagine Video 1.5 är modellen som tog kronan för bild-till-video i juni: den lanserades i slutet av maj och debuterade som #1 på den publikdrivna i2v-arenan med 1473 Elo — ett hopp på 52 poäng över sin föregångare, förbi Seedance 2.0 och Veo. Dess arkitektur förklarar specialiteten: Aurora genererar bildrutor sekventiellt, där varje bildruta baseras på allt som kommit före den, så din uppladdade stillbild — behandlad som den bokstavliga första bildrutan — behåller sin komposition, ljussättning och motividentitet i stället för att driva iväg. Musik, ljudeffekter och läppsynkad dialog renderas i samma omgång, och klippen blir klara på sekunder snarare än minuter. Ett förtydligande innan du betalar: detta är xAI:s videomodell, inte Grok-chattboten — samma varumärke, olika produkter.
Bedömt utifrån våra egna renderingar och den publicerade dokumentationen, reviderat i takt med att fakta förändras — det är en egenskap hos den här sidan, inte en ansvarsfriskrivning.
• Bildåtergivning efter arkitektur.
Källan är fortfarande den första bildrutan, inte en lös referens — Auroras sekventiella konditionering behåller komposition, ljus och identitet genom hela klippet. i2v-arenans krona vanns på exakt detta.
• Ljud i en enda omgång, dialog inkluderad.
Bakgrundsmusik, ljudeffekter och läppsynkat tal genereras tillsammans med bilden. Läppsynk är den främsta förbättringen jämfört med 1.0 — ett talking-head-klipp behöver ingen andra bearbetning.
• Tidsstämplad bildkontroll.
Skriv prompten som en tidslinje — '(0-5s) halvbild... (5-10s) inkörning...' — så hamnar takterna där du placerar dem. Shotlist-promptning, inbyggt.
• Hastighet som en arbetsflödesfunktion.
Renderingar blir vanligtvis klara på några sekunder. Iterationsloopar som tar minuter någon annanstans körs här i samtalstakt — den billigaste kvalitetsmultiplikatorn som finns.
• 720p är den officiella gränsen.
xAI:s egen linje är 720p (vissa gateways exponerar högre). I ett område där konkurrenter levererar 1080p till 4K är detta specifikationen som avslutar vissa briefar i förtid.
• Text-to-video är den svagare halvan.
xAI:s egna vägledning: t2v är 'mer generativ och mindre kontrollerad' än bildvägen. Om du inte har en startstillbild passar prompt-first-flaggskeppen bättre.
• Skatten på varumärkesförvirring.
Det delar namn med Grok-chatboten, men är en separat produkt — chatbotens resonemang säger dig ingenting om den här modellen, åt något håll. Bedöm den utifrån renderingarna.
• Arenarankning ≠ produktionspost.
Elo mäter publikens preferens på i2v-par, och modellen är några veckor gammal. Behandla kronan som en stark signal, inte som ett slutgiltigt omdöme.
Kopiera till generatorn ovan, byt ut parenteserna, rendera.
Ladda upp: ditt produktfoto
"(0-4s) [flaskan] står i mjukt gryningsljus medan dammkorn svävar. (4-9s) långsam inzoomning medan ett varmt huvudljus tonar upp från vänster. (9-12s) landa i en närbild när etiketten fångar ljuset. Stilla ambientmusik, en mjuk klockklang i slutet."
Tidsstämplar gör prompten till en shotlista, och arkitekturen med stillbild som första bildruta håller produkten exakt som den fotograferades. Demon bredvid generatorn är denna prompt.
Ladda upp: ett porträttfoto
"Hon tittar upp från anteckningsboken och säger varmt: 'Det tog mig år att lära mig det här.' Sedan ett litet leende, tillbaka till skrivandet. Rumsljud, blyertspennans skrapande, ingen musik."
Dialog inom citattecken aktiverar läppsynkroniseringen — den stoltaste fixen i generation 1.5. Håll replikerna korta och låt prompten namnge före- och efterhandlingen, så att framförandet har någonstans att landa.
Generera ett första klipp → Förläng från dess sista bildruta → "Fortsätt: kameran fortsätter att glida åt höger förbi fönstret; utanför har regnet börjat. Musiken fortsätter sömlöst."
Förlängningen utgår från exakt den sista bildrutan, så rörelse, ljus och ljud fortsätter i stället för att återställas. Länka två eller tre förlängningar och ett tak på 15 sekunder blir diskret en 40-sekunderssekvens.
Image-to-video-pallen enligt junis arenaranking — den nya ledaren mot de två den passerade. Samma stillbilder och promptar i alla tre, bedömda efter vad vi skulle leverera. Alla tre kan väljas i generatorn ovan.
förhandsvisning 30–31 maj, debut som #1 i i2v arena, GA i xAI API senast i mitten av juni som grok-imagine-video-1.5. 15-sekundersklipp, one-pass-ljud med förbättrad läppsynk, förlängning och referensvägledning. Versionen i generatorn ovan.
den 10 sekunder långa första lanseringen som satte xAI på videokartan; 1.5:s arenahopp mättes mot den.
xAI:s autoregressiva bild-backbone, vars styrka inom karaktärskonsekvens är den arkitektoniska orsaken till att videolinjen behandlar din stillbild som ground truth.
xAI:s videogenereringsmodell — formellt Grok Imagine Video 1.5, släppt i slutet av maj 2026 och allmänt tillgänglig i xAI API:et i mitten av juni. Den utgår från bilder: ladda upp en stillbild, beskriv rörelsen, så animerar den scenen med källbilden som den bokstavliga första bildrutan, och genererar musik, ljudeffekter och läppsynkad dialog i samma omgång. Klipp kan vara upp till 15 sekunder långa och renderas på några sekunder.