Grok Imagine 1.5 AI-videogenerator

xAI:s specialist på bild-till-video: din stillbild blir den första bildrutan — komposition, ljus och identitet bevaras — med musik, effekter och läppsynkad dialog genererade i samma körning. Skriv en prompt nedan och prova.

Modell
Bild: 0/1
Ladda upp bild för startruta
(JPG, JPEG, PNG, WEBP, max 30 MB)
Prompt
0/5000
Videoexempel
 

Utvecklare

xAI

Typ

Bild först · även T2V

Varaktighet

Upp till 15 s

Max utdata

720p (officiell)

Ljud

Musik · SFX · läppsynk, ett enda pass

Hastighet

Renderar på några sekunder

Arena

#1 i2v vid lansering (Elo 1473)

Vårt omdöme på en rad: valet för bild-till-video. När tagningen börjar från en stillbild du redan har — ett produktfoto, ett porträtt, en bildruta — finns det inget här som animerar den snabbare eller mer troget.

Grok Imagine Video 1.5 är modellen som tog kronan för bild-till-video i juni: den lanserades i slutet av maj och debuterade som #1 på den publikdrivna i2v-arenan med 1473 Elo — ett hopp på 52 poäng över sin föregångare, förbi Seedance 2.0 och Veo. Dess arkitektur förklarar specialiteten: Aurora genererar bildrutor sekventiellt, där varje bildruta baseras på allt som kommit före den, så din uppladdade stillbild — behandlad som den bokstavliga första bildrutan — behåller sin komposition, ljussättning och motividentitet i stället för att driva iväg. Musik, ljudeffekter och läppsynkad dialog renderas i samma omgång, och klippen blir klara på sekunder snarare än minuter. Ett förtydligande innan du betalar: detta är xAI:s videomodell, inte Grok-chattboten — samma varumärke, olika produkter.

Ärlig tolkning

Där Grok Imagine 1.5 vinner — och där det inte gör det

Bedömt utifrån våra egna renderingar och den publicerade dokumentationen, reviderat i takt med att fakta förändras — det är en egenskap hos den här sidan, inte en ansvarsfriskrivning.

Verkligt starkt

  • • Bildåtergivning efter arkitektur.

    Källan är fortfarande den första bildrutan, inte en lös referens — Auroras sekventiella konditionering behåller komposition, ljus och identitet genom hela klippet. i2v-arenans krona vanns på exakt detta.

  • • Ljud i en enda omgång, dialog inkluderad.

    Bakgrundsmusik, ljudeffekter och läppsynkat tal genereras tillsammans med bilden. Läppsynk är den främsta förbättringen jämfört med 1.0 — ett talking-head-klipp behöver ingen andra bearbetning.

  • • Tidsstämplad bildkontroll.

    Skriv prompten som en tidslinje — '(0-5s) halvbild... (5-10s) inkörning...' — så hamnar takterna där du placerar dem. Shotlist-promptning, inbyggt.

  • • Hastighet som en arbetsflödesfunktion.

    Renderingar blir vanligtvis klara på några sekunder. Iterationsloopar som tar minuter någon annanstans körs här i samtalstakt — den billigaste kvalitetsmultiplikatorn som finns.

Kända begränsningar

  • • 720p är den officiella gränsen.

    xAI:s egen linje är 720p (vissa gateways exponerar högre). I ett område där konkurrenter levererar 1080p till 4K är detta specifikationen som avslutar vissa briefar i förtid.

  • • Text-to-video är den svagare halvan.

    xAI:s egna vägledning: t2v är 'mer generativ och mindre kontrollerad' än bildvägen. Om du inte har en startstillbild passar prompt-first-flaggskeppen bättre.

  • • Skatten på varumärkesförvirring.

    Det delar namn med Grok-chatboten, men är en separat produkt — chatbotens resonemang säger dig ingenting om den här modellen, åt något håll. Bedöm den utifrån renderingarna.

  • • Arenarankning ≠ produktionspost.

    Elo mäter publikens preferens på i2v-par, och modellen är några veckor gammal. Behandla kronan som en stark signal, inte som ett slutgiltigt omdöme.

Promptrecept

Tre prompts som visa vad det är till för

Kopiera till generatorn ovan, byt ut parenteserna, rendera.

Produktstillbilden, väckt till liv

Ladda upp: ditt produktfoto

"(0-4s) [flaskan] står i mjukt gryningsljus medan dammkorn svävar. (4-9s) långsam inzoomning medan ett varmt huvudljus tonar upp från vänster. (9-12s) landa i en närbild när etiketten fångar ljuset. Stilla ambientmusik, en mjuk klockklang i slutet."

Varför det fungerar

Tidsstämplar gör prompten till en shotlista, och arkitekturen med stillbild som första bildruta håller produkten exakt som den fotograferades. Demon bredvid generatorn är denna prompt.

Det talande porträttet

Ladda upp: ett porträttfoto

"Hon tittar upp från anteckningsboken och säger varmt: 'Det tog mig år att lära mig det här.' Sedan ett litet leende, tillbaka till skrivandet. Rumsljud, blyertspennans skrapande, ingen musik."

Varför det fungerar

Dialog inom citattecken aktiverar läppsynkroniseringen — den stoltaste fixen i generation 1.5. Håll replikerna korta och låt prompten namnge före- och efterhandlingen, så att framförandet har någonstans att landa.

Den kedjade sekvensen

Generera ett första klipp → Förläng från dess sista bildruta → "Fortsätt: kameran fortsätter att glida åt höger förbi fönstret; utanför har regnet börjat. Musiken fortsätter sömlöst."

Varför det fungerar

Förlängningen utgår från exakt den sista bildrutan, så rörelse, ljus och ljud fortsätter i stället för att återställas. Länka två eller tre förlängningar och ett tak på 15 sekunder blir diskret en 40-sekunderssekvens.

Inbördes möten

Grok Imagine 1.5 vs Seedance 2.0 vs Veo

Image-to-video-pallen enligt junis arenaranking — den nya ledaren mot de två den passerade. Samma stillbilder och promptar i alla tre, bedömda efter vad vi skulle leverera. Alla tre kan väljas i generatorn ovan.

JobGrok Imagine 1.5Seedance 2.0Veo
i2v-arenans rankning vid lanseringen #1 (Elo 1473) Godkänd Godkänd
Källbildstrohet Bäst — stillbilden är bildruta ett Bra Bra
Renderingshastighet Sekunder Minuter 1–3 minuter
Ljud i ett pass Musik + SFX + läppsynk Inbyggt ljud Miljöljud + dialog
Kontroll av tidsstämplade bilder Inbyggd syntax Nej Nej
Maximal upplösning 720p officiell 1080p + högupplöst pipeline 1080p
Realism under granskning Bra Bra Bäst
Dokumenterad meritlista Veckor gammal Arenaera, månader Etablerad
Versionshistorik

Hur det hamnade här

jun 2026 · Nuvarande

Grok Imagine Video 1.5

förhandsvisning 30–31 maj, debut som #1 i i2v arena, GA i xAI API senast i mitten av juni som grok-imagine-video-1.5. 15-sekundersklipp, one-pass-ljud med förbättrad läppsynk, förlängning och referensvägledning. Versionen i generatorn ovan.

Tidigare under 2026

Grok Imagine Video 1.0

den 10 sekunder långa första lanseringen som satte xAI på videokartan; 1.5:s arenahopp mättes mot den.

Ursprung

Norrsken

xAI:s autoregressiva bild-backbone, vars styrka inom karaktärskonsekvens är den arkitektoniska orsaken till att videolinjen behandlar din stillbild som ground truth.

Vanliga frågor

Frågor om Grok Imagine 1.5, besvarade rakt på sak

1. Vad är Grok Imagine 1.5?

xAI:s videogenereringsmodell — formellt Grok Imagine Video 1.5, släppt i slutet av maj 2026 och allmänt tillgänglig i xAI API:et i mitten av juni. Den utgår från bilder: ladda upp en stillbild, beskriv rörelsen, så animerar den scenen med källbilden som den bokstavliga första bildrutan, och genererar musik, ljudeffekter och läppsynkad dialog i samma omgång. Klipp kan vara upp till 15 sekunder långa och renderas på några sekunder.