Espesyalista ng xAI sa image-to-video: ang iyong still image ay nagiging unang frame — pinananatili ang komposisyon, ilaw at pagkakakilanlan — na may musika, mga effect at lip-synced na dialog na nabubuo sa parehong proseso. Mag-type ng prompt sa ibaba at subukan ito.
Developer
xAI
Uri
Larawan muna · pati T2V
Tagal
Hanggang 15 s
Max output
720p (opisyal)
Audio
Musika · SFX · lip-sync, isang pasada
Bilis
Nagre-render sa loob ng ilang segundo
Arena
#1 i2v sa paglulunsad (Elo 1473)
Ang aming isang-linyang hatol: ang pili para sa image-to-video. Kapag nagsisimula ang shot mula sa isang still image na mayroon ka na — isang larawan ng produkto, isang portrait, isang frame — walang anuman dito ang nag-a-animate nito nang mas mabilis o mas tapat.
Grok Imagine Video 1.5 ang modelong umagaw ng korona sa image-to-video noong Hunyo: inilunsad sa katapusan ng Mayo, nag-debut ito bilang #1 sa crowd-sourced i2v arena sa 1473 Elo — 52 puntos na pag-angat mula sa nauna rito, lampas sa Seedance 2.0 at Veo. Ipinapaliwanag ng arkitektura nito ang espesyalisasyon: sunod-sunod na bumubuo ang Aurora ng mga frame, na ang bawat isa ay nakabatay sa lahat ng nauna rito, kaya ang na-upload mong still image — itinuturing bilang literal na unang frame — ay napapanatili ang komposisyon, lighting, at pagkakakilanlan ng paksa sa halip na magbago-bago. Nare-render ang musika, sound effects, at lip-synced na dialogue sa iisang pass, at natatapos ang mga clip sa loob ng ilang segundo sa halip na minuto. Isang paglilinaw bago ka gumastos: ito ang video model ng xAI, hindi ang Grok chatbot — iisang brand, magkaibang produkto.
Hinuhusgahan batay sa sarili naming mga render at sa inilathalang tala, nire-rebisa habang nagbabago ang mga katotohanan — tampok ito ng pahinang ito, hindi disclaimer.
• Katapatan ng larawan ayon sa arkitektura.
Ang pinagmulan ay ang unang frame pa rin, hindi isang maluwag na sanggunian — pinananatili ng sequential conditioning ng Aurora ang komposisyon, liwanag, at pagkakakilanlan sa buong clip. Ang korona ng i2v arena ay napanalunan dahil mismo dito.
• One-pass na audio, kasama ang diyalogo.
Nabubuo kasama ng larawan ang musika sa background, mga sound effect, at pananalitang naka-sync sa labi. Ang lip-sync ang pangunahing pagpapahusay kumpara sa 1.0 — hindi na kailangan ng clip ng nagsasalitang mukha ng pangalawang proseso.
• Kontrol ng kuhang may timestamp.
Isulat ang prompt bilang timeline — '(0-5s) medium shot... (5-10s) push-in...' — at tatama ang mga beat kung saan mo inilagay ang mga ito. Pag-prompt gamit ang shot list, native.
• Bilis bilang feature ng workflow.
Karaniwang natatapos ang mga render sa loob ng ilang segundo. Ang mga loop ng iterasyon na umaabot ng ilang minuto sa ibang lugar ay tumatakbo rito sa bilis ng pag-uusap — ang pinakamurang multiplier ng kalidad na mayroon.
• 720p ang opisyal na limitasyon.
Ang sariling linya ng xAI ay 720p (naglalantad ng mas mataas ang ilang gateway). Sa larangang naghahatid ang mga karibal ng 1080p hanggang 4K, ito ang espesipikasyong nagpapatapos nang maaga sa ilang brief.
• Ang text-to-video ang mas mahinang kalahati.
Sariling gabay ng xAI: ang t2v ay 'mas generative at hindi gaanong controlled' kaysa sa image path. Kung wala kang panimulang still image, mas bagay ang mga prompt-first flagship.
• Ang buwis sa pagkalito sa tatak.
Kapangalan nito ang chatbot na Grok ngunit hiwalay itong produkto — walang sinasabi ang pangangatwiran ng chatbot tungkol sa modelong ito, sa alinmang direksyon. Husgahan ito batay sa mga render.
• Ranggo sa arena ≠ tala ng produksyon.
Sinusukat ng Elo ang kagustuhan ng karamihan sa mga pares na i2v, at ilang linggo na ang edad ng modelo. Ituring ang korona bilang malakas na signal, hindi bilang pinal na hatol.
Kopyahin sa generator sa itaas, palitan ang mga bracket, i-render.
I-upload: larawan ng iyong produkto
"(0-4s) nakatayo ang [bote] sa malambot na liwanag ng bukang-liwayway habang lumulutang ang mga butil ng alikabok. (4-9s) mabagal na paglapit habang unti-unting lumiliwanag mula sa kaliwa ang mainit na key light. (9-12s) tumigil sa isang close-up habang nasasalo ng label ang liwanag. Tahimik na ambient score, isang banayad na tunog ng kampana sa dulo."
Ginagawang listahan ng mga shot ng mga timestamp ang prompt, at pinapanatili ng arkitekturang gumagamit ng still image bilang unang frame ang produkto nang eksakto gaya ng pagkakakuha sa larawan. Ang demo sa tabi ng generator ay ang prompt na ito.
I-upload: isang larawang portrait
"Tumingala siya mula sa kuwaderno at mainit na sinabi: 'Inabot ako ng ilang taon para matutuhan ito.' Pagkatapos ay isang maliit na ngiti, balik sa pagsusulat. Tunog ng silid, gasgas ng lapis, walang musika."
Ina-activate ng diyalog na nasa panipi ang lip-sync — ang pinakaipinagmamalaking ayos ng henerasyong 1.5. Panatilihing maikli ang mga linya at hayaang pangalanan ng prompt ang aksyon bago at pagkatapos para may bagsakan ang delivery.
Gumawa ng unang clip → Palawigin mula sa huling frame nito → "Magpatuloy: patuloy na dumudulas pakanan ang camera lampas sa bintana; sa labas, nagsimula nang umulan. Tuloy-tuloy ang musika nang walang putol."
Nakabatay ang extension sa eksaktong huling frame, kaya nagpapatuloy ang galaw, liwanag, at audio sa halip na mag-reset. Pagdugtungin ang dalawa o tatlong extension at ang 15-segundong limitasyon ay tahimik na nagiging 40-segundong sequence.
Ang podium ng image-to-video ayon sa ranggo ng arena noong Hunyo — ang bagong nangunguna laban sa dalawang nalampasan nito. Parehong mga still image at prompt sa lahat ng tatlo, hinusgahan batay sa kung ano ang ilalabas namin. Mapipili ang lahat ng tatlo sa generator sa itaas.
preview Mayo 30–31, debut na #1 sa i2v arena, GA sa xAI API pagsapit ng kalagitnaan ng Hunyo bilang grok-imagine-video-1.5. Mga 15-segundong clip, one-pass na audio na may pinahusay na lip-sync, extension at reference guidance. Ang bersyon sa generator sa itaas.
ang 10-segundong unang release na naglagay sa xAI sa mapa ng video; ang pagtalon ng 1.5 sa arena ay sinukat laban dito.
Ang autoregressive na backbone ng larawan ng xAI, na ang lakas sa consistency ng karakter ay ang arkitektural na dahilan kung bakit itinuturing ng linya ng video ang iyong still image bilang ground truth.
Model ng xAI para sa pagbuo ng video — pormal na Grok Imagine Video 1.5, inilabas noong huling bahagi ng Mayo 2026 at GA sa xAI API pagsapit ng kalagitnaan ng Hunyo. Image-first ito: mag-upload ng still, ilarawan ang galaw, at ia-animate nito ang eksena gamit ang source bilang mismong unang frame, na bumubuo ng musika, sound effects at lip-synced dialogue sa iisang pass. Ang mga clip ay tumatagal nang hanggang 15 segundo at nare-render sa loob ng ilang segundo.