Pakar imej-ke-video xAI: imej pegun anda menjadi bingkai pertama — komposisi, cahaya dan identiti dikekalkan — dengan muzik, kesan dan dialog segerak bibir dijana dalam proses yang sama. Taip gesaan di bawah dan cubalah.
Pembangun
xAI
Jenis
Imej dahulu · juga T2V
Tempoh
Sehingga 15 s
Output maks
720p (rasmi)
Audio
Muzik · SFX · penyegerakan bibir, sekali lalu
Kelajuan
Dirender dalam beberapa saat
Arena
#1 i2v semasa pelancaran (Elo 1473)
Keputusan kami dalam satu baris: pilihan untuk imej-ke-video. Apabila syot bermula daripada imej pegun yang sudah anda miliki — foto produk, potret, bingkai — tiada apa-apa di sini yang menganimasikannya dengan lebih pantas atau lebih setia.
Grok Imagine Video 1.5 ialah model yang meraih takhta imej-ke-video pada bulan Jun: dilancarkan pada akhir Mei, ia muncul di kedudukan #1 dalam arena i2v bersumberkan komuniti pada 1473 Elo — lonjakan 52 mata berbanding pendahulunya, mengatasi Seedance 2.0 dan Veo. Seni binanya menjelaskan kepakarannya: Aurora menjana bingkai secara berurutan, setiap satu dikondisikan berdasarkan semua yang sebelumnya, jadi imej pegun yang anda muat naik — dianggap sebagai bingkai pertama secara literal — mengekalkan komposisi, pencahayaan dan identiti subjeknya tanpa menyimpang. Muzik, kesan bunyi dan dialog yang disegerakkan dengan bibir dirender dalam proses yang sama, dan klip siap dalam beberapa saat, bukannya beberapa minit. Satu penjelasan sebelum anda berbelanja: ini ialah model video xAI, bukan chatbot Grok — jenama sama, produk berbeza.
Dinilai berdasarkan render kami sendiri dan rekod yang diterbitkan, disemak semula apabila fakta berubah — itu ialah ciri halaman ini, bukan penafian.
• Kesetiaan imej mengikut seni bina.
Sumbernya masih bingkai pertama, bukan rujukan longgar — pengkondisian berjujukan Aurora mengekalkan komposisi, cahaya dan identiti sepanjang klip. Mahkota arena i2v dimenangi tepat kerana ini.
• Audio satu laluan, dialog disertakan.
Muzik latar, kesan bunyi dan pertuturan yang disegerakkan dengan bibir dijana bersama gambar. Penyegerakan bibir ialah penambahbaikan utama berbanding 1.0 — klip wajah bercakap tidak memerlukan proses kedua.
• Kawalan tangkapan bercap masa.
Tulis prompt sebagai garis masa — '(0-5s) syot medium... (5-10s) tolakan masuk...' — dan rentak akan jatuh di tempat anda meletakkannya. Prompting senarai syot, secara natif.
• Kelajuan sebagai ciri aliran kerja.
Proses render biasanya selesai dalam beberapa saat. Gelung iterasi yang mengambil masa beberapa minit di tempat lain berjalan pada rentak perbualan di sini — pengganda kualiti paling murah yang ada.
• 720p ialah had rasmi.
Barisan xAI sendiri ialah 720p (sesetengah gerbang mendedahkan resolusi yang lebih tinggi). Dalam bidang di mana pesaing menawarkan 1080p hingga 4K, inilah spesifikasi yang menamatkan sesetengah brief lebih awal.
• Text-to-video ialah separuh yang lebih lemah.
Panduan xAI sendiri: t2v adalah 'lebih generatif dan kurang terkawal' berbanding laluan imej. Jika anda tidak mempunyai imej pegun permulaan, produk unggulan prompt-first lebih sesuai.
• Cukai kekeliruan jenama.
Ia berkongsi nama dengan chatbot Grok tetapi merupakan produk berasingan — penaakulan chatbot tidak memberitahu anda apa-apa tentang model ini, sama ada positif atau negatif. Nilailah berdasarkan hasil render.
• Kedudukan arena ≠ rekod pengeluaran.
Elo mengukur keutamaan orang ramai pada pasangan i2v, dan model ini sudah berusia beberapa minggu. Anggap mahkota sebagai isyarat yang kuat, bukan keputusan muktamad.
Salin ke dalam penjana di atas, tukar kurungan, render.
Muat naik: foto produk anda
"(0-4s) [botol] berdiri dalam cahaya subuh yang lembut sementara habuk halus terapung. (4-9s) gerakan masuk perlahan sementara cahaya utama yang hangat semakin terang dari kiri. (9-12s) berhenti pada jarak dekat apabila label menangkap cahaya. Skor ambien yang tenang, satu dentingan lembut di penghujung."
Cap masa menukar prompt menjadi senarai syot, dan seni bina imej pegun sebagai bingkai pertama mengekalkan produk tepat seperti yang difotografkan. Demo di sebelah penjana ialah prompt ini.
Muat naik: foto potret
"Dia mendongak dari buku nota dan berkata, dengan mesra: 'Saya mengambil masa bertahun-tahun untuk mempelajari perkara ini.' Kemudian senyuman kecil, kembali menulis. Suasana bilik, bunyi goresan pensel, tiada muzik."
Dialog dalam tanda petik mengaktifkan penyegerakan bibir — pembetulan yang paling dibanggakan oleh generasi 1.5. Pastikan baris ringkas dan biarkan prompt menamakan tindakan sebelum dan selepas supaya penyampaian ada tempat untuk mendarat.
Jana klip pertama → Lanjutkan daripada bingkai terakhirnya → "Teruskan: kamera terus hanyut ke kanan melepasi tingkap; di luar, hujan telah mula turun. Muzik bersambung tanpa sela."
Sambungan berasaskan bingkai terakhir yang tepat, jadi gerakan, cahaya dan audio terus berjalan dan bukannya ditetapkan semula. Rangkaikan dua atau tiga sambungan dan had 15 saat secara senyap menjadi jujukan 40 saat.
Podium image-to-video seperti yang dinilai oleh arena Jun — pemimpin baharu menentang dua yang telah dipintasnya. Imej pegun dan prompt yang sama merentas ketiga-tiganya, dinilai berdasarkan apa yang akan kami keluarkan. Ketiga-tiganya boleh dipilih dalam penjana di atas.
pratonton 30–31 Mei, debut #1 di i2v arena, GA dalam xAI API menjelang pertengahan Jun sebagai grok-imagine-video-1.5. Klip 15 saat, audio satu laluan dengan penyegerakan bibir yang dipertingkat, sambungan dan panduan rujukan. Versi dalam penjana di atas.
keluaran pertama 10 saat yang meletakkan xAI pada peta video; lonjakan arena 1.5 diukur berbanding dengannya.
Tulang belakang imej autoregresif xAI, yang kekuatan konsistensi wataknya ialah sebab seni bina barisan video menganggap imej pegun anda sebagai kebenaran asas.
Model penjanaan video xAI — secara rasminya Grok Imagine Video 1.5, dilancarkan pada akhir Mei 2026 dan tersedia secara umum dalam API xAI menjelang pertengahan Jun. Ia mengutamakan imej: muat naik imej pegun, huraikan gerakan, dan ia menganimasikan adegan dengan sumber sebagai bingkai pertama secara literal, menjana muzik, kesan bunyi dan dialog yang diselaraskan bibir dalam proses yang sama. Klip berdurasi sehingga 15 saat dan dirender dalam beberapa saat.