Generator Video AI Grok Imagine 1.5

Spesialis gambar-ke-video xAI: gambar diam Anda menjadi frame pertama — komposisi, cahaya, dan identitas dipertahankan — dengan musik, efek, dan dialog tersinkron bibir yang dihasilkan dalam proses yang sama. Ketik prompt di bawah dan coba.

Model
Gambar: 0/1
Unggah gambar frame awal
(JPG, JPEG, PNG, WEBP, maks. 30 MB)
Prompt
0/5000
Sampel Video
 

Pengembang

xAI

Jenis

Gambar dahulu · juga T2V

Durasi

Hingga 15 dtk

Output maks

720p (resmi)

Audio

Musik · SFX · sinkronisasi bibir, sekali proses

Kecepatan

Merender dalam hitungan detik

Arena

#1 i2v saat peluncuran (Elo 1473)

Putusan satu baris kami: pilihan untuk gambar-ke-video. Saat shot dimulai dari gambar diam yang sudah Anda miliki — foto produk, potret, frame — tidak ada di sini yang menganimasikannya lebih cepat atau lebih akurat.

Grok Imagine Video 1.5 adalah model yang merebut mahkota image-to-video pada bulan Juni: diluncurkan pada akhir Mei, model ini memulai debutnya di peringkat #1 pada arena i2v berbasis urun daya dengan 1473 Elo — lonjakan 52 poin dibanding pendahulunya, melampaui Seedance 2.0 dan Veo. Arsitekturnya menjelaskan spesialisasinya: Aurora menghasilkan frame secara berurutan, masing-masing dikondisikan pada semua yang muncul sebelumnya, sehingga gambar diam yang Anda unggah — diperlakukan sebagai frame pertama secara harfiah — mempertahankan komposisi, pencahayaan, dan identitas subjeknya alih-alih bergeser. Musik, efek suara, dan dialog yang tersinkronisasi dengan gerak bibir dirender dalam proses yang sama, dan klip selesai dalam hitungan detik, bukan menit. Satu klarifikasi sebelum Anda membayar: ini adalah model video xAI, bukan chatbot Grok — merek yang sama, produk yang berbeda.

Pandangan jujur

Di mana Grok Imagine 1.5 unggul — dan di mana tidak

Dinilai berdasarkan render kami sendiri dan catatan yang dipublikasikan, direvisi seiring perubahan fakta — itu adalah fitur halaman ini, bukan penafian.

Benar-benar kuat

  • • Fidelitas gambar berdasarkan arsitektur.

    Sumbernya masih frame pertama, bukan referensi lepas — pengondisian berurutan Aurora mempertahankan komposisi, cahaya, dan identitas sepanjang klip. Mahkota arena i2v dimenangkan tepat karena hal ini.

  • • Audio sekali proses, dialog disertakan.

    Musik latar, efek suara, dan ucapan yang disinkronkan dengan gerak bibir dibuat bersama gambar. Sinkronisasi bibir adalah peningkatan utama dibandingkan 1.0 — klip kepala berbicara tidak memerlukan proses kedua.

  • • Kontrol bidikan dengan stempel waktu.

    Tulis prompt sebagai linimasa — '(0-5s) bidikan medium... (5-10s) push-in...' — dan beat akan terjadi di tempat Anda meletakkannya. Prompting daftar bidikan, bawaan.

  • • Kecepatan sebagai fitur alur kerja.

    Render biasanya selesai dalam hitungan detik. Putaran iterasi yang memakan waktu beberapa menit di tempat lain berjalan dengan tempo percakapan di sini — pengganda kualitas termurah yang ada.

Batasan yang diketahui

  • • 720p adalah batas resmi.

    Lini xAI sendiri adalah 720p (beberapa gateway mengekspos resolusi yang lebih tinggi). Di bidang di mana para pesaing menghadirkan 1080p hingga 4K, inilah spesifikasi yang membuat beberapa brief berakhir lebih awal.

  • • Text-to-video adalah separuh yang lebih lemah.

    Panduan xAI sendiri: t2v 'lebih generatif dan kurang terkontrol' dibandingkan jalur gambar. Jika Anda tidak memiliki gambar diam awal, flagship prompt-first lebih cocok.

  • • Pajak kebingungan merek.

    Ini memiliki nama yang sama dengan chatbot Grok, tetapi merupakan produk terpisah — penalaran chatbot tidak memberi tahu Anda apa pun tentang model ini, ke arah mana pun. Nilailah berdasarkan hasil render.

  • • Peringkat arena ≠ catatan produksi.

    Elo mengukur preferensi pengguna pada pasangan i2v, dan model ini sudah berusia beberapa minggu. Anggap mahkota sebagai sinyal kuat, bukan putusan final.

Resep prompt

Tiga prompt yang tampilkan kegunaannya

Salin ke generator di atas, tukar tanda kurung, render.

Gambar diam produk, dihidupkan

Unggah: foto produk Anda

"(0-4s) [botol] berdiri dalam cahaya fajar yang lembut saat partikel debu melayang. (4-9s) dorongan masuk perlahan sementara cahaya utama yang hangat perlahan menyala dari kiri. (9-12s) berhenti pada close-up saat label menangkap cahaya. Musik latar ambient yang tenang, satu denting lembut di akhir."

Mengapa ini berhasil

Stempel waktu mengubah prompt menjadi daftar shot, dan arsitektur gambar diam sebagai frame pertama menjaga produk tetap persis seperti saat difoto. Demo di samping generator adalah prompt ini.

Potret yang berbicara

Unggah: foto potret

"Dia menengadah dari buku catatan dan berkata dengan hangat: 'Butuh bertahun-tahun bagiku untuk mempelajari yang satu ini.' Lalu senyum kecil, kembali menulis. Suasana ruangan, goresan pensil, tanpa musik."

Mengapa ini berhasil

Dialog dalam tanda kutip mengaktifkan sinkronisasi bibir — perbaikan yang paling dibanggakan generasi 1.5. Buat baris tetap pendek dan biarkan prompt menyebutkan tindakan sebelum dan sesudahnya agar penyampaian punya titik pendaratan.

Urutan berantai

Buat klip pertama → Perpanjang dari bingkai terakhirnya → "Lanjutkan: kamera terus bergeser ke kanan melewati jendela; di luar, hujan sudah mulai turun. Musik berlanjut tanpa jeda."

Mengapa ini berhasil

Ekstensi menggunakan frame terakhir yang persis sebagai acuan, sehingga gerakan, cahaya, dan audio berlanjut alih-alih direset. Rangkai dua atau tiga ekstensi dan batas 15 detik diam-diam menjadi urutan 40 detik.

Head to head

Grok Imagine 1.5 vs Seedance 2.0 vs Veo

Podium image-to-video sebagaimana diperingkat oleh arena Juni — pemimpin baru melawan dua yang berhasil dilewatinya. Gambar diam dan prompt yang sama di ketiganya, dinilai berdasarkan apa yang akan kami rilis. Ketiganya dapat dipilih di generator di atas.

JobGrok Imagine 1.5Seedance 2.0Veo
peringkat arena i2v saat peluncurannya #1 (Elo 1473) Lulus Lulus
Kesetiaan gambar sumber Terbaik — gambar diam adalah bingkai pertama Baik Baik
Kecepatan render Detik Menit 1–3 menit
Audio sekali proses Musik + SFX + sinkronisasi bibir Audio asli Suasana + dialog
Kontrol pengambilan gambar bertanda waktu Sintaks native Tidak Tidak
Resolusi maks. 720p resmi 1080p + pipeline resolusi tinggi 1080p
Realisme dalam sorotan Baik Baik Terbaik
Rekam jejak yang terbukti Minggu Era arena, bulan Ditetapkan
Riwayat versi

Bagaimana ini sampai di sini

Jun 2026 · Saat ini

Grok Imagine Video 1.5

pratinjau 30–31 Mei, debut #1 di i2v arena, GA di xAI API pada pertengahan Juni sebagai grok-imagine-video-1.5. Klip 15 detik, audio satu lintasan dengan sinkronisasi bibir yang ditingkatkan, ekstensi dan panduan referensi. Versi di generator di atas.

Lebih awal pada 2026

Grok Imagine Video 1.0

rilis pertama 10 detik yang menempatkan xAI di peta video; lompatan arena 1.5 diukur terhadapnya.

Asal

Aurora

Backbone gambar autoregresif xAI, yang kekuatan konsistensi karakternya menjadi alasan arsitektural lini video memperlakukan gambar diam Anda sebagai kebenaran acuan.

Pertanyaan Umum

Pertanyaan tentang Grok Imagine 1.5, dijawab langsung

1. Apa itu Grok Imagine 1.5?

Model pembuatan video xAI — secara resmi Grok Imagine Video 1.5, dirilis pada akhir Mei 2026 dan tersedia secara umum (GA) di API xAI pada pertengahan Juni. Model ini mengutamakan gambar: unggah gambar diam, jelaskan gerakannya, dan model ini akan menganimasikan adegan dengan sumber tersebut sebagai frame pertama secara harfiah, menghasilkan musik, efek suara, dan dialog yang disinkronkan dengan gerakan bibir dalam satu proses yang sama. Klip berdurasi hingga 15 detik dan dirender dalam hitungan detik.