Le spécialiste image-en-vidéo de xAI : votre image fixe devient la première image — composition, lumière et identité préservées — tandis que la musique, les effets et le dialogue synchronisé sur les lèvres sont générés dans le même passage. Saisissez un prompt ci-dessous et essayez.
Développeur
xAI
Type
Priorité à l’image · aussi T2V
Durée
Jusqu’à 15 s
Sortie max.
720p (officiel)
Audio
Musique · SFX · synchronisation labiale, en un seul passage
Vitesse
Effectue le rendu en quelques secondes
Arène
#1 i2v au lancement (Elo 1473)
Notre verdict en une ligne : le choix pour transformer une image en vidéo. Lorsque le plan part d'une image fixe que vous avez déjà — une photo de produit, un portrait, une image — rien ici ne l'anime plus vite ni plus fidèlement.
Grok Imagine Video 1.5 est le modèle qui a décroché la couronne de l’image-vers-vidéo en juin : lancé à la fin du mois de mai, il a fait ses débuts à la première place de l’arène i2v participative avec 1473 Elo — un bond de 52 points par rapport à son prédécesseur, devant Seedance 2.0 et Veo. Son architecture explique sa spécialité : Aurora génère les images séquentiellement, chacune étant conditionnée par tout ce qui la précède, de sorte que votre image fixe importée — traitée comme la toute première image — conserve sa composition, son éclairage et l’identité du sujet au lieu de dériver. La musique, les effets sonores et les dialogues synchronisés sur les lèvres sont rendus dans la même passe, et les clips arrivent en quelques secondes plutôt qu’en minutes. Une précision avant de dépenser : il s’agit du modèle vidéo de xAI, pas du chatbot Grok — même marque, produit différent.
Évalué à partir de nos propres rendus et du dossier publié, révisé au fil de l’évolution des faits — c’est une caractéristique de cette page, pas une clause de non-responsabilité.
• Fidélité de l’image par architecture.
La source reste la première image, pas une référence libre — le conditionnement séquentiel d’Aurora conserve la composition, la lumière et l’identité tout au long du clip. La couronne de l’arène i2v a été remportée précisément grâce à cela.
• Audio en un seul passage, dialogues inclus.
La musique de fond, les effets sonores et la parole synchronisée sur les lèvres sont générés avec l’image. La synchronisation labiale est l’amélioration phare par rapport à la version 1.0 — un clip de tête parlante ne nécessite pas de second passage.
• Contrôle de prise horodaté.
Rédigez le prompt sous forme de timeline — '(0-5s) plan moyen... (5-10s) travelling avant...' — et les temps forts tombent là où vous les placez. Prompting par liste de plans, natif.
• La rapidité comme fonctionnalité de workflow.
Les rendus se terminent généralement en quelques secondes. Les boucles d’itération qui prennent des minutes ailleurs avancent ici au rythme d’une conversation — le multiplicateur de qualité le plus économique qui soit.
• 720p est le plafond officiel.
La propre gamme de xAI est en 720p (certaines passerelles exposent une résolution supérieure). Dans un domaine où les concurrents livrent du 1080p à la 4K, c’est la spécification qui met fin prématurément à certains briefs.
• Text-to-video est la moitié la plus faible.
Les propres recommandations de xAI : t2v est 'plus génératif et moins contrôlé' que le parcours image. Si vous n’avez pas d’image fixe de départ, les modèles phares prompt-first conviennent mieux.
• La taxe sur la confusion de marque.
Il partage son nom avec le chatbot Grok, mais c’est un produit distinct — le raisonnement du chatbot ne vous apprend rien sur ce modèle, ni dans un sens ni dans l’autre. Jugez-le sur ses rendus.
• Classement d’arène ≠ enregistrement de production.
L’Elo mesure la préférence du public sur les paires i2v, et le modèle date de plusieurs semaines. Considérez la couronne comme un signal fort, et non comme un verdict définitif.
Copiez dans le générateur ci-dessus, remplacez les crochets, effectuez le rendu.
Téléverser: la photo de votre produit
"(0-4s) la [bouteille] se tient dans la douce lumière de l’aube tandis que des particules de poussière flottent. (4-9s) lent rapprochement pendant qu’une lumière principale chaude monte progressivement depuis la gauche. (9-12s) se poser sur un gros plan alors que l’étiquette capte la lumière. Ambiance sonore calme, un doux carillon à la fin."
Les horodatages transforment le prompt en liste de plans, et l’architecture avec image fixe comme première image garde le produit exactement tel qu’il a été photographié. La démo à côté du générateur est ce prompt.
Téléverser: une photo portrait
"Elle lève les yeux de son carnet et dit, chaleureusement : 'Il m'a fallu des années pour apprendre ça.' Puis un léger sourire, retour à l'écriture. Ambiance de la pièce, crissement du crayon, pas de musique."
Le dialogue entre guillemets active la synchronisation labiale — la correction dont la génération 1.5 est la plus fière. Gardez les répliques courtes et laissez le prompt nommer l'action avant et après, afin que l'interprétation ait un point d'arrivée.
Générez un premier clip → Prolongez à partir de son image finale → "Continuer: la caméra continue de dériver vers la droite au-delà de la fenêtre; dehors, la pluie a commencé. La musique se prolonge sans raccord."
L’extension se base sur la toute dernière image, si bien que le mouvement, la lumière et l’audio se poursuivent au lieu d’être réinitialisés. Enchaînez deux ou trois extensions, et un plafond de 15 secondes devient discrètement une séquence de 40 secondes.
Le podium image-to-video selon le classement de l’arène de juin — le nouveau leader face aux deux qu’il a dépassés. Les mêmes images fixes et prompts pour les trois, évalués selon ce que nous mettrions en production. Tous les trois sont sélectionnables dans le générateur ci-dessus.
aperçu les 30–31 mai, débuts #1 dans i2v arena, GA dans l'xAI API d'ici la mi-juin sous le nom grok-imagine-video-1.5. Clips de 15 secondes, audio en une seule passe avec synchronisation labiale améliorée, extension et guidage par référence. La version dans le générateur ci-dessus.
la première sortie de 10 secondes qui a placé xAI sur la carte de la vidéo; le bond de 1.5 dans l'arène a été mesuré par rapport à elle.
Le backbone d’image autorégressif de xAI, dont la force de cohérence des personnages est la raison architecturale pour laquelle la gamme vidéo traite votre image fixe comme une vérité terrain.
Le modèle de génération vidéo de xAI — officiellement Grok Imagine Video 1.5, publié fin mai 2026 et disponible en version générale dans l’API xAI à la mi-juin. Il est conçu d’abord pour l’image : importez une image fixe, décrivez le mouvement, et il anime la scène en utilisant la source comme toute première image, tout en générant la musique, les effets sonores et les dialogues synchronisés sur les lèvres en une seule passe. Les clips durent jusqu’à 15 secondes et sont rendus en quelques secondes.