Benchmark de réalisme de Google DeepMind : des séquences qui passent pour réelles, avec son ambiant et dialogues parlés générés dans le même passage. Saisissez un prompt ci-dessous et essayez.
Développeur
Google DeepMind
Type
Texte / image en vidéo
Audio
Natif, avec dialogue
Durée
8 s par clip
Sortie max
1080p
Temps de rendu
1–3 min
Niveau ici
Crédits payants
Notre verdict en une ligne : quand le clip doit passer pour du métrage, effectuez son rendu sur Veo. Quand vous êtes encore en phase d’exploration, faites d’abord une ébauche sur les niveaux rapides.
Veo est le modèle auquel les nouveaux venus sont mesurés. Chaque modèle phare sorti cet été — Seedance 2.5, MiniMax H3, Wan 3.0, FLUX 3 — a inclus Veo dans ses graphiques comparatifs, parce qu'il possède les deux choses les plus difficiles à simuler : un réalisme physique qui résiste à l'examen, et un historique plus long qu'une semaine de lancement. Son audio natif fait encore ce que la plupart des rivaux ne peuvent pas faire : une réplique de dialogue entre guillemets dans le prompt revient prononcée, synchronisée avec le visage.
Évalué à partir de nos propres rendus et du dossier publié, révisé au gré de l’évolution des faits — c’est une caractéristique de cette page, pas une clause de non-responsabilité.
• Réalisme physique.
La lumière rebondit, les tissus tombent naturellement, les liquides s’écoulent comme des liquides. Le moins de « signes d’AI » parmi tout ce que nous hébergeons, et la réponse par défaut lorsqu’un client examinera de près.
• Audio natif avec dialogue.
Ambiance, effets et courtes répliques synchronisés avec l’action. Écrivez le son dans le prompt et il est rendu — pas de passe de scoring.
• Respect du prompt.
Les consignes de caméra — travelling, panoramique, bascule de point — sont suivies, pas seulement utilisées comme source d'inspiration. Les prompts de shot-list portent leurs fruits ici plus que partout ailleurs.
• Des résultats éprouvés.
Classements indépendants, des mois d'utilisation en production, modes de défaillance connus. Dans un été de modèles phares vieux d'une semaine, la fiabilité ennuyeuse est une fonctionnalité.
• Plafond de 8 secondes.
Les clips les plus courts de notre gamme actuelle — Seedance 2.5 atteint 30 secondes, FLUX 3 vingt. Les pièces plus longues impliquent d’enchaîner et de planifier les coupes.
• Coût et vitesse.
1–3 minutes par rendu au coût en crédits le plus élevé ici. C’est le modèle de finition, pas le modèle d’esquisse.
• Filtres les plus stricts.
Personnalités publiques, enfants, violence — refusés au niveau du modèle. Les tâches bloquées ne consomment pas de crédits ici, mais attendez-vous à devoir reformuler.
• Animation stylisée.
Les styles anime et faits main ressortent avec un brillant étrange. FLUX 3 et Seedance gèrent mieux la stylisation.
Copiez dans le générateur ci-dessus, remplacez les crochets, effectuez le rendu.
"Plan rapproché taille d'un [pêcheur buriné] sur un quai à l'aube, regardant juste au-delà de la caméra. Il dit: 'La tempête arrive tôt cette année.' Des mouettes au loin, une corde qui grince. Lumière couverte, style documentaire."
Le dialogue entre guillemets génère un audio parlé synchronisé avec le visage. Gardez les lignes sous ~10 mots. La démo à côté du générateur est exactement ce prompt.
"Lent orbit à 180° autour d’une [machine à espresso noir mat] sur un comptoir en béton. La vapeur s’élève ; on entend le léger sifflement de la buse vapeur et une douce ambiance de café. Lumière matinale de fenêtre, faible profondeur de champ, 35mm."
Écrire l’audio dans le prompt ('on entend...') est le geste spécifique à Veo — la moitié de la valeur se trouve dans cette phrase.
Téléverser: une image fixe
"Léger mouvement à main levée, comme si c’était filmé avec un téléphone. [subject] respire et déplace naturellement son poids; l’arrière-plan reste fixe. Ambiance sonore calme de la pièce, circulation lointaine."
« Comme si c’était filmé avec un téléphone » ancre la physique dans le réalisme, et des instructions de mouvement minimales empêchent les visages de dériver lors de la conversion d’image en vidéo.
Trois modèles natifs audio. Mêmes prompts pour les trois, évalués selon ce que nous mettrions en production — ce tableau reflète celui de la page FLUX 3, donc les données concordent où que vous arriviez. Tous les trois sont sélectionnables dans le générateur ci-dessus.
physique plus précise, mouvement cohérent plus long, synchronisation des dialogues plus fiable. La version dans le générateur ci-dessus.
la version qui a fait de 'vidéo IA avec son' une catégorie; les clips viraux d’interviews de rue provenaient de cette version.
une vidéo silencieuse solide, largement destinée à la recherche. Le bond audio l’a fait passer de démo à outil.
Le modèle de génération vidéo de Google DeepMind — le plus performant pour des séquences qui paraissent réelles, avec un audio généré nativement en même temps que l'image : ambiance, effets et courts dialogues. Fonctionne à partir de texte ou anime une image fixe, jusqu'à 1080p, 8 secondes par clip.
Le réalisateur. Storytelling multi-plans jusqu’en 4K avec le Mode réalisateur.
Le plan-séquence. Des prises de 30 secondes montées sur votre bande-son.
Le styliste. Contrôle des images clés et looks du cinématographique au stop-motion.