Realismbenchmark van Google DeepMind: beelden die voor echt doorgaan, met omgevingsgeluid en gesproken dialoog die in dezelfde pass worden gegenereerd. Typ hieronder een prompt en probeer het.
Ontwikkelaar
Google DeepMind
Type
Tekst / afbeelding naar video
Audio
Native, met dialoog
Duur
8 s per clip
Max. uitvoer
1080p
Rendertijd
1–3 min
Niveau hier
Betaalde credits
Ons oordeel in één regel: wanneer de clip moet doorgaan voor beeldmateriaal, render hem dan in Veo. Wanneer je nog aan het verkennen bent, maak dan eerst een concept op de snelle niveaus.
Veo is het model waaraan nieuwkomers worden afgemeten. Elk vlaggenschip dat deze zomer werd uitgebracht — Seedance 2.5, MiniMax H3, Wan 3.0, FLUX 3 — nam Veo op in zijn vergelijkingsgrafieken, omdat het de twee dingen bezit die het moeilijkst te faken zijn: fysiek realisme dat kritische beoordeling doorstaat, en een staat van dienst die langer is dan een lanceringsweek. Zijn native audio doet nog steeds wat de meeste rivalen niet kunnen: een geciteerde dialoogregel in de prompt komt gesproken terug, gesynchroniseerd met het gezicht.
Beoordeeld op basis van onze eigen renders en het gepubliceerde dossier, herzien naarmate de feiten veranderen — dat is een kenmerk van deze pagina, geen disclaimer.
• Fysiek realisme.
Licht kaatst terug, stof valt natuurlijk, vloeistoffen stromen als vloeistoffen. De minste “AI-sporen” van alles wat we hosten, en het standaardantwoord wanneer een klant nauwkeurig zal kijken.
• Native audio met dialoog.
Ambience, effecten en korte gesproken zinnen gesynchroniseerd met de actie. Schrijf het geluid in de prompt en het wordt gerenderd — geen scoring-pass.
• Naleving van de prompt.
Camera-aanwijzingen — dolly, pan, rack focus — worden opgevolgd, niet slechts als inspiratie gebruikt. Shotlist-prompts renderen hier meer dan waar dan ook.
• Bewezen staat van dienst.
Onafhankelijke ranglijsten, maanden productiegebruik, bekende faalmodi. In een zomer vol vlaggenschepen van een week oud is saaie betrouwbaarheid een functie.
• Limiet van 8 seconden.
De kortste clips in ons huidige aanbod — Seedance 2.5 bereikt 30 seconden, FLUX 3 twintig. Langere stukken betekenen koppelen en cuts plannen.
• Kosten en snelheid.
1–3 minuten per render tegen de hoogste creditkosten hier. Dit is het afwerkingsmodel, niet het schetsmodel.
• Strengste filters.
Publieke figuren, kinderen, geweld — geweigerd op modelniveau. Geblokkeerde taken verbruiken hier geen credits, maar reken erop dat je wat moet herformuleren.
• Gestileerde animatie.
Anime- en handgemaakte looks komen vreemd glanzend uit. FLUX 3 en Seedance gaan beter om met stilering.
Kopieer naar de generator hierboven, vervang de haakjes, render.
"Medium close-up van een [door weer en wind getekende visser] op een steiger bij zonsopgang, die net langs de camera kijkt. Hij zegt: 'De storm komt dit jaar vroeg.' Meeuwen in de verte, krakend touw. Bewolkt licht, documentairestijl."
Dialoog tussen aanhalingstekens genereert gesproken audio die met het gezicht is gesynchroniseerd. Houd regels onder ~10 woorden. De demo naast de generator is precies deze prompt.
"Langzame 180°-orbit rond een [matzwarte espressomachine] op een betonnen aanrecht. Stoom stijgt op; we horen het lage gesis van het stoompijpje en een zachte cafésfeer. Ochtendlicht door het raam, geringe scherptediepte, 35mm."
De audio in de prompt schrijven ('we horen...') is de Veo-specifieke zet — de helft van de waarde zit in die zin.
Uploaden: een stilstaand beeld
"Subtiele handheld-beweging, alsof het met een telefoon is gefilmd. [subject] ademt en verplaatst het gewicht op natuurlijke wijze; de achtergrond blijft vast. Zachte kamertoon, verkeer in de verte."
"Alsof het met een telefoon is gefilmd" verankert de fysica in realisme, en minimale bewegingsinstructies voorkomen dat gezichten verschuiven bij beeld-naar-video.
Drie native audiomodellen. Dezelfde prompts voor alle drie, beoordeeld op wat we zouden uitbrengen — deze tabel weerspiegelt die op de FLUX 3-pagina, dus de gegevens kloppen waar je ook terechtkomt. Alle drie selecteerbaar in de generator hierboven.
scherpere fysica, langere coherente beweging, betrouwbaardere dialoogsynchronisatie. De versie in de generator hierboven.
de release die van 'AI-video met geluid' een categorie maakte; de virale straatinterviewclips kwamen uit deze versie.
een solide stille video, grotendeels op onderzoek gericht. De audiosprong veranderde het van een demo in een hulpmiddel.
Het videogeneratiemodel van Google DeepMind — het sterkst in beelden die echt lijken, met audio die native samen met het beeld wordt gegenereerd: ambiance, effecten en korte dialogen. Werkt vanuit tekst of animeert een stilstaand beeld, tot 1080p, 8 seconden per clip.
De regisseur. Multi-shot storytelling tot 4K met Regisseursmodus.
De long take. Shots van 30 seconden, gemonteerd op je soundtrack.
De stylist. Keyframebediening en looks van cinematografisch tot stop-motion.