Google DeepMinds realismbenchmark: filmklipp som passerar som äkta, med omgivningsljud och talad dialog genererade i samma körning. Skriv en prompt nedan och prova.
Utvecklare
Google DeepMind
Typ
Text / bild till video
Ljud
Inbyggt, med dialog
Varaktighet
8 s per klipp
Max utdata
1080p
Renderingstid
1–3 min
Nivå här
Betalda krediter
Vårt omdöme i en rad: när klippet måste kunna passera som filmat material, rendera det i Veo. När du fortfarande utforskar, gör först ett utkast på de snabba nivåerna.
Veo är modellen som nykomlingarna mäts mot. Varje flaggskepp som släpptes i somras — Seedance 2.5, MiniMax H3, Wan 3.0, FLUX 3 — tog med Veo i sina jämförelsediagram, eftersom den har de två saker som är svårast att fejka: fysisk realism som håller för granskning och en meritlista som är längre än en lanseringsvecka. Dess inbyggda ljud gör fortfarande det som de flesta rivaler inte kan: en citerad dialograd i prompten kommer tillbaka uppläst, synkroniserad med ansiktet.
Bedömt utifrån våra egna renderingar och den publicerade dokumentationen, revideras i takt med att fakta förändras — det är en funktion på den här sidan, inte en ansvarsfriskrivning.
• Fysisk realism.
Ljuset studsar, tyger faller naturligt, vätskor hälls som vätskor. Minst “AI-avslöjanden” av allt vi hostar, och standardsvaret när en kund kommer att titta noga.
• Inbyggt ljud med dialog.
Ambiens, effekter och korta talade repliker synkade med handlingen. Skriv in ljudet i prompten så renderas det — ingen scoring-passering.
• Följsamhet till prompten.
Kamerainstruktioner — dolly, panorering, rack focus — följs, inte bara används som inspiration. Shotlist-prompter ger mer utdelning här än någon annanstans.
• Dokumenterad meritlista.
Oberoende rankningar, månader av produktionsanvändning, kända fellägen. I en sommar av veckogamla flaggskepp är tråkig tillförlitlighet en funktion.
• Gräns på 8 sekunder.
De kortaste klippen i vårt nuvarande utbud — Seedance 2.5 når 30 sekunder, FLUX 3 tjugo. Längre stycken innebär kedjning och planering av klipp.
• Kostnad och hastighet.
1–3 minuter per rendering till den högsta kreditkostnaden här. Det är modellen för finputsning, inte skissmodellen.
• Strängaste filtren.
Offentliga personer, barn, våld — avvisas på modellnivå. Blockerade jobb förbrukar inga krediter här, men räkna med att behöva formulera om lite.
• Stiliserad animation.
Anime- och handgjorda stilar blir märkligt glansiga. FLUX 3 och Seedance hanterar stilisering bättre.
Kopiera till generatorn ovan, byt ut parenteserna, rendera.
"Medelnärbild av en [väderbiten fiskare] på en brygga i gryningen, som tittar precis förbi kameran. Han säger: 'Stormen kommer tidigt i år.' Måsar i fjärran, rep som knarrar. Mulet ljus, dokumentär stil."
Dialog inom citattecken genererar talat ljud synkat med ansiktet. Håll raderna under ~10 ord. Demon bredvid generatorn är exakt denna prompt.
"Långsam 180°-orbit runt en [mattsvart espressomaskin] på en betongbänk. Ånga stiger; vi hör det låga väsandet från ångröret och en mjuk kaféatmosfär. Morgonljus från fönster, kort skärpedjup, 35mm."
Att skriva in ljudet i prompten ('vi hör...') är det Veo-specifika draget — halva värdet ligger i den meningen.
Ladda upp: en stillbild
"Subtil handhållen rörelse, som om det filmats med en telefon. [subject] andas och förskjuter vikten naturligt; bakgrunden förblir fixerad. Tyst rumston, avlägsen trafik."
"Som om det filmats med en telefon" förankrar fysiken i realism, och minimala rörelseinstruktioner hindrar ansikten från att glida iväg vid bild-till-video.
Tre modeller byggda för ljud från grunden. Samma prompter i alla tre, bedömda utifrån vad vi skulle lansera — den här tabellen speglar den på FLUX 3-sidan, så datan stämmer oavsett var du hamnar. Alla tre kan väljas i generatorn ovan.
skarpare fysik, längre sammanhängande rörelse, mer tillförlitlig dialogsynkronisering. Versionen i generatorn ovan.
versionen som gjorde 'AI-video med ljud' till en kategori; de virala gatintervjuklippen kom från den här versionen.
en solid tyst video, till stor del inriktad på forskning. Ljudsprånget förvandlade den från en demo till ett verktyg.
Google DeepMinds videogenereringsmodell — starkast på filmklipp som upplevs som verkliga, med ljud som genereras inbyggt tillsammans med bilden: atmosfär, effekter och kort dialog. Fungerar från text eller animerar en stillbild, upp till 1080p, 8 sekunder per klipp.
Regissören. Berättande med flera tagningar upp till 4K med Regissörsläge.
Den långa tagningen. 30-sekundersklipp klippta till ditt soundtrack.
Stylisten. Keyframe-kontroll och looks från filmiskt till stop-motion.