Benchmark ng realism ng Google DeepMind: footage na mukhang tunay, na may ambient sound at binigkas na dialogue na nabuo sa parehong pass. Mag-type ng prompt sa ibaba at subukan ito.
Developer
Google DeepMind
Uri
Teksto / larawan tungo sa video
Audio
Native, may diyalogo
Tagal
8 s bawat clip
Max na output
1080p
Oras ng pag-render
1–3 min
Antas dito
Mga bayad na credit
Ang aming hatol sa isang linya: kapag kailangang magmukhang totoong footage ang clip, i-render ito sa Veo. Kapag nag-e-explore ka pa, mag-draft muna sa mga fast tier.
Veo ang modelong pinagbabatayan ng pagsukat sa mga bagong dating. Bawat flagship na inilabas ngayong tag-init — Seedance 2.5, MiniMax H3, Wan 3.0, FLUX 3 — ay isinama ang Veo sa mga chart ng paghahambing nito, dahil taglay nito ang dalawang bagay na pinakamahirap pekein: pisikal na realismong nakatatagal sa masusing pagsusuri, at track record na mas mahaba kaysa sa linggo ng paglulunsad. Ginagawa pa rin ng native audio nito ang hindi kaya ng karamihan sa mga karibal: ang isang linyang diyalogo na naka-quote sa prompt ay bumabalik na binibigkas, naka-sync sa mukha.
Hinuhusgahan batay sa sarili naming mga render at sa inilathalang tala, nire-rebisa habang nagbabago ang mga katotohanan — tampok ito ng pahinang ito, hindi isang pagtatanggi sa pananagutan.
• Pisikal na realismo.
Tumatama ang liwanag, natural na bumabagsak ang tela, at bumubuhos ang mga likido na parang tunay na likido. Pinakakaunti ang “palatandaan ng AI” sa lahat ng hina-host namin, at ito ang default na sagot kapag masusing titingnan ng kliyente.
• Katutubong audio na may diyalogo.
Ambience, mga effect, at maiikling linyang binibigkas na naka-sync sa aksyon. Isulat ang tunog sa prompt at ire-render ito — walang scoring pass.
• Pagsunod sa prompt.
Ang mga direksyon ng camera — dolly, pan, rack focus — ay sinusunod, hindi basta pinaghuhugutan lang ng inspirasyon. Mas sulit dito kaysa kahit saan ang mga prompt na may shot list.
• Napatunayang track record.
Mga independiyenteng ranggo, mga buwang paggamit sa production, mga kilalang mode ng pagkabigo. Sa isang tag-init na puno ng mga flagship na isang linggo pa lang, ang nakakabagot na pagiging maaasahan ay isang feature.
• Limitasyon na 8 segundo.
Ang pinakamaikling clips sa kasalukuyan naming lineup — Seedance 2.5 ay umaabot sa 30 segundo, FLUX 3 sa dalawampu. Ang mas mahahabang piyesa ay nangangahulugan ng pagdugtong at pagpaplano ng mga cut.
• Gastos at bilis.
1–3 minuto bawat render sa pinakamataas na gastos sa credit dito. Ito ang modelong pang-finalize, hindi ang modelong pang-sketch.
• Pinakamahigpit na mga filter.
Mga pampublikong personalidad, mga bata, karahasan — tinatanggihan sa antas ng modelo. Hindi nakakabawas ng credits dito ang mga na-block na job, pero asahan na kakailanganin ng kaunting pagbabago sa mga salita.
• Istilisadong animasyon.
Ang mga hitsurang anime at handmade ay lumalabas na kakaibang makintab. Mas mahusay ang FLUX 3 at Seedance sa stylization.
Kopyahin sa generator sa itaas, palitan ang mga bracket, i-render.
"Katamtamang close-up ng isang [mangingisdang hinubog ng panahon] sa pantalan sa madaling-araw, nakatingin nang bahagya lampas sa kamera. Sabi niya: 'Maagang darating ang bagyo ngayong taon.' Mga seagull sa malayo, kumakaluskos na lubid. Maulap na liwanag, istilong dokumentaryo."
Ang dayalog na nasa panipi ay gumagawa ng sinasalitang audio na naka-sync sa mukha. Panatilihing mas mababa sa ~10 salita ang bawat linya. Ang demo sa tabi ng generator ay ang eksaktong prompt na ito.
"Mabagal na 180° na pag-ikot sa paligid ng isang [matte black na espresso machine] sa konkretong counter. Umaakyat ang singaw; naririnig natin ang mahinang pagsirit ng steam wand at malambot na ambience ng café. Liwanag ng bintana sa umaga, mababaw na depth of field, 35mm."
Ang pagsulat ng audio sa prompt ('naririnig natin...') ay ang galaw na partikular sa Veo — kalahati ng halaga ay nasa pangungusap na iyon.
I-upload: isang still image
"Banayad na handheld na galaw, na para bang kinunan sa telepono. Humihinga ang [subject] at natural na inililipat ang bigat; nananatiling nakapirmi ang likuran. Tahimik na tunog ng silid, malayong trapiko."
"Parang kinunan gamit ang telepono" ay nagpapakatotoo sa physics, at ang kaunting tagubilin sa galaw ay pumipigil sa paglihis ng mga mukha sa image-to-video.
Tatlong audio-native na modelo. Parehong prompts sa lahat ng tatlo, hinusgahan batay sa kung ano ang ilalabas namin — ginagaya ng talahanayang ito ang nasa pahina ng FLUX 3, kaya tugma ang data saan ka man mapunta. Mapipili ang lahat ng tatlo sa generator sa itaas.
mas matalas na physics, mas mahabang magkakaugnay na galaw, mas maaasahang pag-sync ng diyalogo. Ang bersyon sa generator sa itaas.
ang release na ginawang kategorya ang 'AI video na may tunog'; ang mga viral na clip ng street interview ay mula sa bersyong ito.
solid na tahimik na video, higit na nakatuon sa pananaliksik. Ang malaking pag-angat ng audio ang nagpabago rito mula demo tungo sa kasangkapan.
Ang video generation model ng Google DeepMind — ang pinakamalakas sa footage na mukhang tunay, na may audio na native na nalilikha kasabay ng larawan: ambience, effects, at maiikling dialogue. Gumagana mula sa text o nag-a-animate ng still image, hanggang 1080p, 8 segundo bawat clip.
Ang direktor. Multi-shot na pagkukuwento hanggang 4K gamit ang Director Mode.
Ang long take. Mga 30-segundong kuha na pinutol ayon sa iyong soundtrack.
Ang stylist. Kontrol ng keyframe at mga look mula cinematic hanggang stop-motion.