Penanda aras realisme Google DeepMind: rakaman yang kelihatan seperti sebenar, dengan bunyi persekitaran dan dialog lisan yang dijana dalam laluan yang sama. Taipkan prompt di bawah dan cubalah.
Pembangun
Google DeepMind
Jenis
Teks / imej kepada video
Audio
Asli, dengan dialog
Tempoh
8 s setiap klip
Output maks.
1080p
Masa pemaparan
1–3 min
Tahap di sini
Kredit berbayar
Keputusan kami dalam satu baris: apabila klip perlu kelihatan seperti rakaman, renderkannya di Veo. Apabila anda masih meneroka, drafkan dahulu pada tier pantas.
Veo ialah model yang menjadi ukuran bagi pendatang baharu. Setiap model utama yang dilancarkan pada musim panas ini — Seedance 2.5, MiniMax H3, Wan 3.0, FLUX 3 — memasukkan Veo dalam carta perbandingannya, kerana ia memiliki dua perkara yang paling sukar untuk dipalsukan: realisme fizikal yang tahan diteliti, dan rekod pencapaian yang lebih panjang daripada minggu pelancaran. Audio natifnya masih melakukan perkara yang tidak mampu dilakukan oleh kebanyakan pesaing: satu baris dialog yang dipetik dalam prompt kembali sebagai ucapan, disegerakkan dengan wajah.
Dinilai berdasarkan render kami sendiri dan rekod yang diterbitkan, disemak apabila fakta berubah — itu ialah ciri halaman ini, bukan penafian.
• Realisme fizikal.
Cahaya memantul, fabrik melangsir, cecair mengalir seperti cecair. Paling sedikit “tanda AI” antara semua yang kami hoskan, dan jawapan lalai apabila pelanggan akan melihat dengan teliti.
• Audio asli dengan dialog.
Suasana, kesan bunyi dan baris pertuturan pendek yang disegerakkan dengan aksi. Tulis bunyi dalam prompt dan ia dirender — tiada peringkat pemarkahan muzik.
• Pematuhan prompt.
Arahan kamera — dolly, pan, rack focus — diikuti, bukan sekadar dijadikan inspirasi. Prompt senarai syot paling berbaloi di sini berbanding di mana-mana tempat lain.
• Rekod prestasi yang terbukti.
Kedudukan bebas, berbulan-bulan penggunaan produksi, mod kegagalan yang diketahui. Dalam musim panas yang dipenuhi flagship berusia seminggu, kebolehpercayaan yang membosankan ialah satu ciri.
• Had 8 saat.
Klip terpendek dalam barisan semasa kami — Seedance 2.5 mencapai 30 saat, FLUX 3 dua puluh. Karya yang lebih panjang bermakna perlu merangkaikan dan merancang potongan.
• Kos dan kelajuan.
1–3 minit bagi setiap render pada kos kredit tertinggi di sini. Ini model kemasan, bukan model lakaran.
• Penapis paling ketat.
Tokoh awam, kanak-kanak, keganasan — ditolak pada peringkat model. Tugas yang disekat tidak menggunakan kredit di sini, tetapi jangkakan perlu mengolah semula sedikit.
• Animasi bergaya.
Gaya anime dan buatan tangan kelihatan pelik berkilat. FLUX 3 dan Seedance mengendalikan penggayaan dengan lebih baik.
Salin ke dalam penjana di atas, tukar tanda kurung, render.
"Syot dekat sederhana seorang [nelayan yang dimamah cuaca] di jeti pada waktu subuh, memandang sedikit melepasi kamera. Dia berkata: 'Ribut datang awal tahun ini.' Burung camar di kejauhan, tali berkeriut. Cahaya mendung, gaya dokumentari."
Dialog dalam tanda petik menjana audio pertuturan yang disegerakkan dengan wajah. Pastikan setiap baris di bawah ~10 perkataan. Demo di sebelah penjana ialah prompt tepat ini.
"Orbit 180° yang perlahan mengelilingi sebuah [mesin espresso hitam matte] di atas kaunter konkrit. Wap naik; kita mendengar desisan rendah wand stim dan suasana kafe yang lembut. Cahaya tingkap pagi, kedalaman medan yang cetek, 35mm."
Menulis audio ke dalam prompt ('kita dengar...') ialah langkah khusus Veo — separuh nilainya ada dalam ayat itu.
Muat naik: imej pegun
"Pergerakan genggam yang halus, seolah-olah dirakam menggunakan telefon. [subject] bernafas dan mengalihkan berat badan secara semula jadi; latar belakang kekal tetap. Bunyi bilik yang senyap, trafik jauh."
"Seolah-olah dirakam dengan telefon" menjadikan fizik lebih realistik, dan arahan gerakan yang minimum menghalang wajah daripada berubah kedudukan dalam penukaran imej kepada video.
Tiga model natif audio. Prompt yang sama merentas ketiga-tiganya, dinilai berdasarkan apa yang akan kami keluarkan — jadual ini mencerminkan jadual pada halaman FLUX 3, jadi data adalah konsisten di mana sahaja anda tiba. Ketiga-tiganya boleh dipilih dalam penjana di atas.
fizik yang lebih tajam, pergerakan koheren yang lebih panjang, penyegerakan dialog yang lebih boleh dipercayai. Versi dalam penjana di atas.
keluaran yang menjadikan 'video AI dengan bunyi' satu kategori; klip temu bual jalanan yang tular adalah daripada versi ini.
video senyap yang kukuh, sebahagian besarnya ditujukan kepada penyelidikan. Lonjakan audio mengubahnya daripada demo menjadi alat.
Model penjanaan video Google DeepMind — paling kuat untuk rakaman yang kelihatan nyata, dengan audio dijana secara natif bersama gambar: suasana, kesan dan dialog pendek. Berfungsi daripada teks atau menganimasikan imej pegun, sehingga 1080p, 8 saat setiap klip.
Pengarah. Penceritaan berbilang syot sehingga 4K dengan Mod Pengarah.
Rakaman panjang. Syot 30 saat dipotong mengikut runut bunyi anda.
Penggaya. Kawalan keyframe dan gaya daripada sinematik hingga stop-motion.