Tolok ukur realisme Google DeepMind: rekaman yang tampak nyata, dengan suara sekitar dan dialog lisan yang dihasilkan dalam satu proses yang sama. Ketik prompt di bawah dan coba.
Pengembang
Google DeepMind
Jenis
Teks / gambar ke video
Audio
Native, dengan dialog
Durasi
8 dtk per klip
Output maks.
1080p
Waktu render
1–3 menit
Tingkat di sini
Kredit berbayar
Putusan kami dalam satu baris: saat klip harus tampak seperti rekaman, render klip itu di Veo. Saat Anda masih bereksplorasi, buat draf terlebih dahulu di tier cepat.
Veo adalah model yang menjadi tolok ukur bagi para pendatang baru. Setiap model unggulan yang dirilis musim panas ini — Seedance 2.5, MiniMax H3, Wan 3.0, FLUX 3 — memasukkan Veo ke dalam bagan perbandingannya, karena ia memiliki dua hal yang paling sulit dipalsukan: realisme fisik yang tahan terhadap penilaian teliti, dan rekam jejak yang lebih panjang daripada minggu peluncuran. Audio bawaannya masih melakukan apa yang tidak bisa dilakukan sebagian besar pesaing: sebaris dialog yang dikutip dalam prompt kembali sebagai ucapan, tersinkron dengan wajah.
Dinilai berdasarkan render kami sendiri dan catatan yang diterbitkan, direvisi seiring berubahnya fakta — itu adalah fitur halaman ini, bukan penafian.
• Realisme fisik.
Cahaya memantul, kain jatuh menjuntai, cairan mengalir seperti cairan. Paling sedikit “tanda AI” dari semua yang kami hosting, dan jawaban default ketika klien akan melihat dengan saksama.
• Audio asli dengan dialog.
Ambiens, efek, dan dialog singkat yang disinkronkan dengan aksi. Tulis suara ke dalam prompt dan akan dirender — tanpa tahap scoring.
• Kepatuhan terhadap prompt.
Arahan kamera — dolly, pan, rack focus — diikuti, bukan sekadar dijadikan inspirasi. Prompt daftar shot paling terasa manfaatnya di sini dibandingkan di tempat lain.
• Rekam jejak yang terbukti.
Peringkat independen, berbulan-bulan penggunaan produksi, mode kegagalan yang diketahui. Di musim panas yang dipenuhi flagship berusia seminggu, keandalan yang membosankan adalah sebuah fitur.
• Batas 8 detik.
Klip terpendek dalam jajaran kami saat ini — Seedance 2.5 mencapai 30 detik, FLUX 3 dua puluh. Karya yang lebih panjang berarti merangkai dan merencanakan pemotongan.
• Biaya dan kecepatan.
1–3 menit per render dengan biaya kredit tertinggi di sini. Ini model penyelesaian akhir, bukan model sketsa.
• Filter paling ketat.
Tokoh publik, anak-anak, kekerasan — ditolak di tingkat model. Pekerjaan yang diblokir tidak menghabiskan kredit di sini, tetapi mungkin perlu sedikit penulisan ulang.
• Animasi bergaya.
Tampilan anime dan buatan tangan terlihat anehnya mengilap. FLUX 3 dan Seedance menangani stilisasi dengan lebih baik.
Salin ke generator di atas, ganti tanda kurung, render.
"Close-up sedang seorang [nelayan yang termakan cuaca] di dermaga saat fajar, memandang sedikit melewati kamera. Ia berkata: 'Badai datang lebih awal tahun ini.' Burung camar di kejauhan, tali berderit. Cahaya mendung, gaya dokumenter."
Dialog dalam tanda kutip menghasilkan audio ucapan yang disinkronkan dengan wajah. Jaga setiap baris di bawah ~10 kata. Demo di samping generator adalah prompt persis ini.
"Orbit 180° perlahan mengelilingi [mesin espresso hitam matte] di atas meja beton. Uap mengepul; kita mendengar desisan pelan dari steam wand dan suasana kafe yang lembut. Cahaya jendela pagi, kedalaman bidang dangkal, 35mm."
Menuliskan audio ke dalam prompt ('kita mendengar...') adalah langkah khas Veo — setengah nilainya ada dalam kalimat itu.
Unggah: gambar diam
"Gerakan handheld yang halus, seolah-olah direkam dengan ponsel. [subject] bernapas dan memindahkan berat badan secara alami; latar belakang tetap diam. Suasana ruangan yang hening, lalu lintas di kejauhan."
"Seolah-olah direkam dengan ponsel" membuat fisika terasa realistis, dan instruksi gerakan yang minimal mencegah wajah bergeser dalam konversi gambar ke video.
Tiga model yang native untuk audio. Prompt yang sama di ketiganya, dinilai berdasarkan apa yang akan kami rilis — tabel ini mencerminkan tabel di halaman FLUX 3, jadi datanya konsisten di mana pun Anda tiba. Ketiganya dapat dipilih di generator di atas.
fisika yang lebih tajam, gerakan koheren yang lebih lama, sinkronisasi dialog yang lebih andal. Versi di generator di atas.
rilis yang menjadikan 'video AI dengan suara' sebuah kategori; klip wawancara jalanan yang viral berasal dari versi ini.
video senyap yang solid, sebagian besar ditujukan untuk riset. Lompatan audio mengubahnya dari demo menjadi alat.
Model pembuatan video Google DeepMind — paling kuat untuk footage yang terlihat nyata, dengan audio yang dihasilkan secara native bersama gambar: ambience, efek, dan dialog singkat. Bekerja dari teks atau menganimasikan gambar diam, hingga 1080p, 8 detik per klip.
Sutradara. Penceritaan multi-shot hingga 4K dengan Mode Sutradara.
Long take. Shot 30 detik yang dipotong mengikuti soundtrack Anda.
Penata gaya. Kontrol keyframe dan tampilan dari sinematik hingga stop-motion.