Google DeepMind'in gerçekçilik ölçütü: gerçekmiş gibi görünen, ortam sesi ve konuşulan diyalogların aynı geçişte oluşturulduğu görüntüler. Aşağıya bir prompt yazın ve deneyin.
Geliştirici
Google DeepMind
Tür
Metinden / görselden videoya
Ses
Yerel, diyaloglu
Süre
Klip başına 8 sn
Maks. çıktı
1080p
İşleme süresi
1–3 dk
Kademe burada
Ücretli krediler
Tek cümlelik değerlendirmemiz: klip gerçek çekim gibi görünmek zorundaysa, onu Veo üzerinde render edin. Hâlâ keşif aşamasındaysanız, önce hızlı katmanlarda taslak oluşturun.
Veo, yeni gelenlerin kendilerini kıyaslattığı modeldir. Bu yaz piyasaya çıkan her amiral gemisi — Seedance 2.5, MiniMax H3, Wan 3.0, FLUX 3 — Veo'yu karşılaştırma tablolarına koydu; çünkü taklit edilmesi en zor iki şeye sahip: incelemeye dayanan fiziksel gerçekçilik ve lansman haftasından daha uzun bir geçmiş performans. Yerel sesi hâlâ çoğu rakibin yapamadığını yapıyor: Promptta tırnak içine alınmış bir diyalog satırı, yüzle senkronize şekilde konuşulmuş olarak geri geliyor.
Kendi renderlarımız ve yayımlanmış kayıt temel alınarak değerlendirildi, olgular değiştikçe revize edilir — bu, bu sayfanın bir özelliğidir, bir sorumluluk reddi değildir.
• Fiziksel gerçekçilik.
Işık yansır, kumaş doğal biçimde dökülür, sıvılar sıvı gibi akar. Barındırdığımız her şey içinde en az “AI belirtisi” olan seçenek ve bir müşteri yakından bakacaksa varsayılan yanıt.
• Diyaloglu yerel ses.
Aksiyona senkronize ambiyans, efektler ve kısa konuşma satırları. Sesi prompt’a yazın, işlenir — müziklendirme geçişi yok.
• İsteme uyumu.
Kamera yönergeleri — dolly, pan, rack focus — yalnızca ilham kaynağı olmakla kalmaz, birebir uygulanır. Çekim listesi istemleri burada her yerden daha çok karşılığını verir.
• Kanıtlanmış başarı geçmişi.
Bağımsız sıralamalar, aylarca üretim ortamında kullanım, bilinen hata modları. Bir haftalık amiral gemileriyle dolu bir yazda, sıkıcı güvenilirlik bir özelliktir.
• 8 saniyelik üst sınır.
Mevcut serimizdeki en kısa klipler — Seedance 2.5 30 saniyeye, FLUX 3 yirmiye ulaşır. Daha uzun parçalar, zincirleme ve kesimleri planlama anlamına gelir.
• Maliyet ve hız.
Buradaki en yüksek kredi maliyetiyle render başına 1–3 dakika. Bu, eskiz modeli değil, son rötuş modelidir.
• En katı filtreler.
Kamuya mal olmuş kişiler, çocuklar, şiddet — model düzeyinde reddedilir. Engellenen işler burada kredi harcamaz, ancak biraz yeniden ifade etmeniz gerekebilir.
• Stilize animasyon.
Anime ve el yapımı görünümler tuhaf şekilde parlak çıkıyor. FLUX 3 ve Seedance stilizasyonu daha iyi yönetiyor.
Yukarıdaki oluşturucuya kopyalayın, parantezleri değiştirin, render edin.
"Şafakta iskeledeki bir [hava koşullarından yıpranmış balıkçının] orta yakın çekimi, kameranın hemen ötesine bakıyor. Şöyle der: 'Fırtına bu yıl erken geliyor.' Uzakta martılar, gıcırdayan halat. Kapalı ışık, belgesel tarzı."
Tırnak içindeki diyalog, yüzle senkronize konuşma sesi oluşturur. Satırları ~10 kelimenin altında tutun. Oluşturucunun yanındaki demo tam olarak bu istemdir.
"Beton bir tezgah üzerindeki [mat siyah espresso makinesinin] etrafında yavaş 180° dönüş. Buhar yükselir; buhar çubuğunun alçak tıslamasını ve yumuşak kafe atmosferini duyarız. Sabah pencere ışığı, sığ alan derinliği, 35mm."
Sesi prompta yazmak ('duyuyoruz...') Veo’ya özgü hamledir — değerin yarısı o cümlededir.
Yükle: sabit bir görüntü
"Telefonda çekilmiş gibi, hafif bir elde kamera hareketi. [subject] doğal şekilde nefes alır ve ağırlığını kaydırır; arka plan sabit kalır. Sessiz oda ambiyansı, uzaktan gelen trafik sesi."
"Telefonda çekilmiş gibi" fiziksel etkiyi gerçekçi kılar ve minimum hareket talimatları, görüntüden videoya dönüştürmede yüzlerin kaymasını önler.
Üç yerel ses modeli. Üçünde de aynı promptlar, yayına alacağımız şeye göre değerlendirildi — bu tablo FLUX 3 sayfasındaki tabloyu yansıtır, bu nedenle nereye gelirseniz gelin veriler tutarlıdır. Yukarıdaki oluşturucuda üçü de seçilebilir.
daha keskin fizik, daha uzun tutarlı hareket, daha güvenilir diyalog senkronizasyonu. Yukarıdaki oluşturucudaki sürüm.
'sesli AI video'yu bir kategori haline getiren sürüm; viral sokak röportajı klipleri bu sürümdendi.
sağlam bir sessiz video, büyük ölçüde araştırmaya yönelik. Ses alanındaki sıçrama onu bir demodan araca dönüştürdü.
Google DeepMind'in video oluşturma modeli — gerçek gibi görünen görüntülerde en güçlü seçenek; ses, görüntüyle birlikte yerel olarak oluşturulur: ortam sesi, efektler ve kısa diyaloglar. Metinden çalışır veya durağan bir görseli canlandırır, en fazla 1080p, klip başına 8 saniye.
Yönetmen. Yönetmen Modu ile 4K’ya kadar çok çekimli hikâye anlatımı.
Uzun plan. Müziklerinize göre kurgulanmış 30 saniyelik çekimler.
Stilist. Ana kare kontrolü ve sinematikten stop-motion'a uzanan görünümler.