Benchmark di realismo di Google DeepMind: filmati che sembrano reali, con audio ambientale e dialoghi parlati generati nello stesso passaggio. Inserisci un prompt qui sotto e provalo.
Sviluppatore
Google DeepMind
Tipo
Da testo / immagine a video
Audio
Nativo, con dialogo
Durata
8 s per clip
Output max
1080p
Tempo di rendering
1–3 min
Livello qui
Crediti a pagamento
Il nostro verdetto in una riga: quando la clip deve passare per girato, renderizzala su Veo. Quando stai ancora esplorando, fai prima una bozza sui livelli veloci.
Veo è il modello rispetto al quale vengono misurati i nuovi arrivati. Ogni modello di punta uscito quest'estate — Seedance 2.5, MiniMax H3, Wan 3.0, FLUX 3 — ha inserito Veo nei propri grafici comparativi, perché possiede le due cose più difficili da simulare: un realismo fisico che regge a un esame attento e un curriculum più lungo di una settimana di lancio. Il suo audio nativo fa ancora ciò che la maggior parte dei rivali non riesce a fare: una battuta di dialogo tra virgolette nel prompt viene restituita pronunciata, sincronizzata con il volto.
Giudicato in base ai nostri render e alla documentazione pubblicata, rivisto man mano che i fatti cambiano — questa è una caratteristica di questa pagina, non una dichiarazione di esclusione di responsabilità.
• Realismo fisico.
La luce rimbalza, i tessuti cadono in modo naturale, i liquidi scorrono come liquidi. Il minor numero di “indizi AI” tra tutto ciò che ospitiamo, e la risposta predefinita quando un cliente osserverà da vicino.
• Audio nativo con dialogo.
Ambiente, effetti e brevi battute parlate sincronizzati con l’azione. Scrivi il suono nel prompt e viene renderizzato — nessun passaggio di scoring.
• Aderenza al prompt.
Le indicazioni di camera — carrello, panoramica, rack focus — vengono seguite, non sono solo fonte d'ispirazione. I prompt con shot list rendono qui più che altrove.
• Risultati comprovati.
Classifiche indipendenti, mesi di utilizzo in produzione, modalità di errore note. In un'estate di flagship vecchi di una settimana, l'affidabilità noiosa è una funzionalità.
• Limite di 8 secondi.
I clip più brevi nella nostra gamma attuale — Seedance 2.5 arriva a 30 secondi, FLUX 3 a venti. I contenuti più lunghi richiedono concatenazione e pianificazione dei tagli.
• Costo e velocità.
1–3 minuti per rendering al costo in crediti più alto qui. È il modello di rifinitura, non quello per gli schizzi.
• Filtri più rigorosi.
Personaggi pubblici, bambini, violenza — rifiutati a livello del modello. I lavori bloccati qui non consumano crediti, ma aspettati di dover riformulare un po'.
• Animazione stilizzata.
Gli stili anime e fatti a mano risultano stranamente lucidi. FLUX 3 e Seedance gestiscono meglio la stilizzazione.
Copia nel generatore sopra, sostituisci le parentesi, esegui il rendering.
"Primo piano medio di un [pescatore segnato dalle intemperie] su un molo all'alba, che guarda appena oltre la telecamera. Dice: 'La tempesta arriva in anticipo quest'anno.' Gabbiani in lontananza, corda che scricchiola. Luce coperta, stile documentaristico."
Il dialogo tra virgolette genera audio parlato sincronizzato con il volto. Mantieni le righe sotto ~10 parole. La demo accanto al generatore è esattamente questo prompt.
"Lenta orbita a 180° attorno a una [macchina per espresso nero opaco] su un bancone in cemento. Il vapore sale; sentiamo il basso sibilo della lancia vapore e una morbida atmosfera da caffè. Luce mattutina dalla finestra, profondità di campo ridotta, 35mm."
Inserire l'audio nel prompt ('sentiamo...') è la mossa specifica per Veo — metà del valore sta in quella frase.
Carica: un'immagine fissa
"Leggero movimento a mano libera, come se fosse ripreso con un telefono. [subject] respira e sposta il peso in modo naturale; lo sfondo resta fisso. Silenzioso tono ambientale della stanza, traffico lontano."
"Come se fosse filmato con un telefono" rende la fisica più realistica, e istruzioni di movimento minime impediscono ai volti di spostarsi nella conversione da immagine a video.
Tre modelli nativi per l'audio. Stessi prompt per tutti e tre, valutati in base a ciò che pubblicheremmo — questa tabella rispecchia quella nella pagina FLUX 3, quindi i dati coincidono ovunque arrivi. Tutti e tre selezionabili nel generatore qui sopra.
fisica più precisa, movimento coerente più lungo, sincronizzazione dei dialoghi più affidabile. La versione nel generatore qui sopra.
la release che ha reso 'video AI con audio' una categoria; i clip virali di interviste di strada provenivano da questa versione.
un solido video muto, in gran parte orientato alla ricerca. Il salto nell'audio lo ha trasformato da demo in strumento.
Il modello di generazione video di Google DeepMind — il più forte nel creare filmati che sembrano reali, con audio generato nativamente insieme all'immagine: ambience, effetti e brevi dialoghi. Funziona da testo o anima un'immagine statica, fino a 1080p, 8 secondi per clip.
Il regista. Storytelling multi-inquadratura fino a 4K con la Modalità regista.
Il piano sequenza. Riprese da 30 secondi montate sulla tua colonna sonora.
Lo stilista. Controllo dei keyframe e look dal cinematografico allo stop-motion.