Benchmark de realismo do Google DeepMind: filmagens que passam por reais, com som ambiente e diálogo falado gerados na mesma passagem. Digite um prompt abaixo e experimente.
Desenvolvedor
Google DeepMind
Tipo
Texto / imagem para vídeo
Áudio
Nativo, com diálogo
Duração
8 s por clipe
Saída máx.
1080p
Tempo de renderização
1–3 min
Nível aqui
Créditos pagos
Nosso veredito em uma linha: quando o clipe precisar passar por filmagem, renderize-o no Veo. Quando você ainda estiver explorando, faça primeiro um rascunho nos níveis rápidos.
Veo é o modelo pelo qual os recém-chegados são avaliados. Todo carro-chefe lançado neste verão — Seedance 2.5, MiniMax H3, Wan 3.0, FLUX 3 — colocou o Veo em seus gráficos comparativos, porque ele tem as duas coisas mais difíceis de falsificar: realismo físico que resiste ao escrutínio e um histórico mais longo do que uma semana de lançamento. Seu áudio nativo ainda faz o que a maioria dos rivais não consegue: uma fala entre aspas no prompt volta falada, sincronizada com o rosto.
Julgado com base nas nossas próprias renderizações e no registro publicado, revisado à medida que os fatos mudam — isso é um recurso desta página, não uma isenção de responsabilidade.
• Realismo físico.
A luz ricocheteia, os tecidos caem naturalmente, os líquidos escorrem como líquidos. O menor número de “sinais de AI” entre tudo o que hospedamos, e a resposta padrão quando um cliente vai olhar de perto.
• Áudio nativo com diálogo.
Ambiência, efeitos e falas curtas sincronizados com a ação. Escreva o som no prompt e ele é renderizado — sem etapa de trilha sonora.
• Aderência ao prompt.
As instruções de câmera — dolly, pan, rack focus — são seguidas, não apenas usadas como inspiração. Prompts de lista de tomadas rendem mais aqui do que em qualquer outro lugar.
• Histórico comprovado.
Classificações independentes, meses de uso em produção, modos de falha conhecidos. Em um verão de carros-chefe com uma semana de idade, a confiabilidade entediante é um recurso.
• Limite de 8 segundos.
Os clipes mais curtos da nossa linha atual — Seedance 2.5 chega a 30 segundos, FLUX 3 a vinte. Peças mais longas significam encadear e planejar cortes.
• Custo e velocidade.
1–3 minutos por renderização com o maior custo de créditos aqui. É o modelo de finalização, não o modelo de esboço.
• Filtros mais rigorosos.
Figuras públicas, crianças, violência — recusados no nível do modelo. Trabalhos bloqueados não consomem créditos aqui, mas espere ter que reformular um pouco.
• Animação estilizada.
Os visuais de anime e artesanais saem estranhamente brilhantes. FLUX 3 e Seedance lidam melhor com a estilização.
Copie para o gerador acima, troque os colchetes, renderize.
"Close-up médio de um [pescador marcado pelo tempo] em um cais ao amanhecer, olhando um pouco além da câmera. Ele diz: 'A tempestade vai chegar cedo este ano.' Gaivotas ao longe, corda rangendo. Luz nublada, estilo documental."
O diálogo entre aspas gera áudio falado sincronizado com o rosto. Mantenha as linhas com menos de ~10 palavras. A demonstração ao lado do gerador é exatamente este prompt.
"Órbita lenta de 180° ao redor de uma [máquina de espresso preto fosco] sobre uma bancada de concreto. O vapor sobe; ouvimos o baixo chiado da haste de vapor e uma suave ambiência de café. Luz matinal da janela, pouca profundidade de campo, 35mm."
Escrever o áudio no prompt ('ouvimos...') é a jogada específica do Veo — metade do valor está nessa frase.
Carregar: uma imagem estática
"Movimento sutil de câmera na mão, como se fosse filmado com um telefone. [subject] respira e desloca o peso naturalmente; o fundo permanece fixo. Tom ambiente silencioso do cômodo, trânsito distante."
"Como se fosse filmado em um telefone" dá realismo à física, e instruções mínimas de movimento impedem que os rostos se desloquem na conversão de imagem para vídeo.
Três modelos nativos de áudio. Os mesmos prompts nos três, avaliados pelo que lançaríamos — esta tabela espelha a da página do FLUX 3, então os dados batem onde quer que você chegue. Todos os três selecionáveis no gerador acima.
física mais precisa, movimento coerente mais longo, sincronização de diálogos mais confiável. A versão no gerador acima.
a versão que fez de 'vídeo de IA com som' uma categoria; os clipes virais de entrevistas de rua eram desta versão.
um vídeo silencioso sólido, em grande parte voltado para pesquisa. O salto no áudio o transformou de uma demo em uma ferramenta.
O modelo de geração de vídeo da Google DeepMind — o mais forte em criar filmagens que parecem reais, com áudio gerado nativamente junto com a imagem: ambiência, efeitos e diálogos curtos. Funciona a partir de texto ou anima uma imagem estática, até 1080p, 8 segundos por clipe.
O diretor. Narrativa com múltiplas tomadas até 4K com o Modo diretor.
O plano-sequência. Cenas de 30 segundos cortadas ao som da sua trilha sonora.
O estilista. Controle de keyframes e visuais do cinematográfico ao stop-motion.