Benchmark de realismo de Google DeepMind: metraje que pasa por real, con sonido ambiental y diálogo hablado generados en la misma pasada. Escribe un prompt abajo y pruébalo.
Desarrollador
Google DeepMind
Tipo
Texto / imagen a video
Audio
Nativo, con diálogo
Duración
8 s por clip
Salida máx.
1080p
Tiempo de renderizado
1–3 min
Nivel aquí
Créditos de pago
Nuestro veredicto en una línea: cuando el clip tenga que pasar por metraje, renderízalo en Veo. Cuando aún estés explorando, haz primero un borrador en los niveles rápidos.
Veo es el modelo con el que se mide a los recién llegados. Cada buque insignia lanzado este verano — Seedance 2.5, MiniMax H3, Wan 3.0, FLUX 3 — incluyó a Veo en sus gráficos comparativos, porque posee las dos cosas más difíciles de fingir: un realismo físico que resiste el escrutinio y una trayectoria más larga que una semana de lanzamiento. Su audio nativo aún hace lo que la mayoría de sus rivales no puede: una línea de diálogo entre comillas en el prompt vuelve hablada, sincronizada con el rostro.
Juzgado a partir de nuestros propios renders y del registro publicado, revisado a medida que cambian los hechos — eso es una característica de esta página, no un descargo de responsabilidad.
• Realismo físico.
La luz rebota, las telas caen de forma natural, los líquidos se vierten como líquidos. La menor cantidad de “señales de AI” de todo lo que alojamos, y la respuesta predeterminada cuando un cliente va a mirar de cerca.
• Audio nativo con diálogo.
Ambiente, efectos y breves líneas habladas sincronizadas con la acción. Escribe el sonido en el prompt y se renderiza — sin pasada de musicalización.
• Cumplimiento del prompt.
Las indicaciones de cámara — dolly, paneo, cambio de foco — se siguen, no solo sirven de inspiración. Los prompts con lista de tomas dan mejores resultados aquí que en cualquier otro lugar.
• Trayectoria comprobada.
Clasificaciones independientes, meses de uso en producción, modos de fallo conocidos. En un verano de buques insignia de una semana, la fiabilidad aburrida es una función.
• Límite de 8 segundos.
Los clips más cortos de nuestra línea actual — Seedance 2.5 alcanza 30 segundos, FLUX 3 veinte. Las piezas más largas implican encadenar y planificar cortes.
• Costo y velocidad.
1–3 minutos por renderizado con el coste de créditos más alto aquí. Es el modelo de acabado, no el modelo de bocetado.
• Filtros más estrictos.
Figuras públicas, niños, violencia — se rechazan a nivel del modelo. Los trabajos bloqueados no consumen créditos aquí, pero es probable que tengas que reformular un poco.
• Animación estilizada.
Los estilos anime y hechos a mano salen extrañamente brillantes. FLUX 3 y Seedance manejan mejor la estilización.
Copia en el generador de arriba, cambia los corchetes, renderiza.
"Plano medio corto de un [pescador curtido] en un muelle al amanecer, mirando apenas más allá de la cámara. Dice: 'La tormenta llega temprano este año.' Gaviotas a lo lejos, una cuerda crujiendo. Luz nublada, estilo documental."
El diálogo entre comillas genera audio hablado sincronizado con el rostro. Mantén las líneas por debajo de ~10 palabras. La demo junto al generador es exactamente este prompt.
"Órbita lenta de 180° alrededor de una [máquina de espresso negro mate] sobre una encimera de concreto. El vapor se eleva; oímos el suave siseo de la varilla de vapor y una tenue atmósfera de café. Luz matinal de ventana, poca profundidad de campo, 35mm."
Escribir el audio en el prompt ('oímos...') es la jugada específica de Veo — la mitad del valor está en esa frase.
Subir: una imagen fija
"Movimiento sutil de cámara en mano, como si estuviera filmado con un teléfono. [subject] respira y desplaza el peso de forma natural; el fondo permanece fijo. Ambiente silencioso de la habitación, tráfico distante."
"Como si estuviera grabado con un teléfono" da realismo a la física, y unas instrucciones de movimiento mínimas evitan que los rostros se desplacen al convertir imagen a video.
Tres modelos nativos de audio. Los mismos prompts en los tres, evaluados según lo que lanzaríamos — esta tabla refleja la de la página de FLUX 3, así que los datos coinciden dondequiera que llegues. Los tres se pueden seleccionar en el generador de arriba.
física más precisa, movimiento coherente más largo, sincronización de diálogos más fiable. La versión en el generador de arriba.
la versión que convirtió 'video con IA y sonido' en una categoría; los clips virales de entrevistas callejeras eran de esta versión.
un video silencioso sólido, en gran medida orientado a la investigación. El salto en el audio lo convirtió de una demo en una herramienta.
El modelo de generación de video de Google DeepMind — el más potente para crear metraje que parece real, con audio generado de forma nativa junto con la imagen: ambiente, efectos y diálogos breves. Funciona a partir de texto o anima una imagen fija, hasta 1080p, 8 segundos por clip.
El director. Narración con múltiples tomas hasta 4K con el Modo director.
El plano secuencia. Tomas de 30 segundos montadas con tu banda sonora.
El estilista. Control de fotogramas clave y estilos desde cinematográficos hasta stop-motion.