Generador de videos con IA Veo

Benchmark de realismo de Google DeepMind: metraje que pasa por real, con sonido ambiental y diálogo hablado generados en la misma pasada. Escribe un prompt abajo y pruébalo.

Modelo
Subir imagen del fotograma inicial
(JPG, JPEG, PNG, WEBP, máx. 30 MB)
Prompt
0/5000
Relaciones de aspecto de salida
Auto
Resolución
Auto
Duración(segundos)
Auto
Muestra de video
 

Desarrollador

Google DeepMind

Tipo

Texto / imagen a video

Audio

Nativo, con diálogo

Duración

8 s por clip

Salida máx.

1080p

Tiempo de renderizado

1–3 min

Nivel aquí

Créditos de pago

Nuestro veredicto en una línea: cuando el clip tenga que pasar por metraje, renderízalo en Veo. Cuando aún estés explorando, haz primero un borrador en los niveles rápidos.

Veo es el modelo con el que se mide a los recién llegados. Cada buque insignia lanzado este verano — Seedance 2.5, MiniMax H3, Wan 3.0, FLUX 3 — incluyó a Veo en sus gráficos comparativos, porque posee las dos cosas más difíciles de fingir: un realismo físico que resiste el escrutinio y una trayectoria más larga que una semana de lanzamiento. Su audio nativo aún hace lo que la mayoría de sus rivales no puede: una línea de diálogo entre comillas en el prompt vuelve hablada, sincronizada con el rostro.

Lectura honesta

Dónde gana Veo — y dónde no

Juzgado a partir de nuestros propios renders y del registro publicado, revisado a medida que cambian los hechos — eso es una característica de esta página, no un descargo de responsabilidad.

Realmente fuerte

  • • Realismo físico.

    La luz rebota, las telas caen de forma natural, los líquidos se vierten como líquidos. La menor cantidad de “señales de AI” de todo lo que alojamos, y la respuesta predeterminada cuando un cliente va a mirar de cerca.

  • • Audio nativo con diálogo.

    Ambiente, efectos y breves líneas habladas sincronizadas con la acción. Escribe el sonido en el prompt y se renderiza — sin pasada de musicalización.

  • • Cumplimiento del prompt.

    Las indicaciones de cámara — dolly, paneo, cambio de foco — se siguen, no solo sirven de inspiración. Los prompts con lista de tomas dan mejores resultados aquí que en cualquier otro lugar.

  • • Trayectoria comprobada.

    Clasificaciones independientes, meses de uso en producción, modos de fallo conocidos. En un verano de buques insignia de una semana, la fiabilidad aburrida es una función.

Límites conocidos

  • • Límite de 8 segundos.

    Los clips más cortos de nuestra línea actual — Seedance 2.5 alcanza 30 segundos, FLUX 3 veinte. Las piezas más largas implican encadenar y planificar cortes.

  • • Costo y velocidad.

    1–3 minutos por renderizado con el coste de créditos más alto aquí. Es el modelo de acabado, no el modelo de bocetado.

  • • Filtros más estrictos.

    Figuras públicas, niños, violencia — se rechazan a nivel del modelo. Los trabajos bloqueados no consumen créditos aquí, pero es probable que tengas que reformular un poco.

  • • Animación estilizada.

    Los estilos anime y hechos a mano salen extrañamente brillantes. FLUX 3 y Seedance manejan mejor la estilización.

Recetas de prompts

Tres prompts que mostrar para qué sirve

Copia en el generador de arriba, cambia los corchetes, renderiza.

La toma de diálogo de una línea

"Plano medio corto de un [pescador curtido] en un muelle al amanecer, mirando apenas más allá de la cámara. Dice: 'La tormenta llega temprano este año.' Gaviotas a lo lejos, una cuerda crujiendo. Luz nublada, estilo documental."

Por qué funciona

El diálogo entre comillas genera audio hablado sincronizado con el rostro. Mantén las líneas por debajo de ~10 palabras. La demo junto al generador es exactamente este prompt.

Imagen principal del producto — con sonido

"Órbita lenta de 180° alrededor de una [máquina de espresso negro mate] sobre una encimera de concreto. El vapor se eleva; oímos el suave siseo de la varilla de vapor y una tenue atmósfera de café. Luz matinal de ventana, poca profundidad de campo, 35mm."

Por qué funciona

Escribir el audio en el prompt ('oímos...') es la jugada específica de Veo — la mitad del valor está en esa frase.

La foto cobra vida

Subir: una imagen fija

"Movimiento sutil de cámara en mano, como si estuviera filmado con un teléfono. [subject] respira y desplaza el peso de forma natural; el fondo permanece fijo. Ambiente silencioso de la habitación, tráfico distante."

Por qué funciona

"Como si estuviera grabado con un teléfono" da realismo a la física, y unas instrucciones de movimiento mínimas evitan que los rostros se desplacen al convertir imagen a video.

Cara a cara

Veo contra Seedance 2.5 contra FLUX 3

Tres modelos nativos de audio. Los mismos prompts en los tres, evaluados según lo que lanzaríamos — esta tabla refleja la de la página de FLUX 3, así que los datos coinciden dondequiera que llegues. Los tres se pueden seleccionar en el generador de arriba.

JobVeoSeedance 2.5FLUX 3
Imágenes realistas Mejor Bueno (temprano) Bueno (temprano)
Duración máxima del clip 8 s 30 s nativo 20 s + extender
Fotograma clave / control estructural Solo prompt Primer/último fotograma 10 fijados + primero/último
Ritmo controlado por audio desde una pista No No
Estilos no cinematográficos Aceptable Bueno Mejor
Trayectoria comprobada Establecido Semanas Semanas
Historial de versiones

Cómo llegó aquí

Actual

Veo más reciente

física más precisa, movimiento coherente más largo, sincronización de diálogos más fiable. La versión en el generador de arriba.

Antes

Veo 3

la versión que convirtió 'video con IA y sonido' en una categoría; los clips virales de entrevistas callejeras eran de esta versión.

Origen

Veo 1–2

un video silencioso sólido, en gran medida orientado a la investigación. El salto en el audio lo convirtió de una demo en una herramienta.

Preguntas frecuentes

Preguntas sobre Veo, respuestas directas

1. ¿Qué es Veo, en un párrafo?

El modelo de generación de video de Google DeepMind — el más potente para crear metraje que parece real, con audio generado de forma nativa junto con la imagen: ambiente, efectos y diálogos breves. Funciona a partir de texto o anima una imagen fija, hasta 1080p, 8 segundos por clip.

Otros modelos

¿No es la herramienta adecuada? Prueba sus vecinos

Kling 3.0

El director. Narración con múltiples tomas hasta 4K con el Modo director.

Seedance 2.5

El plano secuencia. Tomas de 30 segundos montadas con tu banda sonora.

FLUX 3

El estilista. Control de fotogramas clave y estilos desde cinematográficos hasta stop-motion.