El modelo reference-first de Kuaishou: tus imágenes y clips definen el sujeto, MVL lo mantiene idéntico toma tras toma — y tú editas el resultado hablándole. Escribe un prompt abajo y pruébalo.
Desarrollador
Kuaishou
Tipo
Multimodal guiado por referencia (MVL)
Referencias
Hasta 7 imágenes + video
Duración
3–15 s por clip
Audio
Nativo · diálogo en 5 idiomas
Edición
Conversacional, in situ
Nivel aquí
Créditos de pago (Std / Pro)
Nuestro veredicto en una línea: la opción para mantener la coherencia en trabajos en serie. Cuando el mismo sujeto debe sobrevivir a decenas de generaciones — y prefieres corregir clips antes que volver a generarlos — empieza aquí.
Kling O3 — Video 3.0 Omni, la mitad guiada por referencias de la generación 3.0 de Kuaishou — trata tus cargas como la referencia definitiva. Dale hasta siete imágenes de un sujeto, opcionalmente un clip de video, y su arquitectura MVL mantiene ese rostro, logotipo o accesorio exacto estable durante movimientos de cámara, cambios de escena y secuencias de múltiples tomas; los evaluadores independientes calificaron la serie O3 como el video de IA más controlable de principios de 2026. La otra mitad de su propuesta: edición conversacional — 'elimina al transeúnte, conserva todo lo demás' — aplicada a clips terminados en lugar de volver a generarlos. Una nota sobre la escritura que lleva a la gente a la página equivocada: Kling O3 no es Hailuo 03. Ese es MiniMax H3, el modelo de una empresa diferente.
Juzgado a partir de nuestros propios renderizados y del registro publicado, revisado a medida que los hechos cambian — es una característica de esta página, no un descargo de responsabilidad.
• Identidad bloqueada por referencia.
Hasta 7 imágenes más un video opcional definen el sujeto; MVL mantiene estables los rostros, los detalles de la ropa, los logotipos y el texto durante movimientos de cámara complejos. El benchmark para el trabajo en series.
• Edición de video conversacional.
Eliminación y reemplazo de objetos, cambios de fondo, efectos — aplicados a un clip terminado como comandos en lenguaje natural. Corregir es mejor que volver a generar.
• Correferencia de varios personajes.
Varios personajes de referencia en una sola escena, cada uno con su propia identidad — tomas de conjunto que confunden a los modelos de referencia única.
• Voz a partir de tus referencias.
Voces personalizadas derivadas de entradas de vídeo o imagen, con diálogo nativo en cinco idiomas — un portavoz de marca que suena igual en cada clip.
• Recuento de referencias en la media.
7 imágenes + video es más que suficiente para un solo sujeto, pero MiniMax H3 acepta 12 archivos y Seedance 2.5 acepta 50 — las producciones completas con kit de recursos pueden necesitar una mayor capacidad de entrada.
• La trampa de la nomenclatura.
'Kling O3' y 'Hailuo 03' son modelos de empresas diferentes; O3 vs V3 vs 2.6 confunde incluso a los compradores cuidadosos. Comprueba la etiqueta del modelo antes de gastar.
• Estándar 1080p.
La salida estándar de la línea O3 está en HD; el 4K de la familia está disponible en otras variantes. Los briefs de resolución van a Kling 3.0 o MiniMax H3.
• El trabajo solo con prompts es tarea del gemelo.
Sin referencias a las que anclarse, su ventaja se reduce — los briefs puramente text-to-video suelen salir mejor en Kling 3.0, centrado primero en los prompts.
Copia en el generador de arriba, cambia los corchetes, renderiza.
Subir: 7 fotos de la misma persona (ángulos, expresiones, cuerpo completo)
"El personaje camina por un mercado matutino, luego aparece en un escritorio de oficina y después en una azotea al atardecer — el mismo rostro, la misma complexión, atuendos que cambian según la escena. Una línea hablada en cada una. Sonido ambiental según la ubicación."
Ángulos de referencia variados le dan a MVL un modelo más completo del sujeto; autorizar explícitamente los cambios de atuendo ('outfits changing per scene') evita que el modelo congele la ropa junto con el rostro. La demo junto al generador es este prompt.
Empezar desde: un clip que ya generaste
"Elimina al transeúnte que cruza detrás del sujeto en el segundo 4. Mantén el sujeto, la deriva de la cámara, la iluminación y todo el audio exactamente como están."
Marca el objetivo con una marca de tiempo y luego protege todo lo demás por nombre — la cláusula de protección es lo que mantiene quirúrgica una edición. Este es el flujo de trabajo que hace que perfeccionar renderizados de 15 segundos sea económico.
Subir: referencias para el personaje A y el personaje B
"A y B discuten a través de una mesa de café — A gesticula con una cuchara, B se recuesta hacia atrás riendo. Corta entre planos por encima del hombro. Cada uno mantiene su apariencia de referencia exacta. Silbido de la máquina de espresso, murmullo bajo de café."
Nombrar quién hace qué es sintaxis de correferencia: el modelo asigna cada acción a la identidad referenciada correcta. Sin ella, las escenas con dos personajes intercambian rostros a mitad de toma.
El triángulo de control de referencia: tres modelos que prometen 'tu sujeto, mantenido consistente,' con distintos tamaños de entrada y filosofías de edición. Los mismos prompts en los tres, evaluados según lo que publicaríamos. Los tres seleccionables en el generador de arriba.
el sucesor de O1 que lleva el audio nativo, el multi-shot y la edición conversacional de la arquitectura Omni a dos niveles. La versión en el generador de arriba.
La apuesta de Kuaishou por el 'multimodal unificado pionero en la industria': generación de referencias, in-painting, transferencia de estilo y extensión de tomas fusionados en un solo motor. O3 es esta idea, ya madura.
modelos impulsados por prompts que convirtieron a Kling en un nombre global, antes de que la familia se dividiera en las líneas V3, guiada por prompts, y O3, guiada por referencias.
Misma generación, distinta filosofía. Kling O3 (Video 3.0 Omni) prioriza las referencias: tus imágenes y video definen el sujeto, y la arquitectura MVL mantiene esa identidad fija en todas las tomas. Kling 3.0 (V3) es trabajo cinematográfico basado en prompts. Briefs basados en referencias aquí, briefs basados en prompts en la página de Kling 3.0.