O modelo reference-first da Kuaishou: suas imagens e clipes definem o sujeito, MVL o mantém idêntico tomada após tomada — e você edita o resultado conversando com ele. Digite um prompt abaixo e experimente.
Desenvolvedor
Kuaishou
Tipo
Multimodal orientado por referência (MVL)
Referências
Até 7 imagens + vídeo
Duração
3–15 s por clipe
Áudio
Nativo · diálogo em 5 idiomas
Editando
Conversacional, no próprio local
Nível aqui
Créditos pagos (Std / Pro)
Nosso veredito em uma linha: a escolha para manter a consistência em trabalhos em série. Quando o mesmo sujeito precisa sobreviver a dezenas de gerações — e você prefere corrigir clipes a gerá-los de novo — comece aqui.
Kling O3 — Video 3.0 Omni, a metade orientada por referências da geração 3.0 da Kuaishou — trata seus uploads como a verdade de referência. Forneça a ele até sete imagens de um sujeito, opcionalmente um clipe de vídeo, e sua arquitetura MVL mantém esse rosto, logotipo ou objeto de cena exato estável durante movimentos de câmera, mudanças de cena e sequências com múltiplas tomadas; avaliadores independentes chamaram a série O3 de o vídeo de IA mais controlável do início de 2026. O outro lado do seu argumento: edição conversacional — 'remova o transeunte, mantenha todo o resto' — aplicada a clipes finalizados em vez de recriá-los. Uma observação de grafia que leva as pessoas à página errada: Kling O3 não é Hailuo 03. Esse é o MiniMax H3, o modelo de uma empresa diferente.
Avaliado a partir das nossas próprias renderizações e do registro publicado, revisado à medida que os fatos mudam — isso é um recurso desta página, não um aviso de isenção de responsabilidade.
• Identidade bloqueada por referência.
Até 7 imagens mais um vídeo opcional definem o assunto; MVL mantém rostos, detalhes das roupas, logotipos e texto estáveis durante movimentos complexos de câmera. O benchmark para trabalho em séries.
• Edição de vídeo conversacional.
Remoção e substituição de objetos, alterações de fundo, efeitos — aplicados a um clipe finalizado como comandos em linguagem natural. Corrigir é melhor do que gerar de novo.
• Correferência de vários personagens.
Vários personagens de referência em uma única cena, cada um mantendo sua própria identidade — tomadas de conjunto que confundem modelos de referência única.
• Voz a partir das suas referências.
Vozes personalizadas derivadas de entradas de vídeo ou imagem, com diálogo nativo em cinco idiomas — um porta-voz da marca que soa igual em todos os clipes.
• Contagem de referências na média.
7 imagens + vídeo é bastante para um único assunto, mas MiniMax H3 aceita 12 arquivos e Seedance 2.5 aceita 50 — produções completas com kit de recursos podem precisar de uma capacidade de entrada maior.
• A armadilha da nomenclatura.
'Kling O3' e 'Hailuo 03' são modelos de empresas diferentes; O3 vs V3 vs 2.6 confunde até compradores cuidadosos. Verifique a etiqueta do modelo antes de gastar.
• Padrão 1080p.
A saída padrão da linha O3 fica em HD; o 4K da família está em outras variantes. Briefs de resolução vão para Kling 3.0 ou MiniMax H3.
• O trabalho apenas com prompts é tarefa do gêmeo.
Sem referências para servir de âncora, a sua vantagem diminui — briefs puramente text-to-video geralmente ficam melhores no Kling 3.0, que prioriza prompts.
Copie para o gerador acima, troque os colchetes, renderize.
Carregar: 7 fotos da mesma pessoa (ângulos, expressões, corpo inteiro)
"O personagem caminha por um mercado matinal, depois aparece em uma mesa de escritório e, em seguida, em um terraço ao pôr do sol — mesmo rosto, mesma constituição física, roupas mudando conforme a cena. Uma fala em cada uma. Som ambiente por local."
Ângulos de referência variados dão ao MVL um modelo mais completo do assunto; permitir explicitamente as mudanças de roupa ('outfits changing per scene') impede que o modelo congele as roupas junto com o rosto. A demonstração ao lado do gerador é este prompt.
Começar de: um clipe que você já gerou
"Remova o transeunte que cruza atrás do sujeito na marca de 4 segundos. Mantenha o sujeito, a deriva da câmera, a iluminação e todo o áudio exatamente como estão."
Aplique um registro de data e hora ao alvo e, em seguida, proteja todo o resto pelo nome — a cláusula de proteção é o que mantém uma edição cirúrgica. Este é o fluxo de trabalho que torna barato aperfeiçoar renderizações de 15 segundos.
Carregar: referências para o personagem A e o personagem B
"A e B discutem através de uma mesa de café — A gesticula com uma colher, B se inclina para trás rindo. Corte entre planos por cima do ombro. Cada um mantém sua aparência de referência exata. Chiado da máquina de espresso, burburinho baixo de café."
Nomear quem faz o quê é sintaxe de correferência: o modelo mapeia cada ação para a identidade referenciada correta. Sem ela, cenas com dois personagens trocam rostos no meio da tomada.
O triângulo de controle de referência: três modelos que prometem 'seu sujeito, mantido consistente,' com diferentes tamanhos de entrada e filosofias de edição. Os mesmos prompts nos três, avaliados pelo que lançaríamos. Todos os três selecionáveis no gerador acima.
o sucessor do O1 que traz o áudio nativo, o multi-shot e a edição conversacional da arquitetura Omni para dois níveis. A versão no gerador acima.
A aposta da Kuaishou no 'multimodal unificado pioneiro no setor': geração de referências, in-painting, transferência de estilo e extensão de tomadas fundidos em um único motor. O3 é essa ideia, amadurecida.
modelos orientados por prompts que tornaram Kling um nome conhecido globalmente, antes de a família se dividir nas linhas V3, guiada por prompts, e O3, guiada por referências.
Mesma geração, filosofia diferente. Kling O3 (Video 3.0 Omni) prioriza referências: suas imagens e seu vídeo definem o assunto, e a arquitetura MVL mantém essa identidade preservada em todas as tomadas. Kling 3.0 (V3) é trabalho cinematográfico que prioriza prompts. Briefings orientados por referências aqui, briefings orientados por prompts na página do Kling 3.0.