Il modello reference-first di Kuaishou: le tue immagini e clip definiscono il soggetto, MVL lo mantiene identico in ogni inquadratura — e tu modifichi il risultato parlandogli. Digita un prompt qui sotto e provalo.
Sviluppatore
Kuaishou
Tipo
Multimodale guidato da riferimenti (MVL)
Riferimenti
Fino a 7 immagini + video
Durata
3–15 s per clip
Audio
Nativo · dialogo in 5 lingue
Modifica
Conversazionale, sul posto
Livello qui
Crediti a pagamento (Std / Pro)
Il nostro verdetto in una riga: la scelta per la coerenza nel lavoro in serie. Quando lo stesso soggetto deve superare decine di generazioni — e preferisci correggere i clip invece di rigenerarli — inizia da qui.
Kling O3 — Video 3.0 Omni, la metà guidata dai riferimenti della generazione 3.0 di Kuaishou — tratta i tuoi caricamenti come verità di riferimento. Forniscigli fino a sette immagini di un soggetto, eventualmente anche una clip video, e la sua architettura MVL mantiene quello stesso volto, logo o oggetto di scena stabile attraverso movimenti di camera, cambi di scena e sequenze multi-inquadratura; recensori indipendenti hanno definito la serie O3 il video AI più controllabile dell’inizio del 2026. L’altra metà del suo caso d’uso: editing conversazionale — 'rimuovi il passante, mantieni tutto il resto' — applicato alle clip finite invece di rigenerarle da capo. Una nota sull’ortografia che porta le persone alla pagina sbagliata: Kling O3 non è Hailuo 03. Quello è MiniMax H3, il modello di un’altra azienda.
Valutato in base ai nostri rendering e al registro pubblicato, rivisto man mano che i fatti evolvono — questa è una caratteristica di questa pagina, non una dichiarazione di esclusione di responsabilità.
• Identità bloccata da riferimento.
Fino a 7 immagini più un video opzionale definiscono il soggetto; MVL mantiene stabili volti, dettagli dell'abbigliamento, loghi e testo durante movimenti complessi della camera. Il benchmark per il lavoro in serie.
• Editing video conversazionale.
Rimozione e sostituzione di oggetti, modifiche dello sfondo, effetti — applicati a una clip finita come comandi in linguaggio naturale. Correggere è meglio che rigenerare.
• Coreferenza di più personaggi.
Diversi personaggi di riferimento in una sola scena, ciascuno con la propria identità — inquadrature d'insieme che mandano in confusione i modelli a riferimento singolo.
• Voce dai tuoi riferimenti.
Voci personalizzate generate da input video o immagine, con dialoghi nativi in cinque lingue — un portavoce del marchio che suona allo stesso modo in ogni clip.
• Conteggio dei riferimenti nella media.
7 immagini + video sono più che sufficienti per un singolo soggetto, ma MiniMax H3 accetta 12 file e Seedance 2.5 ne accetta 50 — le produzioni complete con kit di asset potrebbero richiedere una capacità di acquisizione maggiore.
• La trappola della denominazione.
'Kling O3' e 'Hailuo 03' sono modelli di aziende diverse; O3 vs V3 vs 2.6 confonde anche gli acquirenti più attenti. Controlla l'etichetta del modello prima di spendere.
• Standard 1080p.
L'output standard della linea O3 è in HD; il 4K della famiglia è disponibile su altre varianti. I brief sulla risoluzione vanno a Kling 3.0 o MiniMax H3.
• Il lavoro basato solo sui prompt è compito del gemello.
Senza riferimenti a cui ancorarsi, il suo vantaggio si riduce — i brief puramente text-to-video di solito riescono meglio su Kling 3.0, orientato prima di tutto ai prompt.
Copia nel generatore sopra, sostituisci le parentesi, esegui il rendering.
Carica: 7 foto della stessa persona (angolazioni, espressioni, figura intera)
"Il personaggio cammina attraverso un mercato mattutino, poi appare a una scrivania in ufficio, quindi su un tetto al tramonto — stesso volto, stessa corporatura, abiti che cambiano a ogni scena. Una battuta parlata in ciascuna. Suono ambientale per ogni luogo."
Angoli di riferimento variati danno a MVL un modello più completo del soggetto; autorizzare esplicitamente i cambi di outfit ('outfits changing per scene') impedisce al modello di bloccare l'abbigliamento insieme al volto. La demo accanto al generatore è questo prompt.
Inizia da: un clip che hai già generato
"Rimuovi il passante che attraversa dietro al soggetto al secondo 4. Mantieni il soggetto, la deriva della camera, l'illuminazione e tutto l'audio esattamente come sono."
Applica un timestamp al target, poi proteggi tutto il resto per nome — la clausola di protezione è ciò che mantiene una modifica chirurgicamente precisa. Questo è il flusso di lavoro che rende economico perfezionare render di 15 secondi.
Carica: riferimenti per il personaggio A e il personaggio B
"A e B discutono attraverso un tavolino da caffè — A gesticola con un cucchiaino, B si appoggia all’indietro ridendo. Alterna tagli tra inquadrature over-shoulder. Ognuno mantiene esattamente il proprio aspetto di riferimento. Sibilo della macchina per espresso, basso brusio del caffè."
Indicare chi fa cosa è sintassi di coreferenza: il modello associa ogni azione alla corretta identità referenziata. Senza di essa, le scene con due personaggi si scambiano i volti a metà inquadratura.
Il triangolo del controllo dei riferimenti: tre modelli che promettono tutti 'il tuo soggetto, mantenuto coerente,' con diverse dimensioni di input e filosofie di modifica. Stessi prompt in tutti e tre, valutati in base a ciò che pubblicheremmo. Tutti e tre selezionabili nel generatore qui sopra.
il successore di O1 che porta l'audio nativo, il multi-shot e l'editing conversazionale dell'architettura Omni a due livelli. La versione nel generatore sopra.
La scommessa di Kuaishou sul 'multimodale unificato primo nel settore': generazione di riferimenti, in-painting, trasferimento di stile ed estensione delle inquadrature fusi in un unico motore. O3 è questa idea, maturata.
modelli guidati dai prompt che hanno reso Kling un nome noto a livello globale, prima che la famiglia si dividesse nelle linee V3, guidata dai prompt, e O3, guidata dai riferimenti.
Stessa generazione, filosofia diversa. Kling O3 (Video 3.0 Omni) è orientato prima ai riferimenti: le tue immagini e il tuo video definiscono il soggetto, e l'architettura MVL mantiene quell'identità stabile tra le diverse inquadrature. Kling 3.0 (V3) è lavoro cinematografico orientato prima al prompt. Brief guidati dai riferimenti qui, brief guidati dai prompt nella pagina Kling 3.0.