Kuaishous referens-först-modell: dina bilder och klipp definierar motivet, MVL håller det identiskt tagning efter tagning — och du redigerar resultatet genom att prata med det. Skriv en prompt nedan och prova.
Utvecklare
Kuaishou
Typ
Referensledd multimodal (MVL)
Referenser
Upp till 7 bilder + video
Varaktighet
3–15 s per klipp
Ljud
Modersmål · dialog på 5 språk
Redigerar
Konversationellt, på plats
Nivå här
Betalda krediter (Std / Pro)
Vårt omdöme på en rad: valet för enhetlighet i seriearbete. När samma motiv måste överleva dussintals generationer — och du hellre fixar klipp än genererar om dem — börja här.
Kling O3 — Video 3.0 Omni, den referensstyrda halvan av Kuaishous 3.0-generation — behandlar dina uppladdningar som facit. Mata den med upp till sju bilder av ett motiv, eventuellt ett videoklipp, och dess MVL-arkitektur håller just det ansiktet, den logotypen eller den rekvisitan stabil genom kamerarörelser, scenbyten och sekvenser med flera tagningar; oberoende recensenter kallade O3-serien den mest styrbara AI-videon i början av 2026. Den andra halvan av dess argument: samtalsbaserad redigering — 'ta bort förbipasserande, behåll allt annat' — tillämpad på färdiga klipp i stället för att generera om dem. En stavningsanmärkning som skickar folk till fel sida: Kling O3 är inte Hailuo 03. Det är MiniMax H3, en modell från ett annat företag.
Bedömt utifrån våra egna renderingar och den publicerade dokumentationen, reviderat när fakta förändras — det är en funktion på den här sidan, inte en ansvarsfriskrivning.
• Referenslåst identitet.
Upp till 7 bilder plus valfri video definierar motivet; MVL håller ansikten, kläddetaljer, logotyper och text stabila genom komplexa kamerarörelser. Benchmarken för seriearbete.
• Konversationsbaserad videoredigering.
Borttagning och ersättning av objekt, bakgrundsändringar, effekter — tillämpas som kommandon på naturligt språk på ett färdigt klipp. Att korrigera är bättre än att generera om.
• Koreferens för flera karaktärer.
Flera refererade karaktärer i en scen, var och en med sin egen identitet — ensemblebilder som modeller med en enda referens blandar ihop.
• Röst från dina referenser.
Anpassade röster härledda från video- eller bildinmatningar, med dialog på modersmålsnivå på fem språk — en varumärkestalesperson som låter likadant i varje klipp.
• Antal referenser i mitten av fältet.
7 bilder + video är gott om för ett ämne, men MiniMax H3 tar 12 filer och Seedance 2.5 tar 50 — fullständiga produktioner med asset-kit kan behöva större intagskapacitet.
• Namngivningsfällan.
'Kling O3' och 'Hailuo 03' är modeller från olika företag; O3 vs V3 vs 2.6 förvirrar även noggranna köpare. Kontrollera modelletiketten innan du spenderar.
• 1080p-standard.
Standardutdata för O3-serien ligger på HD; familjens 4K finns i andra varianter. Upplösningsbriefar går till Kling 3.0 eller MiniMax H3.
• Arbete med enbart prompter är tvillingens jobb.
Utan referenser att förankra sig i minskar dess försprång — rena text-to-video-briefar blir vanligtvis bättre i prompt-first Kling 3.0.
Kopiera till generatorn ovan, byt ut hakparenteserna, rendera.
Ladda upp: 7 foton av samma person (vinklar, uttryck, helkropp)
"Karaktären går genom en morgonmarknad, dyker sedan upp vid ett skrivbord på ett kontor och sedan på ett tak vid solnedgången — samma ansikte, samma kroppsbyggnad, kläderna ändras per scen. En talad replik i varje. Omgivningsljud per plats."
Varierade referensvinklar ger MVL en mer heltäckande modell av motivet; att uttryckligen tillåta outfitbyten ('outfits changing per scene') hindrar modellen från att låsa kläderna tillsammans med ansiktet. Demot bredvid generatorn är denna prompt.
Börja från: ett klipp som du redan har genererat
"Ta bort förbipasserande som korsar bakom motivet vid 4-sekundersmarkeringen. Behåll motivet, kameradriften, belysningen och allt ljud exakt som de är."
Tidsstämpla målet och skydda sedan allt annat efter namn — skyddsklausulen är det som håller en redigering kirurgiskt precis. Det här är arbetsflödet som gör det billigt att finslipa 15-sekundersrenderingar till perfektion.
Ladda upp: referenser för karaktär A och karaktär B
"A och B grälar över ett kafébord — A gestikulerar med en sked, B lutar sig bakåt och skrattar. Klipp mellan över-axeln-bilder. Var och en behåller sitt exakta referensutseende. Espressomaskinens pysande, lågmält kafésorl."
Att namnge vem som gör vad är koreferenssyntax: modellen mappar varje handling till rätt refererad identitet. Utan den byter scener med två karaktärer ansikten mitt i tagningen.
Referenskontrolltriangeln: tre modeller som alla utlovar 'ditt motiv, konsekvent bibehållet,' med olika inmatningsstorlekar och redigeringsfilosofier. Samma prompter i alla tre, bedömda efter vad vi skulle leverera. Alla tre kan väljas i generatorn ovan.
O1-efterföljaren som för Omni-arkitekturens inbyggda ljud, multi-shot och konversationsbaserade redigering till två nivåer. Versionen i generatorn ovan.
Kuaishous satsning på 'branschens första enhetliga multimodala' lösning: referensgenerering, in-painting, stilöverföring och shot-förlängning sammansmälta i en enda motor. O3 är denna idé, mognad.
promptdrivna modeller som gjorde Kling till ett globalt namn, innan familjen delades upp i de promptledda V3- och referensledda O3-linjerna.
Samma generation, olika filosofi. Kling O3 (Video 3.0 Omni) är referensstyrd: dina bilder och din video definierar motivet, och MVL-arkitekturen håller identiteten låst mellan tagningar. Kling 3.0 (V3) är promptstyrt filmiskt arbete. Referensdrivna briefar här, promptdrivna briefar på Kling 3.0-sidan.