Kuaishou's reference-first-model: je afbeeldingen en clips bepalen het onderwerp, MVL houdt het shot na shot identiek — en je bewerkt het resultaat door ermee te praten. Typ hieronder een prompt en probeer het.
Ontwikkelaar
Kuaishou
Type
Referentiegestuurd multimodaal (MVL)
Referenties
Tot 7 afbeeldingen + video
Duur
3–15 s per clip
Audio
Moedertaal · dialoog in 5 talen
Bewerken
Gespreksgericht, ter plaatse
Niveau hier
Betaalde credits (Std / Pro)
Ons oordeel in één zin: de keuze voor consistentie bij seriewerk. Wanneer hetzelfde onderwerp tientallen generaties moet overleven — en je liever clips corrigeert dan ze opnieuw genereert — begin hier.
Kling O3 — Video 3.0 Omni, de referentiegestuurde helft van Kuaishou's 3.0-generatie — behandelt je uploads als de bron van waarheid. Voer maximaal zeven afbeeldingen van een onderwerp in, optioneel met een videoclip, en de MVL-architectuur houdt dat exacte gezicht, logo of rekwisiet stabiel tijdens camerabewegingen, scèneovergangen en sequenties met meerdere shots; onafhankelijke reviewers noemden de O3-serie de meest beheersbare AI-video van begin 2026. De andere helft van zijn propositie: conversationele bewerking — 'verwijder de voorbijganger, laat al het andere staan' — toegepast op voltooide clips in plaats van ze opnieuw te genereren. Eén spellingsopmerking die mensen naar de verkeerde pagina stuurt: Kling O3 is niet Hailuo 03. Dat is MiniMax H3, een model van een ander bedrijf.
Beoordeeld op basis van onze eigen renders en het gepubliceerde dossier, herzien naarmate de feiten veranderen — dat is een kenmerk van deze pagina, geen disclaimer.
• Door referentie vergrendelde identiteit.
Tot 7 afbeeldingen plus optionele video definiëren het onderwerp; MVL houdt gezichten, kledingdetails, logo's en tekst stabiel tijdens complexe camerabewegingen. De benchmark voor seriewerk.
• Conversationele videobewerking.
Objecten verwijderen en vervangen, achtergrondwijzigingen, effecten — toegepast als opdrachten in natuurlijke taal op een voltooide clip. Corrigeren is beter dan opnieuw genereren.
• Coreferentie van meerdere personages.
Meerdere gerefereerde personages in één scène, elk met hun eigen identiteit — ensemble-opnamen die modellen met één referentie in de war brengen.
• Stem op basis van je referenties.
Aangepaste stemmen afgeleid van video- of beeldinvoer, met dialoog op moedertaalniveau in vijf talen — een merkwoordvoerder die in elke clip hetzelfde klinkt.
• Aantal referenties in de middenmoot.
7 afbeeldingen + video is ruim voldoende voor één onderwerp, maar MiniMax H3 neemt 12 bestanden en Seedance 2.5 neemt er 50 — volledige producties met asset-kit hebben mogelijk een grotere invoercapaciteit nodig.
• De naamgevingsval.
'Kling O3' en 'Hailuo 03' zijn modellen van verschillende bedrijven; O3 vs V3 vs 2.6 verwart zelfs zorgvuldige kopers. Controleer het modellabel voordat je geld uitgeeft.
• 1080p-standaard.
De standaarduitvoer van de O3-lijn is HD; 4K binnen de familie is beschikbaar op andere varianten. Resolutiebriefs gaan naar Kling 3.0 of MiniMax H3.
• Werk met alleen prompts is de taak van de tweeling.
Zonder referenties om op te leunen, wordt zijn voorsprong kleiner — pure text-to-video-briefs komen meestal beter uit in het prompt-first Kling 3.0.
Kopieer naar de generator hierboven, verwissel de haakjes, render.
Uploaden: 7 foto's van dezelfde persoon (hoeken, uitdrukkingen, volledig lichaam)
"Het personage loopt over een ochtendmarkt, verschijnt daarna aan een bureau op kantoor en vervolgens op een dak bij zonsondergang — hetzelfde gezicht, dezelfde lichaamsbouw, outfits veranderen per scène. Eén gesproken zin in elke scène. Omgevingsgeluid per locatie."
Gevarieerde referentiehoeken geven MVL een afgerond model van het onderwerp; het expliciet toestaan van outfitwijzigingen ('outfits changing per scene') voorkomt dat het model de kleding samen met het gezicht vastzet. De demo naast de generator is deze prompt.
Beginnen vanaf: een clip die je al hebt gegenereerd
"Verwijder de voorbijganger die achter het onderwerp langsloopt op de 4-secondenmarkering. Laat het onderwerp, de cameradrift, de belichting en alle audio precies zoals ze zijn."
Voorzie het doel van een tijdstempel en bescherm daarna al het andere op naam — de beschermingsclausule is wat een bewerking chirurgisch precies houdt. Dit is de workflow die het goedkoop maakt om renders van 15 seconden te perfectioneren.
Uploaden: referenties voor personage A en personage B
"A en B ruziën over een cafétafel heen — A gebaart met een lepel, B leunt lachend achterover. Snijd tussen over-shoulder shots. Beiden behouden exact hun referentie-uiterlijk. Gesis van de espressomachine, zacht cafégemurmel."
Benoemen wie wat doet is coreferentiesyntaxis: het model koppelt elke actie aan de juiste gerefereerde identiteit. Zonder die syntaxis wisselen scènes met twee personages halverwege de opname van gezicht.
De referentiecontrole-driehoek: drie modellen die allemaal 'je onderwerp, consistent gehouden,' beloven, met verschillende invoergroottes en bewerkingsfilosofieën. Dezelfde prompts in alle drie, beoordeeld op wat we zouden uitbrengen. Alle drie selecteerbaar in de generator hierboven.
de opvolger van O1 die de native audio, multi-shot en conversationele bewerking van de Omni-architectuur naar twee niveaus brengt. De versie in de generator hierboven.
Kuaishou's gok op 'de eerste uniforme multimodale aanpak in de branche': referentiegeneratie, in-painting, stijloverdracht en shot-uitbreiding samengebracht in één engine. O3 is dit idee, gerijpt.
promptgestuurde modellen die Kling tot een wereldwijde naam maakten, voordat de familie zich opsplitste in de promptgeleide V3- en referentiegeleide O3-lijnen.
Dezelfde generatie, andere filosofie. Kling O3 (Video 3.0 Omni) is referentiegericht: je afbeeldingen en video definiëren het onderwerp, en de MVL-architectuur houdt die identiteit vast in alle shots. Kling 3.0 (V3) is promptgericht filmisch werk. Referentiegestuurde briefs hier, promptgestuurde briefs op de Kling 3.0-pagina.