Le modèle reference-first de Kuaishou: vos images et clips définissent le sujet, MVL le garde identique plan après plan — et vous modifiez le résultat en lui parlant. Saisissez un prompt ci-dessous et essayez-le.
Développeur
Kuaishou
Type
Multimodal guidé par référence (MVL)
Références
Jusqu’à 7 images + vidéo
Durée
3–15 s par clip
Audio
Natif · dialogue en 5 langues
Modification
Conversationnel, in situ
Niveau ici
Crédits payants (Std / Pro)
Notre verdict en une ligne : le choix de la cohérence pour le travail en série. Quand le même sujet doit survivre à des dizaines de générations — et que vous préférez corriger les clips plutôt que de les générer à nouveau — commencez ici.
Kling O3 — Video 3.0 Omni, la moitié guidée par référence de la génération 3.0 de Kuaishou — traite vos téléversements comme la vérité terrain. Fournissez-lui jusqu’à sept images d’un sujet, éventuellement un clip vidéo, et son architecture MVL maintient ce visage, ce logo ou cet accessoire exact stable à travers les mouvements de caméra, les changements de scène et les séquences à plans multiples ; des évaluateurs indépendants ont qualifié la série O3 de vidéo IA la plus contrôlable du début de 2026. L’autre moitié de son argument : le montage conversationnel — 'supprime le passant, garde tout le reste' — appliqué à des clips finalisés au lieu de les relancer. Une remarque orthographique qui envoie les gens vers la mauvaise page : Kling O3 n’est pas Hailuo 03. C’est MiniMax H3, le modèle d’une autre entreprise.
Évalué à partir de nos propres rendus et des archives publiées, révisé à mesure que les faits évoluent — c’est une caractéristique de cette page, pas une clause de non-responsabilité.
• Identité verrouillée par référence.
Jusqu'à 7 images plus une vidéo facultative définissent le sujet; MVL maintient la stabilité des visages, des détails vestimentaires, des logos et du texte lors de mouvements de caméra complexes. La référence pour le travail en série.
• Montage vidéo conversationnel.
Suppression et remplacement d’objets, changements d’arrière-plan, effets — appliqués à un clip finalisé sous forme de commandes en langage naturel. Mieux vaut corriger que relancer une génération.
• Coréférence de plusieurs personnages.
Plusieurs personnages de référence dans une même scène, chacun conservant sa propre identité — des plans d’ensemble qui déroutent les modèles à référence unique.
• Voix à partir de vos références.
Voix personnalisées dérivées d’entrées vidéo ou image, avec un dialogue natif dans cinq langues — un porte-parole de marque qui a la même voix dans chaque clip.
• Nombre de références dans la moyenne.
7 images + vidéo, c’est largement suffisant pour un seul sujet, mais MiniMax H3 accepte 12 fichiers et Seedance 2.5 en accepte 50 — les productions complètes avec kit de ressources peuvent nécessiter une capacité d’import plus élevée.
• Le piège du nommage.
'Kling O3' et 'Hailuo 03' sont des modèles de sociétés différentes; O3 vs V3 vs 2.6 déroute même les acheteurs attentifs. Vérifiez l’étiquette du modèle avant de dépenser.
• Standard 1080p.
La sortie standard de la gamme O3 est en HD ; la 4K de la famille se trouve sur d'autres variantes. Les briefs de résolution vont à Kling 3.0 ou MiniMax H3.
• Le travail uniquement basé sur des prompts est le rôle du jumeau.
Sans références auxquelles s’ancrer, son avantage se réduit — les briefs purement text-to-video donnent généralement de meilleurs résultats sur Kling 3.0, axé d’abord sur les prompts.
Copiez dans le générateur ci-dessus, remplacez les crochets, effectuez le rendu.
Téléverser: 7 photos de la même personne (angles, expressions, corps entier)
"Le personnage traverse un marché matinal, puis apparaît à un bureau, puis sur un toit au coucher du soleil — même visage, même carrure, tenues changeant selon la scène. Une réplique parlée dans chacune. Son d’ambiance pour chaque lieu."
Des angles de référence variés donnent à MVL un modèle plus complet du sujet; autoriser explicitement les changements de tenue ('outfits changing per scene') empêche le modèle de figer les vêtements avec le visage. La démo à côté du générateur correspond à ce prompt.
Commencer à partir de: un clip que vous avez déjà généré
"Supprimez le passant qui traverse derrière le sujet à la 4e seconde. Conservez le sujet, la dérive de la caméra, l’éclairage et tout l’audio exactement tels quels."
Horodatez la cible, puis protégez tout le reste par nom — la clause de protection est ce qui rend une modification chirurgicale. C’est le flux de travail qui rend peu coûteux le perfectionnement des rendus de 15 secondes.
Téléverser: références pour le personnage A et le personnage B
"A et B se disputent de part et d’autre d’une table de café — A gesticule avec une cuillère, B se renverse en arrière en riant. Alterner entre des plans par-dessus l’épaule. Chacun conserve exactement son apparence de référence. Sifflement de la machine à espresso, léger brouhaha de café."
Nommer qui fait quoi relève de la syntaxe de coréférence: le modèle associe chaque action à la bonne identité référencée. Sans elle, les scènes à deux personnages échangent les visages en plein plan.
Le triangle du contrôle des références: trois modèles qui promettent tous 'votre sujet, conservé de façon cohérente,' avec des tailles d’entrée et des philosophies d’édition différentes. Les mêmes prompts dans les trois, jugés selon ce que nous publierions. Tous les trois sélectionnables dans le générateur ci-dessus.
le successeur d'O1, apportant l'audio natif, le multi-shot et l'édition conversationnelle de l'architecture Omni à deux niveaux. La version dans le générateur ci-dessus.
Le pari de Kuaishou sur le 'multimodal unifié, une première dans le secteur': génération de références, in-painting, transfert de style et extension de plans fusionnés dans un seul moteur. O3 est cette idée, arrivée à maturité.
des modèles pilotés par des prompts qui ont fait de Kling un nom mondial, avant que la famille ne se scinde en deux gammes : V3, pilotée par les prompts, et O3, pilotée par les références.
Même génération, philosophie différente. Kling O3 (Video 3.0 Omni) privilégie les références : vos images et vidéos définissent le sujet, et l’architecture MVL verrouille cette identité d’un plan à l’autre. Kling 3.0 (V3) privilégie les prompts pour un travail cinématographique. Briefs guidés par les références ici, briefs guidés par les prompts sur la page Kling 3.0.