Model Kuaishou z priorytetem referencji: Twoje obrazy i klipy definiują obiekt, MVL utrzymuje go identycznym ujęcie po ujęciu — a wynik edytujesz, rozmawiając z nim. Wpisz poniżej prompt i wypróbuj.
Deweloper
Kuaishou
Typ
Multimodalny oparty na referencjach (MVL)
Odwołania
Do 7 obrazów + wideo
Czas trwania
3–15 s na klip
Audio
Natywny · dialog w 5 językach
Edytowanie
Konwersacyjnie, bezpośrednio w miejscu
Poziom tutaj
Płatne kredyty (Std / Pro)
Nasz werdykt w jednym zdaniu: wybór dla spójności przy pracy nad seriami. Gdy ten sam temat musi przetrwać dziesiątki generacji — a wolisz poprawiać klipy niż generować je od nowa — zacznij tutaj.
Kling O3 — Video 3.0 Omni, oparta na materiałach referencyjnych połowa generacji 3.0 Kuaishou — traktuje Twoje przesłane pliki jako źródło prawdy. Podaj mu do siedmiu obrazów przedstawiających obiekt, opcjonalnie klip wideo, a jego architektura MVL utrzyma dokładnie tę twarz, logo lub rekwizyt stabilnie podczas ruchów kamery, zmian scen i sekwencji wieloujęciowych; niezależni recenzenci nazwali serię O3 najbardziej sterowalnym wideo AI początku 2026 roku. Druga część jego atutów: edycja konwersacyjna — 'usuń przechodnia, zostaw wszystko inne' — stosowana do gotowych klipów zamiast generowania ich od nowa. Jedna uwaga dotycząca pisowni, która kieruje ludzi na złą stronę: Kling O3 to nie Hailuo 03. To MiniMax H3, model innej firmy.
Ocenione na podstawie naszych własnych renderów i opublikowanego zapisu, aktualizowane wraz ze zmianą faktów — to cecha tej strony, nie zastrzeżenie.
• Tożsamość zablokowana przez odniesienie.
Do 7 obrazów plus opcjonalne wideo definiują temat; MVL utrzymuje twarze, szczegóły ubioru, logotypy i tekst w stabilnej formie podczas złożonych ruchów kamery. Benchmark pracy nad seriami.
• Konwersacyjna edycja wideo.
Usuwanie i zastępowanie obiektów, zmiany tła, efekty — stosowane jako polecenia w języku naturalnym dla gotowego klipu. Poprawianie jest lepsze niż ponowne generowanie.
• Koreferencja wielu postaci.
Kilka postaci referencyjnych w jednej scenie, każda zachowująca własną tożsamość — ujęcia zespołowe, które modele z pojedynczą referencją mieszają.
• Głos na podstawie Twoich materiałów referencyjnych.
Niestandardowe głosy tworzone na podstawie materiałów wideo lub obrazów, z naturalnym dialogiem w pięciu językach — rzecznik marki, który brzmi tak samo w każdym klipie.
• Liczba odniesień w środku stawki.
7 obrazów + wideo to dużo dla jednego tematu, ale MiniMax H3 przyjmuje 12 plików, a Seedance 2.5 przyjmuje 50 — pełne produkcje z pakietem zasobów mogą potrzebować większej pojemności importu.
• Pułapka nazewnictwa.
'Kling O3' i 'Hailuo 03' to modele różnych firm; O3 vs V3 vs 2.6 dezorientuje nawet uważnych kupujących. Sprawdź etykietę modelu, zanim wydasz pieniądze.
• Standard 1080p.
Standardowe wyjście linii O3 to HD; 4K w tej rodzinie jest dostępne w innych wariantach. Briefy dotyczące rozdzielczości kieruj do Kling 3.0 lub MiniMax H3.
• Praca wyłącznie z promptami to zadanie bliźniaka.
Bez odniesień, na których można się oprzeć, jego przewaga maleje — briefy wyłącznie text-to-video zwykle wychodzą lepiej w stawiającym prompt na pierwszym miejscu Kling 3.0.
Skopiuj do generatora powyżej, zamień nawiasy, wyrenderuj.
Prześlij: 7 zdjęć tej samej osoby (ujęcia, wyrazy twarzy, cała sylwetka)
"Postać przechodzi przez poranny targ, potem pojawia się przy biurku w biurze, a następnie na dachu o zachodzie słońca — ta sama twarz, ta sama budowa, stroje zmieniają się w każdej scenie. W każdej jedna kwestia mówiona. Dźwięk otoczenia odpowiedni dla lokalizacji."
Zróżnicowane kąty odniesienia dają MVL zaokrąglony model obiektu; wyraźne zezwolenie na zmiany stroju ('outfits changing per scene') powstrzymuje model przed zamrożeniem ubrań razem z twarzą. Demo obok generatora to ten prompt.
Zacznij od: klip, który już wygenerowałeś
"Usuń przechodnia przechodzącego za obiektem w 4. sekundzie. Zachowaj obiekt, dryf kamery, oświetlenie i cały dźwięk dokładnie bez zmian."
Oznacz cel znacznikiem czasu, a potem chroń wszystko inne według nazwy — klauzula ochronna sprawia, że edycja pozostaje chirurgicznie precyzyjna. To przepływ pracy, który sprawia, że dopracowywanie 15-sekundowych renderów jest tanie.
Prześlij: referencje dla postaci A i postaci B
"A i B kłócą się przy stoliku w kawiarni — A gestykuluje łyżeczką, B odchyla się, śmiejąc się. Przebitki między ujęciami znad ramienia. Każde z nich zachowuje dokładnie swój wygląd referencyjny. Syk ekspresu do espresso, cichy gwar kawiarni."
Nazwanie tego, kto co robi, to składnia koreferencji: model przypisuje każde działanie do właściwej wskazanej tożsamości. Bez niej sceny z dwiema postaciami zamieniają twarze w środku ujęcia.
Trójkąt kontroli referencji: trzy modele, które wszystkie obiecują 'twój obiekt, zachowany spójnie,' z różnymi rozmiarami wejścia i filozofiami edycji. Te same prompty we wszystkich trzech, oceniane według tego, co wysłalibyśmy do publikacji. Wszystkie trzy do wyboru w generatorze powyżej.
następca O1, wprowadzający natywną obsługę audio, multi-shot i edycję konwersacyjną architektury Omni do dwóch poziomów. Wersja w powyższym generatorze.
Zakład Kuaishou na 'pierwszy w branży zunifikowany multimodalny' silnik: generowanie referencji, uzupełnianie obrazu, transfer stylu i rozszerzanie ujęć połączone w jednym silniku. O3 to ta idea, dojrzała.
modele sterowane promptami, które sprawiły, że Kling stał się globalnie rozpoznawalną nazwą, zanim rodzina podzieliła się na linię V3 kierowaną promptami i linię O3 kierowaną referencjami.
Ta sama generacja, inna filozofia. Kling O3 (Video 3.0 Omni) stawia na referencje: Twoje obrazy i wideo definiują temat, a architektura MVL utrzymuje jego tożsamość w kolejnych ujęciach. Kling 3.0 (V3) to filmowa praca oparta na promptach. Briefy oparte na referencjach tutaj, briefy oparte na promptach na stronie Kling 3.0.