Generator wideo AI Wan 3.0

Nowy model all-in-one od Alibaba: natywne 30-sekundowe klipy z promptu, obrazu — albo pliku PDF, prezentacji lub arkusza kalkulacyjnego. Jedyny model tutaj, który czyta dokumenty. Wpisz prompt poniżej i wypróbuj go, bez listy oczekujących.

Model
Prześlij obraz
Kliknij lub upuść tutaj obraz JPG, JPEG, PNG lub WEBP do 10 MB
Polecenie
0/5000
Proporcje wyjściowe
Auto
Rozdzielczość
Auto
Czas trwania(sekundy)
Auto
Próbka wideo
 

Deweloper

Laboratorium Alibaba Tongyi

Typ

Wszystko w jednym: generowanie + odniesienie + edycja

Czas trwania

2–30 s pojedynczy przebieg

Maks. wynik

1080p

Dane wejściowe dokumentu

pdf / ppt / xls / URL

Otwórz wagi

Zadeklarowano (Apache 2.0)

Poziom tutaj

Płatne kredyty

Nasz werdykt w jednym zdaniu: wybór dokumentu. Gdy materiał źródłowy jest prezentacją, instrukcją lub arkuszem kalkulacyjnym, nic innego nie potrafi go nawet odczytać.

Wan 3.0 wszedł do publicznej bety 6 sierpnia, a jego najostrzejszą przewagą nie jest 30-sekundowe pojedyncze ujęcie — Seedance zrobił to pierwszy — lecz to, co akceptuje jako dane wejściowe. Podaj mu podręcznik w PDF, prezentację sprzedażową albo kwartalny arkusz kalkulacyjny, a zbuduje film na podstawie ich zawartości, zachowując postacie, rekwizyty i układy zgodne ze źródłem. Alibaba połączyła też to, co wcześniej było czterema osobnymi modelami Wan, w jeden, dzięki czemu generowanie, odniesienia i edycja nie wymagają już przełączania modeli w trakcie procesu.

Szczera ocena

Gdzie Wan 3.0 wygrywa — a gdzie nie

Publiczna beta ma zaledwie kilka dni, więc są to pierwsze wrażenia z naszych testowych renderów oraz opublikowanej dokumentacji Alibaba — odpowiednio oznaczone. Zaktualizujemy je, gdy pojawią się niezależne dane.

Naprawdę silne

  • • Dokument na wideo.

    Odczytuje pliki doc, xls, ppt, pdf i podobne formaty do 100 MB lub 50 stron, a także strony internetowe według adresu URL, i generuje wideo na podstawie zawartości. Film szkoleniowy z instrukcji, demo z prezentacji — żaden inny model, który hostujemy, w ogóle nie potrafi tego zrobić.

  • • 30-sekundowe ujęcie bez cięć.

    Jedno natywne generowanie od 2 do 30 sekund, dwukrotnie więcej niż poprzedni limit Wan, z funkcją inteligentnego czasu trwania, która sugeruje odpowiednią długość dla Twojego promptu.

  • • Kompleksowy przepływ pracy.

    Wan 2.7 rozdzielał text-to-video, image-to-video, referencje i edycję między cztery modele. Wan 3.0 łączy je — jeden model ID, bez przełączania pipeline’u, referencje i edycje w tym samym miejscu.

  • • Wierność odniesieniu.

    Postacie, rekwizyty, głosy, układy przestrzenne i styl pozostają zgodne z Twoimi danymi wejściowymi — Alibaba ujmuje to jako „od generowania pojedynczej klatki do opowiedzenia całej historii”, a nasze wczesne testy potwierdzają deklarowaną ciągłość.

Znane limity

  • • Limit 1080p.

    Udokumentowane wyjścia to 480P, 720P i 1080P — brak poziomu 2K. Jeśli rozdzielczość jest kluczowym wymaganiem, MiniMax H3 ma tę kartę w ręku.

  • • Uzyskaj dostęp do tarć u źródła.

    W Alibaba Cloud model jest oznaczony jako wersja zapoznawcza, a ceny są dostępne tylko na zaproszenie. Tutaj pomijasz listę oczekujących, ale spodziewaj się przejściowych problemów z pojemnością po stronie dostawcy podczas skalowania wersji beta.

  • • Otwarte wagi: obiecane, niewydane.

    Apache 2.0 jest obiecywane; historia linii Wan w dostarczaniu otwartych wydań była nierówna. Wierz w przesłany plik, nie w zapowiedź.

  • • Benchmarki oczekują.

    Zadebiutował w najbardziej zatłoczonym miesiącu w historii wideo AI — każde twierdzenie o „najlepszym modelu” dotyczące jego, jego rywali lub wysuwane przez nas jest tymczasowe, dopóki nie pojawią się niezależne oceny.

Przepisy na prompty

Trzy prompty, które pokaż, do czego służy

Dwa z nich wykorzystują trik z dokumentem, którego nie ma nikt inny; trzeci to długie ujęcie. Skopiuj, zamień nawiasy, wyrenderuj.

Film-z-prezentacji-do-premiery

Prześlij: twoja prezentacja produktu (ppt/pdf, ≤50 stron)

"Przekształć tę prezentację w 30-sekundowy film premierowy: prezenter omawia po kolei trzy kluczowe funkcje, rendery produktu dokładnie odpowiadają slajdom, pozytywny ton korporacyjny, zakończ logo i hasłem z ostatniego slajdu."

Dlaczego to działa

Nazwanie struktury ("trzy kluczowe funkcje po kolei", "zakończ na ostatnim slajdzie") mówi modelowi, jak rozplanować jego 30 sekund na Twoich 12 slajdach. "Dopasuj slajdy dokładnie" uruchamia system wierności względem odniesienia — odczytuje Twoją prezentację, a nie ozdabia jej naokoło.

Podręcznik-w-klip-szkoleniowy

Prześlij: instrukcja obsługi sprzętu (pdf)

"30-sekundowy klip szkoleniowy z zakresu bezpieczeństwa z sekcji 3 tego podręcznika: operator demonstruje sekwencję uruchamiania krok po kroku, zbliżenia na każdy element sterujący nazwany w tekście, spokojny instruktaż lektorski, napisy zgodne z terminologią podręcznika."

Dlaczego to działa

Wskazanie sekcji utrzymuje 50-stronicowe dane wejściowe w skupieniu, a "terminologia zgodna z podręcznikiem" to instrukcja, która sprawia, że wynik nadaje się do rzeczywistego szkolenia zamiast ogólnego b-roll. Wersja arkusza kalkulacyjnego: podmień na xls i poproś o kwartalne podsumowanie oparte na wykresach.

Nieprzerwane ujęcie historii

"Jedno ciągłe 30-sekundowe ujęcie: [uliczna sprzedawczyni jedzenia] rozstawia swój stragan o świcie — rozkłada wózek, rozpala palnik, pierwszy klient przychodzi, gdy słońce wyłania się ponad dachy. Kamera przez cały czas powoli okrąża stragan. Poranne dźwięki otoczenia narastają do skwierczenia i rozmów."

Dlaczego to działa

Początek-środek-koniec zapisany jako jedno zdanie ciągłej akcji to forma, którą nagradzają modele długich ujęć. Kamera krążąca wokół obiektu to test wytrzymałości ciągłości — jeśli postać i układ pozostają spójne przez 360 stopni przez 30 sekund, model wykonuje swoją pracę.

Bezpośrednie starcie

Wan 3.0 vs Seedance 2.5 vs MiniMax H3

Trzy chińskie laboratoria, trzy flagowe modele, sześć tygodni. Te same prompty we wszystkich trzech, oceniane według tego, co byśmy wypuścili — wstępnie, biorąc pod uwagę, jak nowe są wszystkie. Porównaj je samodzielnie z jednego pola promptu.

JobWan 3.0Seedance 2.5MiniMax H3
Wprowadzanie dokumentu (pdf/ppt/xls) Tak — unikalne Nie Nie
Maks. długość klipu 30 s natywnie 30 s natywne (180 s beta) 15 s (wydłuż do ~30 s)
Maks. rozdzielczość 1080p Wysoka rozdzielczość przez pipeline rodziny natywne 2K
Tempo sterowane dźwiękiem ze ścieżki Nie Tak Odniesienie głosowe
Wszystko w jednym (generowanie + odniesienie + edycja) Jeden model Edycje regionów, oddzielne przepływy Edycje instrukcji
Koszt za klip Średni Najwyższa (długie renderowanie) Najniższa dla 2K
Mapa drogowa modeli z otwartymi wagami Apache 2.0 zadeklarowane Brak Zadeklarowano, niewysłane
Dostęp bez listy oczekujących Upstream tylko dla zaproszonych Otwórz Otwórz
Historia wersji

Linia Wan, w skrócie

sie 2026 · Obecnie

Wan 3.0

publiczna beta 6 sierpnia jako wan3.0-video w Alibaba Cloud. Natywne 30-sekundowe klipy, zamiana dokumentu na wideo, architektura all-in-one, zadeklarowane otwarte wagi na licencji Apache 2.0. Wersja na tej stronie.

Wcześniej

Wan 2.6 / 2.7

era komercyjna: solidne generowanie 15-sekundowe z przepływem pracy podzielonym na cztery wyspecjalizowane modele oraz historia open-source, która miała swoje wzloty i upadki. Wersje opisywane przez większość istniejących recenzji Wan.

Pochodzenie

Wan 2.1 / 2.2 — era otwartości

wydania, które zbudowały społeczność Wan: zdolne otwarte wagi, które zapoczątkowały fine-tuny i lokalne przepływy pracy, oraz powód, dla którego "czy wagi rzeczywiście zostaną udostępnione" jest pierwszym pytaniem, jakie każdy zadaje o Wan 3.0.

FAQ

Pytania o Wan 3.0, odpowiedzi wprost

1. Czym jest Wan 3.0?

Nowy flagowy model linii wideo Wan laboratorium Alibaba Tongyi Lab, uruchomiony w publicznej wersji beta 6 sierpnia 2026 r. pod identyfikatorem modelu wan3.0-video. Trzy najważniejsze zmiany: natywne 30-sekundowe klipy w jednym przebiegu (dwukrotność limitu Wan 2.7), system omni-reference, który akceptuje dokumenty — pliki PDF, prezentacje, arkusze kalkulacyjne, a nawet strony internetowe — jako kreatywne dane wejściowe, oraz architektura all-in-one łącząca cztery dotąd oddzielne modele Wan w jeden.

Inne modele

Nie to narzędzie? Wypróbuj sąsiednie

Seedance 2.5

Drugi model długich ujęć. 30-sekundowe ujęcia przycięte do Twojej ścieżki dźwiękowej.

MiniMax H3

Wybór 2K. Najtańsze klipy w wysokiej rozdzielczości z zablokowanymi postaciami i głosami.

FLUX 3

Stylista. 20-sekundowe klipy z dźwiękiem, od kinowych po poklatkowe.