Nowy model all-in-one od Alibaba: natywne 30-sekundowe klipy z promptu, obrazu — albo pliku PDF, prezentacji lub arkusza kalkulacyjnego. Jedyny model tutaj, który czyta dokumenty. Wpisz prompt poniżej i wypróbuj go, bez listy oczekujących.
Deweloper
Laboratorium Alibaba Tongyi
Typ
Wszystko w jednym: generowanie + odniesienie + edycja
Czas trwania
2–30 s pojedynczy przebieg
Maks. wynik
1080p
Dane wejściowe dokumentu
pdf / ppt / xls / URL
Otwórz wagi
Zadeklarowano (Apache 2.0)
Poziom tutaj
Płatne kredyty
Nasz werdykt w jednym zdaniu: wybór dokumentu. Gdy materiał źródłowy jest prezentacją, instrukcją lub arkuszem kalkulacyjnym, nic innego nie potrafi go nawet odczytać.
Wan 3.0 wszedł do publicznej bety 6 sierpnia, a jego najostrzejszą przewagą nie jest 30-sekundowe pojedyncze ujęcie — Seedance zrobił to pierwszy — lecz to, co akceptuje jako dane wejściowe. Podaj mu podręcznik w PDF, prezentację sprzedażową albo kwartalny arkusz kalkulacyjny, a zbuduje film na podstawie ich zawartości, zachowując postacie, rekwizyty i układy zgodne ze źródłem. Alibaba połączyła też to, co wcześniej było czterema osobnymi modelami Wan, w jeden, dzięki czemu generowanie, odniesienia i edycja nie wymagają już przełączania modeli w trakcie procesu.
Publiczna beta ma zaledwie kilka dni, więc są to pierwsze wrażenia z naszych testowych renderów oraz opublikowanej dokumentacji Alibaba — odpowiednio oznaczone. Zaktualizujemy je, gdy pojawią się niezależne dane.
• Dokument na wideo.
Odczytuje pliki doc, xls, ppt, pdf i podobne formaty do 100 MB lub 50 stron, a także strony internetowe według adresu URL, i generuje wideo na podstawie zawartości. Film szkoleniowy z instrukcji, demo z prezentacji — żaden inny model, który hostujemy, w ogóle nie potrafi tego zrobić.
• 30-sekundowe ujęcie bez cięć.
Jedno natywne generowanie od 2 do 30 sekund, dwukrotnie więcej niż poprzedni limit Wan, z funkcją inteligentnego czasu trwania, która sugeruje odpowiednią długość dla Twojego promptu.
• Kompleksowy przepływ pracy.
Wan 2.7 rozdzielał text-to-video, image-to-video, referencje i edycję między cztery modele. Wan 3.0 łączy je — jeden model ID, bez przełączania pipeline’u, referencje i edycje w tym samym miejscu.
• Wierność odniesieniu.
Postacie, rekwizyty, głosy, układy przestrzenne i styl pozostają zgodne z Twoimi danymi wejściowymi — Alibaba ujmuje to jako „od generowania pojedynczej klatki do opowiedzenia całej historii”, a nasze wczesne testy potwierdzają deklarowaną ciągłość.
• Limit 1080p.
Udokumentowane wyjścia to 480P, 720P i 1080P — brak poziomu 2K. Jeśli rozdzielczość jest kluczowym wymaganiem, MiniMax H3 ma tę kartę w ręku.
• Uzyskaj dostęp do tarć u źródła.
W Alibaba Cloud model jest oznaczony jako wersja zapoznawcza, a ceny są dostępne tylko na zaproszenie. Tutaj pomijasz listę oczekujących, ale spodziewaj się przejściowych problemów z pojemnością po stronie dostawcy podczas skalowania wersji beta.
• Otwarte wagi: obiecane, niewydane.
Apache 2.0 jest obiecywane; historia linii Wan w dostarczaniu otwartych wydań była nierówna. Wierz w przesłany plik, nie w zapowiedź.
• Benchmarki oczekują.
Zadebiutował w najbardziej zatłoczonym miesiącu w historii wideo AI — każde twierdzenie o „najlepszym modelu” dotyczące jego, jego rywali lub wysuwane przez nas jest tymczasowe, dopóki nie pojawią się niezależne oceny.
Dwa z nich wykorzystują trik z dokumentem, którego nie ma nikt inny; trzeci to długie ujęcie. Skopiuj, zamień nawiasy, wyrenderuj.
Prześlij: twoja prezentacja produktu (ppt/pdf, ≤50 stron)
"Przekształć tę prezentację w 30-sekundowy film premierowy: prezenter omawia po kolei trzy kluczowe funkcje, rendery produktu dokładnie odpowiadają slajdom, pozytywny ton korporacyjny, zakończ logo i hasłem z ostatniego slajdu."
Nazwanie struktury ("trzy kluczowe funkcje po kolei", "zakończ na ostatnim slajdzie") mówi modelowi, jak rozplanować jego 30 sekund na Twoich 12 slajdach. "Dopasuj slajdy dokładnie" uruchamia system wierności względem odniesienia — odczytuje Twoją prezentację, a nie ozdabia jej naokoło.
Prześlij: instrukcja obsługi sprzętu (pdf)
"30-sekundowy klip szkoleniowy z zakresu bezpieczeństwa z sekcji 3 tego podręcznika: operator demonstruje sekwencję uruchamiania krok po kroku, zbliżenia na każdy element sterujący nazwany w tekście, spokojny instruktaż lektorski, napisy zgodne z terminologią podręcznika."
Wskazanie sekcji utrzymuje 50-stronicowe dane wejściowe w skupieniu, a "terminologia zgodna z podręcznikiem" to instrukcja, która sprawia, że wynik nadaje się do rzeczywistego szkolenia zamiast ogólnego b-roll. Wersja arkusza kalkulacyjnego: podmień na xls i poproś o kwartalne podsumowanie oparte na wykresach.
"Jedno ciągłe 30-sekundowe ujęcie: [uliczna sprzedawczyni jedzenia] rozstawia swój stragan o świcie — rozkłada wózek, rozpala palnik, pierwszy klient przychodzi, gdy słońce wyłania się ponad dachy. Kamera przez cały czas powoli okrąża stragan. Poranne dźwięki otoczenia narastają do skwierczenia i rozmów."
Początek-środek-koniec zapisany jako jedno zdanie ciągłej akcji to forma, którą nagradzają modele długich ujęć. Kamera krążąca wokół obiektu to test wytrzymałości ciągłości — jeśli postać i układ pozostają spójne przez 360 stopni przez 30 sekund, model wykonuje swoją pracę.
Trzy chińskie laboratoria, trzy flagowe modele, sześć tygodni. Te same prompty we wszystkich trzech, oceniane według tego, co byśmy wypuścili — wstępnie, biorąc pod uwagę, jak nowe są wszystkie. Porównaj je samodzielnie z jednego pola promptu.
publiczna beta 6 sierpnia jako wan3.0-video w Alibaba Cloud. Natywne 30-sekundowe klipy, zamiana dokumentu na wideo, architektura all-in-one, zadeklarowane otwarte wagi na licencji Apache 2.0. Wersja na tej stronie.
era komercyjna: solidne generowanie 15-sekundowe z przepływem pracy podzielonym na cztery wyspecjalizowane modele oraz historia open-source, która miała swoje wzloty i upadki. Wersje opisywane przez większość istniejących recenzji Wan.
wydania, które zbudowały społeczność Wan: zdolne otwarte wagi, które zapoczątkowały fine-tuny i lokalne przepływy pracy, oraz powód, dla którego "czy wagi rzeczywiście zostaną udostępnione" jest pierwszym pytaniem, jakie każdy zadaje o Wan 3.0.
Nowy flagowy model linii wideo Wan laboratorium Alibaba Tongyi Lab, uruchomiony w publicznej wersji beta 6 sierpnia 2026 r. pod identyfikatorem modelu wan3.0-video. Trzy najważniejsze zmiany: natywne 30-sekundowe klipy w jednym przebiegu (dwukrotność limitu Wan 2.7), system omni-reference, który akceptuje dokumenty — pliki PDF, prezentacje, arkusze kalkulacyjne, a nawet strony internetowe — jako kreatywne dane wejściowe, oraz architektura all-in-one łącząca cztery dotąd oddzielne modele Wan w jeden.
Drugi model długich ujęć. 30-sekundowe ujęcia przycięte do Twojej ścieżki dźwiękowej.
Wybór 2K. Najtańsze klipy w wysokiej rozdzielczości z zablokowanymi postaciami i głosami.
Stylista. 20-sekundowe klipy z dźwiękiem, od kinowych po poklatkowe.