Il nuovo modello all-in-one di Alibaba: clip native da 30 secondi da un prompt, un'immagine — oppure un PDF, una presentazione o un foglio di calcolo. L'unico modello qui che legge i documenti. Digita un prompt qui sotto e provalo, senza lista d'attesa.
Sviluppatore
Laboratorio Alibaba Tongyi
Tipo
Tutto in uno: generazione + riferimento + modifica
Durata
2–30 s passaggio singolo
Output max
1080p
Input documento
pdf / ppt / xls / URL
Apri pesi
Promesso (Apache 2.0)
Livello qui
Crediti a pagamento
Il nostro verdetto in una riga: la selezione del documento. Quando il materiale di origine è una presentazione, un manuale o un foglio di calcolo, nient'altro riesce nemmeno a leggerlo.
Wan 3.0 è entrato in beta pubblica il 6 agosto, e il suo vantaggio più affilato non è il singolo take da 30 secondi — Seedance ci è arrivato prima — ma ciò che accetta come input. Dagli un manuale PDF, un pitch deck o un foglio di calcolo trimestrale e costruisce il video dai contenuti, mantenendo personaggi, oggetti di scena e layout coerenti con la fonte. Alibaba ha anche unificato quelli che prima erano quattro modelli Wan separati in uno solo, quindi generazione, riferimento e modifica non richiedono più di cambiare modello a metà pipeline.
La beta pubblica ha solo pochi giorni, quindi queste sono prime impressioni basate sui nostri rendering di prova e sulla documentazione pubblicata da Alibaba — indicate come tali. Le rivedremo non appena saranno disponibili dati indipendenti.
• Da documento a video.
Legge doc, xls, ppt, pdf e formati simili fino a 100 MB o 50 pagine, oltre a pagine web tramite URL, e genera video dai contenuti. Un video di formazione da un manuale, una demo da una presentazione — nessun altro modello che ospitiamo può farlo in alcun modo.
• Il piano sequenza di 30 secondi.
Una generazione nativa da 2 a 30 secondi, il doppio del precedente limite di Wan, con una funzione di durata intelligente che suggerisce la lunghezza giusta per il tuo prompt.
• Flusso di lavoro tutto in uno.
Wan 2.7 separava text-to-video, image-to-video, riferimenti e modifica su quattro modelli. Wan 3.0 li unisce — un unico ID modello, nessun cambio di pipeline, riferimenti e modifiche nello stesso posto.
• Fedeltà al riferimento.
Personaggi, oggetti di scena, voci, layout spaziali e stile restano coerenti con i tuoi input — la formulazione di Alibaba è “dal generare un fotogramma al raccontare un'intera storia”, e i nostri primi test confermano l'affermazione sulla continuità.
• Limite 1080p.
Gli output documentati sono 480P, 720P e 1080P — nessun livello 2K. Se la risoluzione è il requisito, MiniMax H3 ha questa carta in mano.
• Accedi agli attriti a monte.
Su Alibaba Cloud il modello è contrassegnato come anteprima e i prezzi sono disponibili solo su invito. Qui salti la lista d'attesa, ma aspettati qualche intoppo nella capacità upstream mentre la beta viene scalata.
• Pesi aperti: promessi, non rilasciati.
Apache 2.0 è promesso; lo storico della linea Wan nel fornire release aperte è stato altalenante. Credete al caricamento, non all'annuncio.
• Benchmark in sospeso.
È stato lanciato nel mese più affollato nella storia dei video AI — ogni affermazione sul “miglior modello” riguardo a esso, ai suoi rivali o da parte nostra è provvisoria finché non arrivano punteggi indipendenti.
Due di questi usano il trucco del documento che nessun altro ha; il terzo è il piano sequenza. Copia, scambia le parentesi, renderizza.
Carica: il tuo deck di prodotto (ppt/pdf, ≤50 pagine)
"Trasforma questa presentazione in un video di lancio di 30 secondi: un presentatore illustra in ordine le tre funzionalità chiave, i render del prodotto corrispondono esattamente alle slide, tono aziendale vivace, chiusura sul logo e sul tagline della slide finale."
Dare un nome alla struttura ("tre funzionalità chiave in ordine", "termina sulla diapositiva finale") indica al modello come impiegare i suoi 30 secondi sulle tue 12 diapositive. "Abbina esattamente le diapositive" richiama il sistema di fedeltà al riferimento — sta leggendo la tua presentazione, non la sta decorando intorno.
Carica: un manuale dell'attrezzatura (pdf)
"Una clip di formazione sulla sicurezza di 30 secondi dalla sezione 3 di questo manuale: un operatore dimostra la sequenza di avvio passo dopo passo, primi piani su ogni comando nominato nel testo, voce fuori campo istruttiva e calma, sottotitoli coerenti con la terminologia del manuale."
Indicare una sezione mantiene focalizzato un input di 50 pagine, e "terminologia corrispondente al manuale" è l'istruzione che rende l'output utilizzabile per una formazione reale invece che per b-roll generico. Versione foglio di calcolo: inserisci un xls e chiedi un riepilogo trimestrale guidato dai grafici.
"Un'unica ripresa continua di 30 secondi: una [venditrice di cibo di strada] allestisce la sua bancarella all'alba — apre il carretto, accende il bruciatore, il primo cliente arriva mentre il sole supera i tetti. La camera gira lentamente intorno alla bancarella per tutto il tempo. I suoni ambientali del mattino crescono fino a friggere e chiacchiericcio."
Un inizio-sviluppo-fine scritto come un’unica frase di azione continua è la forma che i modelli per long take premiano. La camera che gira intorno è lo stress test della continuità — se personaggio e layout reggono per 360 gradi per 30 secondi, il modello sta facendo il suo lavoro.
Tre laboratori cinesi, tre modelli di punta, sei settimane. Gli stessi prompt su tutti e tre, valutati in base a ciò che rilasceremmo — provvisoriamente, considerando quanto siano nuovi tutti quanti. Confrontali tu stesso da un'unica casella prompt.
beta pubblica il 6 agosto come wan3.0-video su Alibaba Cloud. Clip native di 30 secondi, da documento a video, architettura all-in-one, pesi aperti Apache 2.0 promessi. La versione su questa pagina.
l'era commerciale: solida generazione di 15 secondi con il flusso di lavoro suddiviso tra quattro modelli specializzati, e una storia open-source fatta di alti e bassi. Le versioni descritte dalla maggior parte delle recensioni esistenti di Wan.
le release che hanno costruito la community di Wan: pesi aperti capaci che hanno dato origine a fine-tuning e flussi di lavoro locali, e il motivo per cui "i pesi verranno davvero rilasciati" è la prima domanda che chiunque si pone su Wan 3.0.
Il nuovo modello di punta della linea video Wan di Alibaba Tongyi Lab, lanciato in beta pubblica il 6 agosto 2026 con l'ID modello wan3.0-video. Tre novità principali: clip native di 30 secondi in un singolo passaggio (il doppio del limite di Wan 2.7), un sistema omni-reference che accetta documenti — PDF, presentazioni, fogli di calcolo, persino pagine web — come input creativi, e un'architettura all-in-one che unisce in uno solo quelli che prima erano quattro modelli Wan separati.