Generatore video AI Wan 3.0

Il nuovo modello all-in-one di Alibaba: clip native da 30 secondi da un prompt, un'immagine — oppure un PDF, una presentazione o un foglio di calcolo. L'unico modello qui che legge i documenti. Digita un prompt qui sotto e provalo, senza lista d'attesa.

Modello
Carica immagine
Fai clic o trascina qui un'immagine JPG, JPEG, PNG o WEBP fino a 10 MB
Prompt
0/5000
Proporzioni di output
Auto
Risoluzione
Auto
Durata(secondi)
Auto
Esempio video
 

Sviluppatore

Laboratorio Alibaba Tongyi

Tipo

Tutto in uno: generazione + riferimento + modifica

Durata

2–30 s passaggio singolo

Output max

1080p

Input documento

pdf / ppt / xls / URL

Apri pesi

Promesso (Apache 2.0)

Livello qui

Crediti a pagamento

Il nostro verdetto in una riga: la selezione del documento. Quando il materiale di origine è una presentazione, un manuale o un foglio di calcolo, nient'altro riesce nemmeno a leggerlo.

Wan 3.0 è entrato in beta pubblica il 6 agosto, e il suo vantaggio più affilato non è il singolo take da 30 secondi — Seedance ci è arrivato prima — ma ciò che accetta come input. Dagli un manuale PDF, un pitch deck o un foglio di calcolo trimestrale e costruisce il video dai contenuti, mantenendo personaggi, oggetti di scena e layout coerenti con la fonte. Alibaba ha anche unificato quelli che prima erano quattro modelli Wan separati in uno solo, quindi generazione, riferimento e modifica non richiedono più di cambiare modello a metà pipeline.

Lettura onesta

Dove Wan 3.0 vince — e dove no

La beta pubblica ha solo pochi giorni, quindi queste sono prime impressioni basate sui nostri rendering di prova e sulla documentazione pubblicata da Alibaba — indicate come tali. Le rivedremo non appena saranno disponibili dati indipendenti.

Davvero forte

  • • Da documento a video.

    Legge doc, xls, ppt, pdf e formati simili fino a 100 MB o 50 pagine, oltre a pagine web tramite URL, e genera video dai contenuti. Un video di formazione da un manuale, una demo da una presentazione — nessun altro modello che ospitiamo può farlo in alcun modo.

  • • Il piano sequenza di 30 secondi.

    Una generazione nativa da 2 a 30 secondi, il doppio del precedente limite di Wan, con una funzione di durata intelligente che suggerisce la lunghezza giusta per il tuo prompt.

  • • Flusso di lavoro tutto in uno.

    Wan 2.7 separava text-to-video, image-to-video, riferimenti e modifica su quattro modelli. Wan 3.0 li unisce — un unico ID modello, nessun cambio di pipeline, riferimenti e modifiche nello stesso posto.

  • • Fedeltà al riferimento.

    Personaggi, oggetti di scena, voci, layout spaziali e stile restano coerenti con i tuoi input — la formulazione di Alibaba è “dal generare un fotogramma al raccontare un'intera storia”, e i nostri primi test confermano l'affermazione sulla continuità.

Limiti noti

  • • Limite 1080p.

    Gli output documentati sono 480P, 720P e 1080P — nessun livello 2K. Se la risoluzione è il requisito, MiniMax H3 ha questa carta in mano.

  • • Accedi agli attriti a monte.

    Su Alibaba Cloud il modello è contrassegnato come anteprima e i prezzi sono disponibili solo su invito. Qui salti la lista d'attesa, ma aspettati qualche intoppo nella capacità upstream mentre la beta viene scalata.

  • • Pesi aperti: promessi, non rilasciati.

    Apache 2.0 è promesso; lo storico della linea Wan nel fornire release aperte è stato altalenante. Credete al caricamento, non all'annuncio.

  • • Benchmark in sospeso.

    È stato lanciato nel mese più affollato nella storia dei video AI — ogni affermazione sul “miglior modello” riguardo a esso, ai suoi rivali o da parte nostra è provvisoria finché non arrivano punteggi indipendenti.

Ricette per prompt

Tre prompt che mostra a cosa serve

Due di questi usano il trucco del documento che nessun altro ha; il terzo è il piano sequenza. Copia, scambia le parentesi, renderizza.

Il-video-dal-deck-al-lancio

Carica: il tuo deck di prodotto (ppt/pdf, ≤50 pagine)

"Trasforma questa presentazione in un video di lancio di 30 secondi: un presentatore illustra in ordine le tre funzionalità chiave, i render del prodotto corrispondono esattamente alle slide, tono aziendale vivace, chiusura sul logo e sul tagline della slide finale."

Perché funziona

Dare un nome alla struttura ("tre funzionalità chiave in ordine", "termina sulla diapositiva finale") indica al modello come impiegare i suoi 30 secondi sulle tue 12 diapositive. "Abbina esattamente le diapositive" richiama il sistema di fedeltà al riferimento — sta leggendo la tua presentazione, non la sta decorando intorno.

Dal-manuale-alla-clip-di-formazione

Carica: un manuale dell'attrezzatura (pdf)

"Una clip di formazione sulla sicurezza di 30 secondi dalla sezione 3 di questo manuale: un operatore dimostra la sequenza di avvio passo dopo passo, primi piani su ogni comando nominato nel testo, voce fuori campo istruttiva e calma, sottotitoli coerenti con la terminologia del manuale."

Perché funziona

Indicare una sezione mantiene focalizzato un input di 50 pagine, e "terminologia corrispondente al manuale" è l'istruzione che rende l'output utilizzabile per una formazione reale invece che per b-roll generico. Versione foglio di calcolo: inserisci un xls e chiedi un riepilogo trimestrale guidato dai grafici.

Lo scatto narrativo ininterrotto

"Un'unica ripresa continua di 30 secondi: una [venditrice di cibo di strada] allestisce la sua bancarella all'alba — apre il carretto, accende il bruciatore, il primo cliente arriva mentre il sole supera i tetti. La camera gira lentamente intorno alla bancarella per tutto il tempo. I suoni ambientali del mattino crescono fino a friggere e chiacchiericcio."

Perché funziona

Un inizio-sviluppo-fine scritto come un’unica frase di azione continua è la forma che i modelli per long take premiano. La camera che gira intorno è lo stress test della continuità — se personaggio e layout reggono per 360 gradi per 30 secondi, il modello sta facendo il suo lavoro.

Testa a testa

Wan 3.0 vs Seedance 2.5 vs MiniMax H3

Tre laboratori cinesi, tre modelli di punta, sei settimane. Gli stessi prompt su tutti e tre, valutati in base a ciò che rilasceremmo — provvisoriamente, considerando quanto siano nuovi tutti quanti. Confrontali tu stesso da un'unica casella prompt.

JobWan 3.0Seedance 2.5MiniMax H3
Inserimento documento (pdf/ppt/xls) Sì — unico No No
Lunghezza max clip 30 s nativo 30 s nativo (180 s beta) 15 s (estendi a ~30 s)
Risoluzione max 1080p Alta risoluzione tramite pipeline familiare 2K nativo
Ritmo guidato dall'audio di una traccia No Riferimento vocale
Tutto in uno (generazione + riferimento + modifica) Un modello Modifiche alle regioni, flussi separati Modifiche alle istruzioni
Costo per clip Medio Massima (rendering lunghi) Il più basso per 2K
Roadmap dei modelli con pesi aperti Apache 2.0 promesso Nessuno Impegnato, non spedito
Accesso senza lista d'attesa Upstream solo su invito Apri Apri
Cronologia delle versioni

La linea Wan, in breve

ago 2026 · Attuale

Wan 3.0

beta pubblica il 6 agosto come wan3.0-video su Alibaba Cloud. Clip native di 30 secondi, da documento a video, architettura all-in-one, pesi aperti Apache 2.0 promessi. La versione su questa pagina.

Prima

Wan 2.6 / 2.7

l'era commerciale: solida generazione di 15 secondi con il flusso di lavoro suddiviso tra quattro modelli specializzati, e una storia open-source fatta di alti e bassi. Le versioni descritte dalla maggior parte delle recensioni esistenti di Wan.

Origine

Wan 2.1 / 2.2 — l'era aperta

le release che hanno costruito la community di Wan: pesi aperti capaci che hanno dato origine a fine-tuning e flussi di lavoro locali, e il motivo per cui "i pesi verranno davvero rilasciati" è la prima domanda che chiunque si pone su Wan 3.0.

FAQ

Domande su Wan 3.0, risposte dirette

1. Che cos'è Wan 3.0?

Il nuovo modello di punta della linea video Wan di Alibaba Tongyi Lab, lanciato in beta pubblica il 6 agosto 2026 con l'ID modello wan3.0-video. Tre novità principali: clip native di 30 secondi in un singolo passaggio (il doppio del limite di Wan 2.7), un sistema omni-reference che accetta documenti — PDF, presentazioni, fogli di calcolo, persino pagine web — come input creativi, e un'architettura all-in-one che unisce in uno solo quelli che prima erano quattro modelli Wan separati.

Altri modelli

Non è lo strumento giusto? Prova quelli vicini

Seedance 2.5

L’altro modello per piani sequenza. Riprese da 30 secondi montate sulla tua colonna sonora.

MiniMax H3

La scelta 2K. Le clip ad alta risoluzione più economiche con personaggi e voci bloccati.

FLUX 3

Lo stilista. Clip di 20 secondi con audio, dal cinematografico allo stop-motion.