Le nouveau modèle tout-en-un d’Alibaba : des clips natifs de 30 secondes à partir d’un prompt, d’une image — ou d’un PDF, d’un diaporama ou d’une feuille de calcul. Le seul modèle ici qui lit les documents. Saisissez un prompt ci-dessous et essayez-le, sans liste d’attente.
Développeur
Laboratoire Alibaba Tongyi
Type
Tout-en-un: génération + référence + modification
Durée
2–30 s en une seule passe
Sortie max.
1080p
Entrée du document
pdf / ppt / xls / URL
Ouvrir les poids
Engagé (Apache 2.0)
Niveau ici
Crédits payants
Notre verdict en une ligne : la sélection du document. Lorsque le contenu source est une présentation, un manuel ou une feuille de calcul, rien d'autre ne peut même le lire.
Wan 3.0 est passé en bêta publique le 6 août, et son atout le plus tranchant n’est pas la prise unique de 30 secondes — Seedance y est arrivé en premier — mais ce qu’il accepte en entrée. Donnez-lui un manuel PDF, un pitch deck ou une feuille de calcul trimestrielle, et il crée la vidéo à partir du contenu, en gardant les personnages, les accessoires et les mises en page cohérents avec la source. Alibaba a également fusionné ce qui était auparavant quatre modèles Wan distincts en un seul, si bien que la génération, la référence et l’édition ne nécessitent plus de changer de modèle en plein pipeline.
La bêta publique n’a que quelques jours, il s’agit donc de premières impressions issues de nos rendus de test et de la documentation publiée par Alibaba — signalées comme telles. Nous les réviserons dès que des chiffres indépendants seront disponibles.
• Document en vidéo.
Lit les formats doc, xls, ppt, pdf et similaires jusqu’à 100 MB ou 50 pages, ainsi que les pages web par URL, et génère une vidéo à partir du contenu. Une vidéo de formation à partir d’un manuel, une démo à partir d’un diaporama — aucun autre modèle que nous hébergeons ne peut faire cela du tout.
• La prise unique de 30 secondes.
Une génération native de 2 à 30 secondes, soit le double du précédent plafond de Wan, avec une fonction de durée intelligente qui suggère la longueur adaptée à votre prompt.
• Flux de travail tout-en-un.
Wan 2.7 répartissait le text-to-video, l’image-to-video, les références et l’édition sur quatre modèles. Wan 3.0 les fusionne — un seul ID de modèle, pas de changement de pipeline, références et modifications au même endroit.
• Fidélité à la référence.
Les personnages, accessoires, voix, dispositions spatiales et le style restent cohérents avec vos entrées — la formulation d’Alibaba est « de la génération d’une image à la narration d’une histoire complète », et nos premiers tests confirment l’affirmation de continuité.
• Limite 1080p.
Les sorties documentées sont 480P, 720P et 1080P — pas de palier 2K. Si la résolution est le critère clé, MiniMax H3 a cette carte en main.
• Accédez aux frictions en amont.
Sur Alibaba Cloud, le modèle est indiqué comme étant en aperçu et la tarification est disponible uniquement sur invitation. Ici, vous évitez la liste d’attente, mais prévoyez des aléas de capacité en amont pendant que la bêta monte en charge.
• Poids ouverts: promis, non publiés.
Apache 2.0 est promis ; le bilan de la gamme Wan en matière de publication de versions ouvertes a été inégal. Croyez au téléversement, pas à l'annonce.
• Benchmarks en attente.
Il a été lancé durant le mois le plus chargé de l’histoire de la vidéo IA — toute affirmation de « meilleur modèle » à son sujet, au sujet de ses concurrents ou de notre part, reste provisoire jusqu’à la publication de scores indépendants.
Deux d’entre eux utilisent l’astuce du document que personne d’autre n’a; le troisième est le plan-séquence. Copiez, inversez les crochets, effectuez le rendu.
Téléverser: votre deck produit (ppt/pdf, ≤50 pages)
"Transformez cette présentation en une vidéo de lancement de 30 secondes: un présentateur passe en revue les trois fonctionnalités clés dans l’ordre, les rendus du produit correspondent exactement aux diapositives, ton d’entreprise dynamique, finir sur le logo et le slogan de la dernière diapositive."
Nommer la structure ("trois fonctionnalités clés dans l’ordre", "terminer sur la dernière diapositive") indique au modèle comment répartir ses 30 secondes sur vos 12 diapositives. "Faire correspondre exactement les diapositives" invoque le système de fidélité à la référence — il lit votre présentation, il ne la décore pas autour.
Importer: un manuel d’utilisation de l’équipement (pdf)
"Une vidéo de formation à la sécurité de 30 secondes tirée de la section 3 de ce manuel : un opérateur démontre la séquence de démarrage étape par étape, gros plans sur chaque commande nommée dans le texte, voix off pédagogique calme, sous-titres correspondant à la terminologie du manuel."
Pointer vers une section permet de garder une entrée de 50 pages bien ciblée, et "terminologie correspondant au manuel" est l’instruction qui rend la sortie utilisable pour une formation réelle plutôt que pour un b-roll générique. Version feuille de calcul: remplacez par un xls et demandez un résumé trimestriel guidé par les graphiques.
"Un plan continu de 30 secondes : une [vendeuse de street food] installe son stand à l'aube — déplie le chariot, allume le brûleur, le premier client arrive tandis que le soleil dépasse les toits. La caméra tourne lentement autour du stand pendant tout ce temps. Les sons ambiants du matin montent jusqu'au grésillement et aux conversations."
Un début-milieu-fin écrit comme une seule phrase d’action continue est la forme que récompensent les modèles de plan-séquence. La caméra qui tourne autour est le test de résistance de la continuité — si le personnage et la disposition tiennent sur 360 degrés pendant 30 secondes, le modèle fait son travail.
Trois laboratoires chinois, trois modèles phares, six semaines. Les mêmes prompts pour les trois, évalués selon ce que nous publierions — provisoirement, étant donné à quel point ils sont tous récents. Comparez-les vous-même à partir d’une seule zone de prompt.
bêta publique le 6 août sous le nom wan3.0-video sur Alibaba Cloud. Clips natifs de 30 secondes, document vers vidéo, architecture tout-en-un, poids ouverts Apache 2.0 promis. La version sur cette page.
l’ère commerciale : une puissante génération de 15 secondes avec le flux de travail réparti entre quatre modèles spécialisés, et une histoire open-source en dents de scie. Les versions décrites par la plupart des avis existants sur Wan.
les versions qui ont bâti la communauté Wan: des poids ouverts performants qui ont donné naissance à des fine-tunings et à des workflows locaux, et la raison pour laquelle "les poids seront-ils réellement publiés" est la première question que tout le monde se pose à propos de Wan 3.0.
Le nouveau modèle phare de la gamme vidéo Wan d'Alibaba Tongyi Lab, lancé en bêta publique le 6 août 2026 sous l'ID de modèle wan3.0-video. Trois changements majeurs : des clips natifs de 30 secondes en un seul passage (le double du plafond de Wan 2.7), un système omni-reference qui accepte les documents — PDF, présentations, feuilles de calcul, et même pages web — comme entrées créatives, ainsi qu'une architecture tout-en-un fusionnant en un seul ce qui était auparavant quatre modèles Wan distincts.
L’autre modèle de plan-séquence. Des prises de 30 secondes montées sur votre bande-son.
Le choix 2K. Les clips haute résolution les moins chers avec personnages et voix verrouillés.
Le styliste. Des clips de 20 secondes avec audio, du cinématographique au stop-motion.