El nuevo modelo todo en uno de Alibaba: clips nativos de 30 segundos a partir de un prompt, una imagen — o un PDF, una presentación o una hoja de cálculo. El único modelo aquí que lee documentos. Escribe un prompt abajo y pruébalo, sin lista de espera.
Desarrollador
Laboratorio Alibaba Tongyi
Tipo
Todo en uno: generación + referencia + edición
Duración
2–30 s en una sola pasada
Salida máx.
1080p
Entrada de documento
pdf / ppt / xls / URL
Abrir pesos
Comprometido (Apache 2.0)
Nivel aquí
Créditos de pago
Nuestro veredicto en una línea: la selección del documento. Cuando el material de origen es una presentación, un manual o una hoja de cálculo, nada más puede siquiera leerlo.
Wan 3.0 entró en beta pública el 6 de agosto, y su ventaja más afilada no es la toma única de 30 segundos — Seedance llegó allí primero — sino lo que acepta como entrada. Entrégale un manual en PDF, una presentación de pitch o una hoja de cálculo trimestral y construye el video a partir del contenido, manteniendo personajes, accesorios y diseños coherentes con la fuente. Alibaba también fusionó lo que antes eran cuatro modelos Wan separados en uno solo, por lo que la generación, la referencia y la edición ya no implican cambiar de modelo a mitad del proceso.
La beta pública tiene solo unos días, así que estas son primeras impresiones de nuestros renderizados de prueba y de la documentación publicada por Alibaba — señaladas como tales. Las revisaremos cuando lleguen cifras independientes.
• Documento a video.
Lee doc, xls, ppt, pdf y formatos similares de hasta 100 MB o 50 páginas, además de páginas web por URL, y genera video a partir del contenido. Un video de capacitación a partir de un manual, una demostración a partir de una presentación — ningún otro modelo que alojamos puede hacer esto en absoluto.
• La toma única de 30 segundos.
Una generación nativa de 2 a 30 segundos, el doble del límite anterior de Wan, con una función de duración inteligente que sugiere la longitud adecuada para tu prompt.
• Flujo de trabajo todo en uno.
Wan 2.7 separaba text-to-video, image-to-video, referencias y edición en cuatro modelos. Wan 3.0 los fusiona — un solo ID de modelo, sin cambiar de pipeline, referencias y ediciones en el mismo lugar.
• Fidelidad a la referencia.
Los personajes, accesorios, voces, disposiciones espaciales y estilo se mantienen coherentes con tus entradas — el planteamiento de Alibaba es “pasar de generar un fotograma a contar una historia completa”, y nuestras primeras pruebas respaldan la afirmación de continuidad.
• Límite de 1080p.
Las salidas documentadas son 480P, 720P y 1080P — sin nivel 2K. Si la resolución es el requisito, MiniMax H3 tiene esa carta en la mano.
• Accede a las fricciones en la fase inicial.
En Alibaba Cloud el modelo está etiquetado como versión preliminar y los precios son solo por invitación. Aquí te saltas la lista de espera, pero espera algunos contratiempos de capacidad en el proveedor mientras la beta escala.
• Pesos abiertos: prometidos, no publicados.
Se promete Apache 2.0; el historial de la línea Wan en la entrega de lanzamientos abiertos ha sido irregular. Cree en la subida, no en el anuncio.
• Pruebas comparativas pendientes.
Se lanzó en el mes más concurrido de la historia del video con IA — cualquier afirmación de “mejor modelo” sobre él, sus rivales o por nuestra parte es provisional hasta que lleguen puntuaciones independientes.
Dos de estos usan el truco del documento que nadie más tiene; el tercero es la toma larga. Copia, intercambia los corchetes, renderiza.
Subir: tu presentación de producto (ppt/pdf, ≤50 páginas)
"Convierte esta presentación en un video de lanzamiento de 30 segundos: un presentador repasa en orden las tres funciones clave, los renders del producto coinciden exactamente con las diapositivas, tono corporativo optimista, termina con el logotipo y el eslogan de la diapositiva final."
Nombrar la estructura ("tres funciones clave en orden", "terminar en la diapositiva final") le indica al modelo cómo distribuir sus 30 segundos en tus 12 diapositivas. "Hacer coincidir las diapositivas exactamente" invoca el sistema de fidelidad a la referencia — está leyendo tu presentación, no decorando alrededor de ella.
Subir: un manual del equipo (pdf)
"Un clip de capacitación en seguridad de 30 segundos de la sección 3 de este manual: un operador demuestra la secuencia de inicio paso a paso, primeros planos de cada control mencionado en el texto, voz en off instructiva y tranquila, subtítulos que coinciden con la terminología del manual."
Señalar una sección mantiene enfocada una entrada de 50 páginas, y "terminología que coincide con el manual" es la instrucción que hace que la salida sea utilizable para una capacitación real en lugar de b-roll genérico. Versión de hoja de cálculo: sustituye por un xls y pide un resumen trimestral basado en gráficos.
"Una toma continua de 30 segundos: una [vendedora de comida callejera] monta su puesto al amanecer — despliega el carrito, enciende el quemador, el primer cliente llega cuando el sol asoma sobre los tejados. La cámara rodea lentamente el puesto todo el tiempo. Los sonidos ambientales de la mañana aumentan hasta convertirse en chisporroteos y charlas."
Un inicio-desarrollo-final escrito como una sola frase de acción continua es la forma que recompensan los modelos de toma larga. La cámara que gira alrededor es la prueba de estrés de la continuidad — si el personaje y la composición se mantienen durante 360 grados por 30 segundos, el modelo está haciendo su trabajo.
Tres laboratorios chinos, tres modelos insignia, seis semanas. Los mismos prompts en los tres, evaluados según lo que lanzaríamos — de forma provisional, dado lo nuevos que son todos. Compáralos tú mismo desde un único cuadro de prompt.
beta pública el 6 de agosto como wan3.0-video en Alibaba Cloud. Clips nativos de 30 segundos, documento a vídeo, arquitectura todo en uno, pesos abiertos Apache 2.0 prometidos. La versión en esta página.
la era comercial: sólida generación de 15 segundos con el flujo de trabajo dividido entre cuatro modelos especializados, y una historia de código abierto con altibajos. Las versiones que describen la mayoría de las reseñas existentes de Wan.
los lanzamientos que construyeron la comunidad de Wan: pesos abiertos potentes que dieron lugar a ajustes finos y flujos de trabajo locales, y la razón por la que "los pesos se publicarán realmente" es la primera pregunta que cualquiera hace sobre Wan 3.0.
El nuevo buque insignia de la línea de video Wan de Alibaba Tongyi Lab, lanzado en beta pública el 6 de agosto de 2026 con el ID de modelo wan3.0-video. Tres cambios principales: clips nativos de 30 segundos en una sola pasada (el doble del límite de Wan 2.7), un sistema omni-reference que acepta documentos — PDF, presentaciones, hojas de cálculo e incluso páginas web — como entradas creativas, y una arquitectura todo en uno que fusiona en uno lo que antes eran cuatro modelos Wan separados.
El otro modelo de plano secuencia. Tomas de 30 segundos montadas con tu banda sonora.
La opción 2K. Los clips de alta resolución más baratos con personajes y voces bloqueados.
El estilista. Clips de 20 segundos con audio, desde cinematográficos hasta stop-motion.