O novo modelo tudo-em-um da Alibaba: clipes nativos de 30 segundos a partir de um prompt, uma imagem — ou um PDF, uma apresentação ou uma planilha. O único modelo aqui que lê documentos. Digite um prompt abaixo e experimente, sem lista de espera.
Desenvolvedor
Laboratório Alibaba Tongyi
Tipo
Tudo em um: geração + referência + edição
Duração
2–30 s em passagem única
Saída máx.
1080p
Entrada de documento
pdf / ppt / xls / URL
Abrir pesos
Comprometido (Apache 2.0)
Nível aqui
Créditos pagos
Nosso veredito em uma linha: a seleção de documento. Quando o material de origem é uma apresentação, um manual ou uma planilha, nada mais consegue sequer lê-lo.
Wan 3.0 entrou em beta pública em 6 de agosto, e sua vantagem mais afiada não é a tomada única de 30 segundos — Seedance chegou lá primeiro — mas o que ele aceita como entrada. Entregue a ele um manual em PDF, um pitch deck ou uma planilha trimestral e ele constrói o vídeo a partir do conteúdo, mantendo personagens, adereços e layouts consistentes com a fonte. A Alibaba também consolidou o que antes eram quatro modelos Wan separados em um só, então geração, referência e edição não significam mais trocar de modelo no meio do pipeline.
A beta pública tem apenas alguns dias, portanto estas são primeiras impressões dos nossos renders de teste e da documentação publicada pela Alibaba — sinalizadas como tal. Vamos revisá-las quando chegarem números independentes.
• Documento para vídeo.
Lê doc, xls, ppt, pdf e formatos semelhantes de até 100 MB ou 50 páginas, além de páginas da web por URL, e gera vídeo a partir do conteúdo. Um vídeo de treinamento a partir de um manual, uma demonstração a partir de uma apresentação — nenhum outro modelo que hospedamos consegue fazer isso de forma alguma.
• A tomada única de 30 segundos.
Uma geração nativa de 2 a 30 segundos, o dobro do limite anterior do Wan, com um recurso de duração inteligente que sugere o tamanho certo para o seu prompt.
• Fluxo de trabalho tudo em um.
Wan 2.7 separava text-to-video, image-to-video, referências e edição em quatro modelos. Wan 3.0 os reúne — um único ID de modelo, sem troca de pipeline, referências e edições no mesmo lugar.
• Fidelidade à referência.
Personagens, adereços, vozes, layouts espaciais e estilo permanecem consistentes com seus dados de entrada — a forma como a Alibaba enquadra isso é “de gerar um quadro a contar uma história inteira”, e nossos testes iniciais respaldam a afirmação de continuidade.
• Limite de 1080p.
As saídas documentadas são 480P, 720P e 1080P — sem nível 2K. Se a resolução é o requisito, o MiniMax H3 tem essa carta na mão.
• Acesse os atritos a montante.
Na Alibaba Cloud, o modelo é rotulado como prévia e os preços são apenas por convite. Aqui você pula a lista de espera, mas espere alguns contratempos de capacidade no upstream enquanto a versão beta escala.
• Pesos abertos: prometidos, não lançados.
Apache 2.0 é prometido; o histórico da linha Wan na entrega de lançamentos abertos tem sido irregular. Acredite no upload, não no anúncio.
• Benchmarks pendentes.
Foi lançado no mês mais concorrido da história dos vídeos de IA — qualquer alegação de “melhor modelo” sobre ele, seus rivais ou feita por nós é provisória até que pontuações independentes sejam divulgadas.
Dois destes usam o truque do documento que ninguém mais tem; o terceiro é a tomada longa. Copie, troque os colchetes, renderize.
Carregar: sua apresentação de produto (ppt/pdf, ≤50 páginas)
"Transforme esta apresentação em um vídeo de lançamento de 30 segundos: um apresentador percorre os três principais recursos em ordem, as renderizações do produto correspondem exatamente aos slides, tom corporativo animado, termine com o logotipo e o slogan do slide final."
Nomear a estrutura ("três funcionalidades principais em ordem", "terminar no slide final") diz ao modelo como usar seus 30 segundos nos seus 12 slides. "Corresponder exatamente aos slides" aciona o sistema de fidelidade à referência — ele está lendo a sua apresentação, não decorando ao redor dela.
Carregar: um manual do equipamento (pdf)
"Um clipe de treinamento de segurança de 30 segundos da seção 3 deste manual: um operador demonstra a sequência de inicialização passo a passo, closes em cada controle mencionado no texto, narração instrucional calma, legendas correspondentes à terminologia do manual."
Apontar para uma seção mantém uma entrada de 50 páginas focada, e "terminologia correspondente ao manual" é a instrução que torna a saída utilizável para treinamento real em vez de b-roll genérico. Versão de planilha: substitua por um xls e peça um resumo trimestral orientado por gráficos.
"Uma tomada contínua de 30 segundos: uma [vendedora de comida de rua] monta sua barraca ao amanhecer — desdobra o carrinho, acende o queimador, o primeiro cliente chega quando o sol ultrapassa os telhados. A câmera circula lentamente a barraca o tempo todo. Sons ambientes da manhã crescendo até chiados e conversas."
Um começo-meio-fim escrito como uma única frase de ação contínua é a forma que os modelos de tomada longa recompensam. A câmera circulando é o teste de estresse da continuidade — se o personagem e o layout se mantêm por 360 graus durante 30 segundos, o modelo está fazendo seu trabalho.
Três laboratórios chineses, três modelos de ponta, seis semanas. Os mesmos prompts nos três, avaliados pelo que lançaríamos — provisoriamente, considerando o quão novos todos eles são. Compare você mesmo a partir de uma única caixa de prompt.
beta pública em 6 de agosto como wan3.0-video na Alibaba Cloud. Clipes nativos de 30 segundos, documento para vídeo, arquitetura all-in-one, pesos abertos Apache 2.0 prometidos. A versão nesta página.
a era comercial: geração robusta de 15 segundos com o fluxo de trabalho dividido entre quatro modelos especializados, e uma trajetória open-source de altos e baixos. As versões descritas pela maioria das avaliações existentes do Wan.
os lançamentos que construíram a comunidade Wan: pesos abertos poderosos que deram origem a fine-tunes e fluxos de trabalho locais, e a razão pela qual "os pesos serão realmente lançados" é a primeira pergunta que qualquer pessoa faz sobre Wan 3.0.
O novo carro-chefe da linha de vídeo Wan da Alibaba Tongyi Lab, lançado em beta pública em 6 de agosto de 2026 com o ID de modelo wan3.0-video. Três mudanças principais: clipes nativos de 30 segundos em uma única passagem (o dobro do limite do Wan 2.7), um sistema omni-reference que aceita documentos — PDFs, apresentações, planilhas e até páginas da web — como entradas criativas, e uma arquitetura all-in-one que funde em um só o que antes eram quatro modelos Wan separados.
O outro modelo de plano-sequência. Tomadas de 30 segundos cortadas para a sua trilha sonora.
A escolha 2K. Clipes em alta resolução mais baratos com personagens e vozes bloqueados.
O estilista. Clipes de 20 segundos com áudio, do cinematográfico ao stop-motion.