Gerador de vídeos com IA Wan 3.0

O novo modelo tudo-em-um da Alibaba: clipes nativos de 30 segundos a partir de um prompt, uma imagem — ou um PDF, uma apresentação ou uma planilha. O único modelo aqui que lê documentos. Digite um prompt abaixo e experimente, sem lista de espera.

Modelo
Carregar imagem
Clique ou solte uma imagem aqui JPG, JPEG, PNG ou WEBP até 10 MB
Prompt
0/5000
Proporções de saída
Auto
Resolução
Auto
Duração(segundos)
Auto
Amostra de vídeo
 

Desenvolvedor

Laboratório Alibaba Tongyi

Tipo

Tudo em um: geração + referência + edição

Duração

2–30 s em passagem única

Saída máx.

1080p

Entrada de documento

pdf / ppt / xls / URL

Abrir pesos

Comprometido (Apache 2.0)

Nível aqui

Créditos pagos

Nosso veredito em uma linha: a seleção de documento. Quando o material de origem é uma apresentação, um manual ou uma planilha, nada mais consegue sequer lê-lo.

Wan 3.0 entrou em beta pública em 6 de agosto, e sua vantagem mais afiada não é a tomada única de 30 segundos — Seedance chegou lá primeiro — mas o que ele aceita como entrada. Entregue a ele um manual em PDF, um pitch deck ou uma planilha trimestral e ele constrói o vídeo a partir do conteúdo, mantendo personagens, adereços e layouts consistentes com a fonte. A Alibaba também consolidou o que antes eram quatro modelos Wan separados em um só, então geração, referência e edição não significam mais trocar de modelo no meio do pipeline.

Leitura honesta

Onde o Wan 3.0 vence — e onde não

A beta pública tem apenas alguns dias, portanto estas são primeiras impressões dos nossos renders de teste e da documentação publicada pela Alibaba — sinalizadas como tal. Vamos revisá-las quando chegarem números independentes.

Realmente forte

  • • Documento para vídeo.

    Lê doc, xls, ppt, pdf e formatos semelhantes de até 100 MB ou 50 páginas, além de páginas da web por URL, e gera vídeo a partir do conteúdo. Um vídeo de treinamento a partir de um manual, uma demonstração a partir de uma apresentação — nenhum outro modelo que hospedamos consegue fazer isso de forma alguma.

  • • A tomada única de 30 segundos.

    Uma geração nativa de 2 a 30 segundos, o dobro do limite anterior do Wan, com um recurso de duração inteligente que sugere o tamanho certo para o seu prompt.

  • • Fluxo de trabalho tudo em um.

    Wan 2.7 separava text-to-video, image-to-video, referências e edição em quatro modelos. Wan 3.0 os reúne — um único ID de modelo, sem troca de pipeline, referências e edições no mesmo lugar.

  • • Fidelidade à referência.

    Personagens, adereços, vozes, layouts espaciais e estilo permanecem consistentes com seus dados de entrada — a forma como a Alibaba enquadra isso é “de gerar um quadro a contar uma história inteira”, e nossos testes iniciais respaldam a afirmação de continuidade.

Limites conhecidos

  • • Limite de 1080p.

    As saídas documentadas são 480P, 720P e 1080P — sem nível 2K. Se a resolução é o requisito, o MiniMax H3 tem essa carta na mão.

  • • Acesse os atritos a montante.

    Na Alibaba Cloud, o modelo é rotulado como prévia e os preços são apenas por convite. Aqui você pula a lista de espera, mas espere alguns contratempos de capacidade no upstream enquanto a versão beta escala.

  • • Pesos abertos: prometidos, não lançados.

    Apache 2.0 é prometido; o histórico da linha Wan na entrega de lançamentos abertos tem sido irregular. Acredite no upload, não no anúncio.

  • • Benchmarks pendentes.

    Foi lançado no mês mais concorrido da história dos vídeos de IA — qualquer alegação de “melhor modelo” sobre ele, seus rivais ou feita por nós é provisória até que pontuações independentes sejam divulgadas.

Receitas de prompts

Três prompts que mostrar para que serve

Dois destes usam o truque do documento que ninguém mais tem; o terceiro é a tomada longa. Copie, troque os colchetes, renderize.

O-vídeo-do-deck-ao-lançamento

Carregar: sua apresentação de produto (ppt/pdf, ≤50 páginas)

"Transforme esta apresentação em um vídeo de lançamento de 30 segundos: um apresentador percorre os três principais recursos em ordem, as renderizações do produto correspondem exatamente aos slides, tom corporativo animado, termine com o logotipo e o slogan do slide final."

Por que funciona

Nomear a estrutura ("três funcionalidades principais em ordem", "terminar no slide final") diz ao modelo como usar seus 30 segundos nos seus 12 slides. "Corresponder exatamente aos slides" aciona o sistema de fidelidade à referência — ele está lendo a sua apresentação, não decorando ao redor dela.

Do-manual-ao-clipe-de-treinamento

Carregar: um manual do equipamento (pdf)

"Um clipe de treinamento de segurança de 30 segundos da seção 3 deste manual: um operador demonstra a sequência de inicialização passo a passo, closes em cada controle mencionado no texto, narração instrucional calma, legendas correspondentes à terminologia do manual."

Por que funciona

Apontar para uma seção mantém uma entrada de 50 páginas focada, e "terminologia correspondente ao manual" é a instrução que torna a saída utilizável para treinamento real em vez de b-roll genérico. Versão de planilha: substitua por um xls e peça um resumo trimestral orientado por gráficos.

A tomada narrativa ininterrupta

"Uma tomada contínua de 30 segundos: uma [vendedora de comida de rua] monta sua barraca ao amanhecer — desdobra o carrinho, acende o queimador, o primeiro cliente chega quando o sol ultrapassa os telhados. A câmera circula lentamente a barraca o tempo todo. Sons ambientes da manhã crescendo até chiados e conversas."

Por que funciona

Um começo-meio-fim escrito como uma única frase de ação contínua é a forma que os modelos de tomada longa recompensam. A câmera circulando é o teste de estresse da continuidade — se o personagem e o layout se mantêm por 360 graus durante 30 segundos, o modelo está fazendo seu trabalho.

Confronto direto

Wan 3.0 vs Seedance 2.5 vs MiniMax H3

Três laboratórios chineses, três modelos de ponta, seis semanas. Os mesmos prompts nos três, avaliados pelo que lançaríamos — provisoriamente, considerando o quão novos todos eles são. Compare você mesmo a partir de uma única caixa de prompt.

JobWan 3.0Seedance 2.5MiniMax H3
Entrada de documento (pdf/ppt/xls) Sim — único Não Não
Duração máx. do clipe 30 s nativo 30 s nativo (180 s beta) 15 s (estender para ~30 s)
Resolução máxima 1080p Alta resolução via pipeline familiar 2K nativo
Ritmo guiado pelo áudio de uma faixa Não Sim Referência de voz
Tudo em um (geração + referência + edição) Um modelo Edições de região, fluxos separados Edições de instruções
Custo por clipe Médio Máxima (renderizações longas) Mais baixo para 2K
Roteiro de modelos com pesos abertos Apache 2.0 prometido Nenhum Comprometido, não enviado
Acesso sem lista de espera Upstream somente por convite Abrir Abrir
Histórico de versões

A linha Wan, em breve

ago de 2026 · Atual

Wan 3.0

beta pública em 6 de agosto como wan3.0-video na Alibaba Cloud. Clipes nativos de 30 segundos, documento para vídeo, arquitetura all-in-one, pesos abertos Apache 2.0 prometidos. A versão nesta página.

Mais cedo

Wan 2.6 / 2.7

a era comercial: geração robusta de 15 segundos com o fluxo de trabalho dividido entre quatro modelos especializados, e uma trajetória open-source de altos e baixos. As versões descritas pela maioria das avaliações existentes do Wan.

Origem

Wan 2.1 / 2.2 — a era aberta

os lançamentos que construíram a comunidade Wan: pesos abertos poderosos que deram origem a fine-tunes e fluxos de trabalho locais, e a razão pela qual "os pesos serão realmente lançados" é a primeira pergunta que qualquer pessoa faz sobre Wan 3.0.

Perguntas frequentes

Perguntas sobre Wan 3.0, respondidas diretamente

1. O que é Wan 3.0?

O novo carro-chefe da linha de vídeo Wan da Alibaba Tongyi Lab, lançado em beta pública em 6 de agosto de 2026 com o ID de modelo wan3.0-video. Três mudanças principais: clipes nativos de 30 segundos em uma única passagem (o dobro do limite do Wan 2.7), um sistema omni-reference que aceita documentos — PDFs, apresentações, planilhas e até páginas da web — como entradas criativas, e uma arquitetura all-in-one que funde em um só o que antes eram quatro modelos Wan separados.

Outros modelos

Não é a ferramenta certa? Experimente os vizinhos

Seedance 2.5

O outro modelo de plano-sequência. Tomadas de 30 segundos cortadas para a sua trilha sonora.

MiniMax H3

A escolha 2K. Clipes em alta resolução mais baratos com personagens e vozes bloqueados.

FLUX 3

O estilista. Clipes de 20 segundos com áudio, do cinematográfico ao stop-motion.