O primeiro modelo de vídeo da Black Forest Labs: clipes de 20 segundos com áudio sincronizado, até 10 quadros-chave fixados e visuais que vão de live-action a stop-motion. Digite um prompt abaixo e experimente.
Desenvolvedor
Black Forest Labs
Tipo
Multimodal (vídeo agora, imagem em breve)
Áudio
Nativo, sincronizado, mesma senha
Duração
Até 20 s por passagem
Quadros-chave
Até 10 fixados + primeiro/último
Abrir pesos
Desenvolvimento planejado, final de 2026
Nível aqui
Créditos pagos + modo rascunho
Nosso veredito em uma linha: a escolha de storyboard. Quando você sabe exatamente quais quadros a cena precisa atingir — ou quer um visual que não pareça “vídeo de IA cinematográfico” — comece aqui.
FLUX 3 vem do laboratório de Freiburg cujos fundadores construíram a arquitetura por trás do Stable Diffusion, e é o primeiro modelo deles que se move: uma única rede treinada conjuntamente em imagens, vídeo, áudio e ação, lançando vídeo primeiro. Duas coisas o destacam em um mês concorrido — você pode fixar até dez quadros exatos e deixar o modelo animar entre eles, e a saída não fica presa ao visual brilhante de “cinema de IA”. Cru, nostálgico, artesanal, estranho: o alcance é o ponto.
Primeiras impressões dos nossos renders de teste mais o material publicado pela BFL — com as próprias ressalvas deles repassadas na íntegra. Revisaremos quando números independentes chegarem.
• Controle de quadros-chave.
Fixe até 10 fotogramas exatos mais o primeiro e o último, e o modelo gera movimento, câmera, diálogo e áudio entre eles. Storyboard como formato de entrada — nada mais que hospedamos aceita tantos pontos de ancoragem.
• Gama estética.
Stop-motion, macro, time-lapse, vídeo caseiro nostálgico, deliberadamente estranho — ele escapa do brilho cinematográfico uniforme ao qual a maioria dos modelos de vídeo recorre por padrão. Se o visual da sua marca não é "trailer de filme", isso importa.
• Áudio na mesma passagem.
Até 20 segundos com uma trilha sonora sincronizada — diálogo incluído — e extensão com reconhecimento de junção que leva movimento, câmera e áudio através do ponto de união quando você estende um clipe.
• Economia do modo rascunho.
Cada endpoint tem uma variante de rascunho rápida para pré-visualizações de baixo custo. Itere no rascunho, gaste créditos reais apenas uma vez na versão final — o fluxo de trabalho que este site inteiro defende, incorporado à família de modelos.
• A parte da imagem ainda não está aqui.
O nome FLUX é famoso por imagens, mas a geração de imagens do FLUX 3 ainda está sendo lançada gradualmente. Se você veio aqui para criar imagens, isso ainda levará semanas — consulte o FAQ antes de queimar créditos para descobrir.
• Benchmarks são números de casa.
O gráfico de lançamento foi rotulado como uma avaliação preliminar de um candidato inicial, e as taxas de vitória mais chamativas vieram contra modelos que não estão ditando o ritmo atual. As alegações posteriores da BFL são mais fortes, mas ainda são internas.
• 20 segundos, não 30.
Wan 3.0 e Seedance 2.5 chegam ambos a 30 em uma única passagem. FLUX 3 responde com uma extensão que respeita a junção — mas, se o briefing pede um único meio minuto ininterrupto, não é a escolha certa.
• Pesos de desenvolvimento: planejados, sem data.
O lançamento de pesos abertos foi anunciado para mais adiante em 2026, sem data nem termos de licença. O histórico de código aberto da BFL é realmente bom, mas um plano ainda é um plano.
Um para a aparência, um para os quadros-chave, um para a emenda. Copie, troque os colchetes, renderize — primeiro no modo rascunho.
"Uma cena de stop-motion feita à mão: um [astronaut] de argila finca uma pequena bandeira de papel em uma lua de mesa de cozinha feita de farinha. Impressões digitais visíveis na argila, movimento 12fps levemente trêmulo, luz suave da janela, sons de passos em feltro e uma fala abafada com voz estridente."
Nomear as imperfeições — impressões digitais, taxa de quadros irregular — é o que afasta o FLUX 3 do brilho padrão. A maioria dos modelos resiste ao “feito à mão”; este o trata como uma meta de estilo.
Carregar: 4 quadros-chave (produto na caixa → fora da caixa → na mão → cartão com logotipo)
"Um unboxing de 20 segundos que mostra estes quatro quadros em ordem, com cerca de 5 segundos de intervalo. Sensação natural de câmera na mão, sons de papel rasgando e fita adesiva, alegria discreta de uma voz fora da tela no terceiro quadro."
Os frames sustentam a composição, então o prompt só precisa orientar o timing, o movimento e o som. Dicas de espaçamento ("aproximadamente 5 segundos de intervalo") impedem que o modelo acelere os momentos-chave. Este é o fluxo de trabalho que as equipes que começam pelo storyboard estavam esperando.
Começar de: um clipe que você já gerou
"Estender por 10 segundos: [dancer] completa a volta em que o clipe termina, a câmera continua se deslocando para a esquerda na mesma velocidade, a música continua sem interrupções — sem corte, sem reinício."
A extensão lê o movimento e o áudio dos quadros finais, então a instrução deve descrever uma continuação, não uma nova cena. "Completa a curva em que o clipe termina" dá a ela o fio físico a puxar; indicar a velocidade da câmera protege a deriva através da emenda.
Três modelos audio-native, três filosofias de controle. Os mesmos prompts nos três, avaliados pelo que lançaríamos — provisoriamente para os dois mais recentes. Compare você mesmo a partir de uma única caixa de prompt.
anunciado em 23 de julho: uma arquitetura única para imagem, vídeo, áudio e ação. O vídeo foi lançado primeiro (20 s, áudio nativo, keyframes); a geração de imagens será disponibilizada nas semanas seguintes; o lançamento Dev com pesos abertos está planejado para mais tarde neste ano. A versão nesta página.
a era da imagem que tornou o nome conhecido: FLUX.1 dev tornou-se uma das versões de difusão abertas mais baixadas e ajustadas em qualquer lugar, a espinha dorsal de inúmeros fluxos de trabalho da comunidade.
a equipe fundadora construiu a arquitetura de difusão latente por trás do Stable Diffusion. A credibilidade open-source que esse histórico confere é o motivo pelo qual "FLUX 3 Dev" tem mais peso como promessa do que a maioria dos compromissos de pesos abertos.
O primeiro modelo fundacional multimodal da Black Forest Labs, anunciado em 23 de julho de 2026 — uma única arquitetura treinada conjuntamente com imagens, vídeo, áudio e previsão de ações, da equipa de Freiburg cujos fundadores construíram a arquitetura por trás do Stable Diffusion. A parte com que pode gerar hoje é vídeo: até 20 segundos com uma banda sonora sincronizada na mesma passagem, a partir de texto, uma imagem inicial, keyframes fixados ou um clipe existente que pretende prolongar.
O realista. Quando o clipe precisa passar por uma filmagem real, com áudio.
O plano-sequência. Cenas de 30 segundos editadas ao som da sua trilha sonora.
O leitor de documentos. Apresentações, PDFs e planilhas entram, vídeo sai.