Le premier modèle vidéo de Black Forest Labs: des clips de 20 secondes avec audio synchronisé, jusqu’à 10 images clés épinglées et des styles allant de la prise de vues réelles au stop-motion. Saisissez un prompt ci-dessous et essayez-le.
Développeur
Black Forest Labs
Type
Multimodal (vidéo maintenant, image bientôt)
Audio
Natif, synchronisé, même mot de passe
Durée
Jusqu’à 20 s par passage
Images clés
Jusqu’à 10 épinglés + premier/dernier
Ouvrir les poids
Développement prévu, fin 2026
Niveau ici
Crédits payants + mode brouillon
Notre verdict en une ligne: le choix storyboard. Quand vous savez exactement quelles images le plan doit atteindre — ou que vous voulez un rendu qui ne soit pas une « vidéo IA cinématographique » — commencez ici.
FLUX 3 vient du laboratoire de Fribourg dont les fondateurs ont construit l'architecture derrière Stable Diffusion, et c'est leur premier modèle qui bouge: un seul réseau entraîné conjointement sur des images, de la vidéo, de l'audio et des actions, avec la vidéo livrée en premier. Deux choses le distinguent dans un mois chargé — vous pouvez épingler jusqu'à dix images exactes et laisser le modèle animer entre elles, et la sortie n'est pas enfermée dans le look brillant « cinématique IA ». Brut, nostalgique, fait main, étrange: c'est l'étendue qui compte.
Premières impressions à partir de nos rendus de test, plus le contenu publié par BFL — avec leurs propres réserves relayées telles quelles. Nous réviserons lorsque des chiffres indépendants seront disponibles.
• Contrôle des images clés.
Épinglez jusqu’à 10 images exactes plus la première et la dernière, et le modèle génère le mouvement, la caméra, le dialogue et l’audio entre elles. Le storyboard comme format d’entrée — rien d’autre de ce que nous hébergeons n’accepte autant d’ancrages.
• Gamme esthétique.
Stop-motion, macro, time-lapse, vidéo maison nostalgique, délibérément étrange — cela échappe au vernis cinématographique uniforme adopté par défaut par la plupart des modèles vidéo. Si l'apparence de votre marque n'est pas "bande-annonce de film", c'est important.
• Audio dans le même passage.
Jusqu’à 20 secondes avec une bande-son synchronisée — dialogues inclus — et une extension tenant compte de la jonction, qui prolonge le mouvement, la caméra et l’audio au-delà du raccord lorsque vous allongez un clip.
• Économie du mode brouillon.
Chaque point de terminaison dispose d’une variante brouillon rapide pour des aperçus à faible coût. Itérez sur le brouillon, dépensez de vrais crédits une seule fois sur la version finale — le flux de travail que tout ce site prône, intégré à la famille de modèles.
• La partie image n’est pas encore ici.
Le nom FLUX est célèbre pour les images, mais la génération d’images de FLUX 3 est encore en cours de déploiement. Si vous êtes ici pour créer des images, il faudra encore attendre des semaines — consultez la FAQ avant de brûler des crédits pour le découvrir.
• Les benchmarks sont des numéros de maison.
Le graphique de lancement a été présenté comme une évaluation préliminaire d’un candidat précoce, et les taux de victoire les plus spectaculaires ont été obtenus face à des modèles qui ne donnent pas le rythme actuel. Les affirmations ultérieures de BFL sont plus solides, mais restent internes.
• 20 secondes, pas 30.
Wan 3.0 et Seedance 2.5 atteignent tous deux 30 en un seul passage. FLUX 3 répond avec une extension qui respecte la jointure — mais si le brief demande une seule demi-minute ininterrompue, ce n’est pas le bon choix.
• Pondérations de développement : planifiées, sans date.
La publication en poids ouverts est annoncée pour plus tard en 2026, sans date ni conditions de licence. Le bilan open source de BFL est réellement bon, mais un plan reste un plan.
Un pour l’apparence, un pour les images clés, un pour la couture. Copiez, inversez les crochets, effectuez le rendu — d’abord en mode brouillon.
"Une scène en stop-motion faite à la main : un [astronaut] en argile plante un minuscule drapeau en papier sur une lune de table de cuisine faite de farine. Empreintes digitales visibles dans l'argile, mouvement 12fps légèrement saccadé, douce lumière de fenêtre, sons de pas en feutre et une réplique étouffée d'une voix aiguë."
Nommer les imperfections — empreintes digitales, fréquence d’images saccadée — est ce qui éloigne FLUX 3 du brillant par défaut. La plupart des modèles résistent au « fait main » ; celui-ci le traite comme un objectif de style.
Téléverser: 4 images clés (produit emballé → déballé → en main → carte avec logo)
"Un déballage de 20 secondes qui enchaîne ces quatre plans dans l'ordre, espacés d'environ 5 secondes. Sensation naturelle de caméra à l'épaule, sons de papier déchiré et de ruban adhésif, joie discrète d'une voix hors champ au troisième plan."
Les images portent la composition, de sorte que le prompt n’a qu’à diriger le timing, le mouvement et le son. Les indications d’espacement (« à environ 5 secondes d’intervalle ») empêchent le modèle de précipiter les temps forts. C’est le flux de travail que les équipes qui commencent par le storyboard attendaient.
Commencer à partir de : un clip que vous avez déjà généré
"Prolonger de 10 secondes : [dancer] termine le tour sur lequel le clip se termine, la caméra continue de glisser vers la gauche à la même vitesse, la musique continue sans accroc — pas de coupe, pas de réinitialisation."
L’extension lit le mouvement et l’audio des dernières images, donc l’instruction doit décrire une continuation, pas une nouvelle scène. "Termine le mouvement de rotation sur lequel le clip se termine" lui donne le fil physique à tirer; préciser la vitesse de la caméra préserve le glissement à travers la jonction.
Trois modèles audio-native, trois philosophies de contrôle. Les mêmes prompts sur les trois, jugés selon ce que nous publierions — provisoirement pour les deux plus récents. Comparez-les vous-même depuis une seule zone de prompt.
annoncé le 23 juillet : une architecture unique pour l’image, la vidéo, l’audio et l’action. La vidéo a été livrée en premier (20 s, audio natif, images clés) ; la génération d’images sera déployée dans les semaines suivantes ; la version Dev à poids ouverts est prévue plus tard dans l’année. La version sur cette page.
l’ère de l’image qui a fait connaître le nom : FLUX.1 dev est devenu l’une des versions de diffusion ouvertes les plus téléchargées et les plus affinées au monde, l’épine dorsale d’innombrables flux de travail communautaires.
l’équipe fondatrice a construit l’architecture de diffusion latente derrière Stable Diffusion. La crédibilité open source que confère cet historique explique pourquoi "FLUX 3 Dev" a plus de poids comme promesse que la plupart des engagements à poids ouverts.
Le premier modèle fondationnel multimodal de Black Forest Labs, annoncé le 23 juillet 2026 — une architecture unique entraînée conjointement sur des images, de la vidéo, de l’audio et la prédiction d’actions, par l’équipe de Fribourg dont les fondateurs ont construit l’architecture derrière Stable Diffusion. La partie avec laquelle vous pouvez générer aujourd’hui est la vidéo : jusqu’à 20 secondes avec une bande-son synchronisée dans le même passage, à partir de texte, d’une image de départ, d’images clés épinglées ou d’un clip existant que vous souhaitez prolonger.
Le réaliste. Quand le clip doit passer pour une séquence réelle, avec audio.
Le plan-séquence. Des plans de 30 secondes montés sur ta bande-son.
Le lecteur de documents. Présentations, PDF et feuilles de calcul en entrée, vidéo en sortie.