Il primo modello video di Black Forest Labs: clip da 20 secondi con audio sincronizzato, fino a 10 fotogrammi chiave fissati e stili che spaziano dal live-action allo stop-motion. Digita un prompt qui sotto e provalo.
Sviluppatore
Black Forest Labs
Tipo
Multimodale (video ora, immagine a breve)
Audio
Nativo, sincronizzato, stessa password
Durata
Fino a 20 s per passaggio
Fotogrammi chiave
Fino a 10 fissati + primo/ultimo
Apri pesi
Sviluppo pianificato, fine 2026
Livello qui
Crediti a pagamento + modalità bozza
Il nostro verdetto in una riga: la scelta per lo storyboard. Quando sai esattamente quali fotogrammi deve centrare l'inquadratura — oppure vuoi un look che non sembri un “video AI cinematografico” — inizia da qui.
FLUX 3 proviene dal laboratorio di Friburgo i cui fondatori hanno costruito l'architettura alla base di Stable Diffusion, ed è il loro primo modello che si muove: un'unica rete addestrata congiuntamente su immagini, video, audio e azioni, con il video distribuito per primo. Due cose lo distinguono in un mese affollato — puoi fissare fino a dieci fotogrammi esatti e lasciare che il modello li animi tra loro, e l'output non è vincolato al patinato look “cinematografico AI”. Grezzo, nostalgico, artigianale, strano: il punto è la varietà.
Prime impressioni dai nostri rendering di test più il materiale pubblicato da BFL — con le loro avvertenze riportate integralmente. Rivedremo quando arriveranno dati indipendenti.
• Controllo dei fotogrammi chiave.
Fissa fino a 10 fotogrammi esatti più il primo e l'ultimo, e il modello genera movimento, camera, dialoghi e audio tra di essi. Lo storyboard come formato di input — nient'altro di ciò che ospitiamo accetta così tanti ancoraggi.
• Gamma estetica.
Stop-motion, macro, time-lapse, home video nostalgico, volutamente strano — sfugge alla patina cinematografica uniforme su cui la maggior parte dei modelli video ripiega di default. Se l'aspetto del tuo brand non è "trailer cinematografico", questo conta.
• Audio nello stesso passaggio.
Fino a 20 secondi con una colonna sonora sincronizzata — dialoghi inclusi — ed estensione consapevole della giunzione, che porta movimento, camera e audio oltre il punto di raccordo quando estendi una clip.
• Economia della modalità bozza.
Ogni endpoint ha una variante bozza rapida per anteprime a basso costo. Itera sulla bozza, spendi crediti reali una sola volta sulla versione finale — il flusso di lavoro che questo intero sito promuove, integrato nella famiglia di modelli.
• La parte dell'immagine non è ancora qui.
Il nome FLUX è famoso per le immagini, ma la generazione di immagini di FLUX 3 è ancora in fase di distribuzione. Se sei qui per creare immagini, ci vorranno ancora settimane — consulta le FAQ prima di bruciare crediti per scoprirlo.
• I benchmark sono numeri civici.
Il grafico di lancio è stato etichettato come una valutazione preliminare di un candidato iniziale, e i tassi di vittoria più appariscenti sono arrivati contro modelli che non stanno dettando il ritmo attuale. Le affermazioni successive di BFL sono più forti, ma restano interne.
• 20 secondi, non 30.
Wan 3.0 e Seedance 2.5 raggiungono entrambi 30 in un solo passaggio. FLUX 3 risponde con un'estensione che rispetta la giunzione — ma se il brief richiede un singolo mezzo minuto senza interruzioni, non è la scelta giusta.
• Pesi di sviluppo: pianificati, senza data.
Il rilascio con pesi aperti è annunciato per più avanti nel 2026, senza una data né termini di licenza. Il precedente di BFL nell'open source è davvero buono, ma un piano resta comunque un piano.
Uno per l'aspetto, uno per i fotogrammi chiave, uno per la giuntura. Copia, scambia le parentesi, esegui il rendering — prima in modalità bozza.
"Una scena in stop-motion fatta a mano: un [astronaut] di argilla pianta una minuscola bandiera di carta su una luna da tavolo da cucina fatta di farina. Impronte digitali visibili nell'argilla, movimento 12fps leggermente a scatti, morbida luce dalla finestra, suoni di passi sul feltro e una battuta di dialogo ovattata con voce stridula."
Dare un nome alle imperfezioni — impronte digitali, frame rate a scatti — è ciò che allontana FLUX 3 dalla lucentezza predefinita. La maggior parte dei modelli si oppone al “fatto a mano”; questo lo tratta come un obiettivo stilistico.
Carica: 4 fotogrammi chiave (prodotto nella confezione → disimballato → in mano → scheda con logo)
"Un unboxing di 20 secondi che mostra questi quattro fotogrammi in ordine, a circa 5 secondi di distanza l'uno dall'altro. Sensazione naturale da ripresa a mano, suoni di carta strappata e nastro adesivo, quieta gioia da una voce fuori campo al terzo fotogramma."
I fotogrammi sostengono la composizione, quindi il prompt deve solo dirigere tempistiche, movimento e suono. I suggerimenti sulla spaziatura ("a circa 5 secondi di distanza") impediscono al modello di affrettare i momenti chiave. Questo è il flusso di lavoro che i team storyboard-first stavano aspettando.
Inizia da: un clip che hai già generato
"Estendi di 10 secondi: [dancer] completa il giro su cui termina la clip, la camera continua a spostarsi a sinistra alla stessa velocità, la musica continua senza intoppi — nessun taglio, nessun reset."
L'estensione legge il movimento e l'audio dei fotogrammi finali, quindi l'istruzione dovrebbe descrivere una continuazione, non una nuova scena. "Completa la rotazione con cui termina la clip" le offre il filo fisico da seguire; indicare la velocità della telecamera protegge la deriva attraverso la giunzione.
Tre modelli audio-native, tre filosofie di controllo. Gli stessi prompt su tutti e tre, valutati in base a ciò che rilasceremmo — provvisoriamente per i due più recenti. Confrontali tu stesso da un unico riquadro del prompt.
annunciato il 23 luglio: un'unica architettura per immagini, video, audio e azioni. Il video è stato rilasciato per primo (20 s, audio nativo, keyframe); la generazione di immagini verrà implementata nelle settimane successive; il rilascio Dev open-weight è previsto più avanti nel corso dell'anno. La versione in questa pagina.
l’era delle immagini che ha reso famoso il nome: FLUX.1 dev è diventato una delle release di diffusione aperte più scaricate e ottimizzate ovunque, la spina dorsale di innumerevoli flussi di lavoro della community.
il team fondatore ha costruito l'architettura di diffusione latente alla base di Stable Diffusion. La credibilità open-source che questa storia garantisce è il motivo per cui "FLUX 3 Dev" ha più peso come promessa rispetto alla maggior parte degli impegni open-weight.
Il primo modello fondazionale multimodale di Black Forest Labs, annunciato il 23 luglio 2026 — un’unica architettura addestrata congiuntamente su immagini, video, audio e previsione delle azioni, dal team di Friburgo i cui fondatori hanno costruito l’architettura alla base di Stable Diffusion. La parte con cui puoi generare oggi è il video: fino a 20 secondi con una colonna sonora sincronizzata nello stesso passaggio, da testo, un’immagine iniziale, keyframe fissati o una clip esistente che vuoi estendere.