Il primo modello video di Black Forest Labs: clip da 20 secondi con audio sincronizzato, fino a 10 fotogrammi chiave fissati e stili che spaziano dal live-action allo stop-motion. Digita un prompt qui sotto e provalo.
Sviluppatore
Black Forest Labs
Tipo
Multimodale (video ora, immagine a breve)
Audio
Nativo, sincronizzato, stessa password
Durata
Fino a 20 s per passaggio
Fotogrammi chiave
Fino a 10 fissati + primo/ultimo
Apri pesi
Sviluppo pianificato, fine 2026
Livello qui
Crediti a pagamento + modalità bozza
Il nostro verdetto in una riga: la scelta per lo storyboard. Quando sai esattamente quali fotogrammi deve centrare l'inquadratura — oppure vuoi un look che non sembri un “video AI cinematografico” — inizia da qui.
FLUX 3 proviene dal laboratorio di Friburgo i cui fondatori hanno costruito l'architettura alla base di Stable Diffusion, ed è il loro primo modello che si muove: un'unica rete addestrata congiuntamente su immagini, video, audio e azioni, con il video distribuito per primo. Due cose lo distinguono in un mese affollato — puoi fissare fino a dieci fotogrammi esatti e lasciare che il modello li animi tra loro, e l'output non è vincolato al patinato look “cinematografico AI”. Grezzo, nostalgico, artigianale, strano: il punto è la varietà.
Prime impressioni dai nostri rendering di test più il materiale pubblicato da BFL — con le loro avvertenze riportate integralmente. Rivedremo quando arriveranno dati indipendenti.
• Controllo dei fotogrammi chiave.
Fissa fino a 10 fotogrammi esatti più il primo e l'ultimo, e il modello genera movimento, camera, dialoghi e audio tra di essi. Lo storyboard come formato di input — nient'altro di ciò che ospitiamo accetta così tanti ancoraggi.
• Gamma estetica.
Stop-motion, macro, time-lapse, home video nostalgico, volutamente strano — sfugge alla patina cinematografica uniforme su cui la maggior parte dei modelli video ripiega di default. Se l'aspetto del tuo brand non è "trailer cinematografico", questo conta.
• Audio nello stesso passaggio.
Fino a 20 secondi con una colonna sonora sincronizzata — dialoghi inclusi — ed estensione consapevole della giunzione, che porta movimento, camera e audio oltre il punto di raccordo quando estendi una clip.
• Economia della modalità bozza.
Ogni endpoint ha una variante bozza rapida per anteprime a basso costo. Itera sulla bozza, spendi crediti reali una sola volta sulla versione finale — il flusso di lavoro che questo intero sito promuove, integrato nella famiglia di modelli.
• La parte dell'immagine non è ancora qui.
Il nome FLUX è famoso per le immagini, ma la generazione di immagini di FLUX 3 è ancora in fase di distribuzione. Se sei qui per creare immagini, ci vorranno ancora settimane — consulta le FAQ prima di bruciare crediti per scoprirlo.
• I benchmark sono numeri civici.
Il grafico di lancio è stato etichettato come una valutazione preliminare di un candidato iniziale, e i tassi di vittoria più appariscenti sono arrivati contro modelli che non stanno dettando il ritmo attuale. Le affermazioni successive di BFL sono più forti, ma restano interne.
• 20 secondi, non 30.
Wan 3.0 e Seedance 2.5 raggiungono entrambi 30 in un solo passaggio. FLUX 3 risponde con un'estensione che rispetta la giunzione — ma se il brief richiede un singolo mezzo minuto senza interruzioni, non è la scelta giusta.
• Pesi di sviluppo: pianificati, senza data.
Il rilascio con pesi aperti è annunciato per più avanti nel 2026, senza una data né termini di licenza. Il precedente di BFL nell'open source è davvero buono, ma un piano resta comunque un piano.
Uno per l'aspetto, uno per i fotogrammi chiave, uno per la giuntura. Copia, scambia le parentesi, esegui il rendering — prima in modalità bozza.
"Una scena in stop-motion fatta a mano: un [astronaut] di argilla pianta una minuscola bandiera di carta su una luna da tavolo da cucina fatta di farina. Impronte digitali visibili nell'argilla, movimento 12fps leggermente a scatti, morbida luce dalla finestra, suoni di passi sul feltro e una battuta di dialogo ovattata con voce stridula."
Dare un nome alle imperfezioni — impronte digitali, frame rate a scatti — è ciò che allontana FLUX 3 dalla lucentezza predefinita. La maggior parte dei modelli si oppone al “fatto a mano”; questo lo tratta come un obiettivo stilistico.
Carica: 4 fotogrammi chiave (prodotto nella confezione → disimballato → in mano → scheda con logo)
"Un unboxing di 20 secondi che mostra questi quattro fotogrammi in ordine, a circa 5 secondi di distanza l'uno dall'altro. Sensazione naturale da ripresa a mano, suoni di carta strappata e nastro adesivo, quieta gioia da una voce fuori campo al terzo fotogramma."
I fotogrammi sostengono la composizione, quindi il prompt deve solo dirigere tempistiche, movimento e suono. I suggerimenti sulla spaziatura ("a circa 5 secondi di distanza") impediscono al modello di affrettare i momenti chiave. Questo è il flusso di lavoro che i team storyboard-first stavano aspettando.
Inizia da: un clip che hai già generato
"Estendi di 10 secondi: [dancer] completa il giro su cui termina la clip, la camera continua a spostarsi a sinistra alla stessa velocità, la musica continua senza intoppi — nessun taglio, nessun reset."
L'estensione legge il movimento e l'audio dei fotogrammi finali, quindi l'istruzione dovrebbe descrivere una continuazione, non una nuova scena. "Completa la rotazione con cui termina la clip" le offre il filo fisico da seguire; indicare la velocità della telecamera protegge la deriva attraverso la giunzione.
Tre modelli audio-native, tre filosofie di controllo. Gli stessi prompt su tutti e tre, valutati in base a ciò che rilasceremmo — provvisoriamente per i due più recenti. Confrontali tu stesso da un unico riquadro del prompt.
annunciato il 23 luglio: un'unica architettura per immagini, video, audio e azioni. Il video è stato rilasciato per primo (20 s, audio nativo, keyframe); la generazione di immagini verrà implementata nelle settimane successive; il rilascio Dev open-weight è previsto più avanti nel corso dell'anno. La versione in questa pagina.
l’era delle immagini che ha reso famoso il nome: FLUX.1 dev è diventato una delle release di diffusione aperte più scaricate e ottimizzate ovunque, la spina dorsale di innumerevoli flussi di lavoro della community.
il team fondatore ha costruito l'architettura di diffusione latente alla base di Stable Diffusion. La credibilità open-source che questa storia garantisce è il motivo per cui "FLUX 3 Dev" ha più peso come promessa rispetto alla maggior parte degli impegni open-weight.
Il primo modello fondazionale multimodale di Black Forest Labs, annunciato il 23 luglio 2026 — un’unica architettura addestrata congiuntamente su immagini, video, audio e previsione delle azioni, dal team di Friburgo i cui fondatori hanno costruito l’architettura alla base di Stable Diffusion. La parte con cui puoi generare oggi è il video: fino a 20 secondi con una colonna sonora sincronizzata nello stesso passaggio, da testo, un’immagine iniziale, keyframe fissati o una clip esistente che vuoi estendere.
Il realista. Quando la clip deve sembrare un filmato reale, con audio.
Il piano sequenza. Riprese da 30 secondi montate sulla tua colonna sonora.
Il lettore di documenti. Presentazioni, PDF e fogli di calcolo in ingresso, video in uscita.