Generatore di video AI FLUX 3

Il primo modello video di Black Forest Labs: clip da 20 secondi con audio sincronizzato, fino a 10 fotogrammi chiave fissati e stili che spaziano dal live-action allo stop-motion. Digita un prompt qui sotto e provalo.

Modello
Carica immagine
Fai clic o trascina qui un'immagine JPG, JPEG, PNG o WEBP fino a 10 MB
Prompt
0/5000
Proporzioni di output
Auto
Risoluzione
Auto
Durata(secondi)
Auto
Esempio video
 

Sviluppatore

Black Forest Labs

Tipo

Multimodale (video ora, immagine a breve)

Audio

Nativo, sincronizzato, stessa password

Durata

Fino a 20 s per passaggio

Fotogrammi chiave

Fino a 10 fissati + primo/ultimo

Apri pesi

Sviluppo pianificato, fine 2026

Livello qui

Crediti a pagamento + modalità bozza

Il nostro verdetto in una riga: la scelta per lo storyboard. Quando sai esattamente quali fotogrammi deve centrare l'inquadratura — oppure vuoi un look che non sembri un “video AI cinematografico” — inizia da qui.

FLUX 3 proviene dal laboratorio di Friburgo i cui fondatori hanno costruito l'architettura alla base di Stable Diffusion, ed è il loro primo modello che si muove: un'unica rete addestrata congiuntamente su immagini, video, audio e azioni, con il video distribuito per primo. Due cose lo distinguono in un mese affollato — puoi fissare fino a dieci fotogrammi esatti e lasciare che il modello li animi tra loro, e l'output non è vincolato al patinato look “cinematografico AI”. Grezzo, nostalgico, artigianale, strano: il punto è la varietà.

Valutazione sincera

Dove FLUX 3 vince — e dove no

Prime impressioni dai nostri rendering di test più il materiale pubblicato da BFL — con le loro avvertenze riportate integralmente. Rivedremo quando arriveranno dati indipendenti.

Davvero forte

  • • Controllo dei fotogrammi chiave.

    Fissa fino a 10 fotogrammi esatti più il primo e l'ultimo, e il modello genera movimento, camera, dialoghi e audio tra di essi. Lo storyboard come formato di input — nient'altro di ciò che ospitiamo accetta così tanti ancoraggi.

  • • Gamma estetica.

    Stop-motion, macro, time-lapse, home video nostalgico, volutamente strano — sfugge alla patina cinematografica uniforme su cui la maggior parte dei modelli video ripiega di default. Se l'aspetto del tuo brand non è "trailer cinematografico", questo conta.

  • • Audio nello stesso passaggio.

    Fino a 20 secondi con una colonna sonora sincronizzata — dialoghi inclusi — ed estensione consapevole della giunzione, che porta movimento, camera e audio oltre il punto di raccordo quando estendi una clip.

  • • Economia della modalità bozza.

    Ogni endpoint ha una variante bozza rapida per anteprime a basso costo. Itera sulla bozza, spendi crediti reali una sola volta sulla versione finale — il flusso di lavoro che questo intero sito promuove, integrato nella famiglia di modelli.

Limiti noti

  • • La parte dell'immagine non è ancora qui.

    Il nome FLUX è famoso per le immagini, ma la generazione di immagini di FLUX 3 è ancora in fase di distribuzione. Se sei qui per creare immagini, ci vorranno ancora settimane — consulta le FAQ prima di bruciare crediti per scoprirlo.

  • • I benchmark sono numeri civici.

    Il grafico di lancio è stato etichettato come una valutazione preliminare di un candidato iniziale, e i tassi di vittoria più appariscenti sono arrivati contro modelli che non stanno dettando il ritmo attuale. Le affermazioni successive di BFL sono più forti, ma restano interne.

  • • 20 secondi, non 30.

    Wan 3.0 e Seedance 2.5 raggiungono entrambi 30 in un solo passaggio. FLUX 3 risponde con un'estensione che rispetta la giunzione — ma se il brief richiede un singolo mezzo minuto senza interruzioni, non è la scelta giusta.

  • • Pesi di sviluppo: pianificati, senza data.

    Il rilascio con pesi aperti è annunciato per più avanti nel 2026, senza una data né termini di licenza. Il precedente di BFL nell'open source è davvero buono, ma un piano resta comunque un piano.

Ricette per prompt

Tre prompt che mostra a cosa serve

Uno per l'aspetto, uno per i fotogrammi chiave, uno per la giuntura. Copia, scambia le parentesi, esegui il rendering — prima in modalità bozza.

L'anti-cinematografico — gamma di stili in mostra

"Una scena in stop-motion fatta a mano: un [astronaut] di argilla pianta una minuscola bandiera di carta su una luna da tavolo da cucina fatta di farina. Impronte digitali visibili nell'argilla, movimento 12fps leggermente a scatti, morbida luce dalla finestra, suoni di passi sul feltro e una battuta di dialogo ovattata con voce stridula."

Perché funziona

Dare un nome alle imperfezioni — impronte digitali, frame rate a scatti — è ciò che allontana FLUX 3 dalla lucentezza predefinita. La maggior parte dei modelli si oppone al “fatto a mano”; questo lo tratta come un obiettivo stilistico.

Blocco dello storyboard — fotogrammi chiave come script

Carica: 4 fotogrammi chiave (prodotto nella confezione → disimballato → in mano → scheda con logo)

"Un unboxing di 20 secondi che mostra questi quattro fotogrammi in ordine, a circa 5 secondi di distanza l'uno dall'altro. Sensazione naturale da ripresa a mano, suoni di carta strappata e nastro adesivo, quieta gioia da una voce fuori campo al terzo fotogramma."

Perché funziona

I fotogrammi sostengono la composizione, quindi il prompt deve solo dirigere tempistiche, movimento e suono. I suggerimenti sulla spaziatura ("a circa 5 secondi di distanza") impediscono al modello di affrettare i momenti chiave. Questo è il flusso di lavoro che i team storyboard-first stavano aspettando.

L’estensione senza interruzioni

Inizia da: un clip che hai già generato

"Estendi di 10 secondi: [dancer] completa il giro su cui termina la clip, la camera continua a spostarsi a sinistra alla stessa velocità, la musica continua senza intoppi — nessun taglio, nessun reset."

Perché funziona

L'estensione legge il movimento e l'audio dei fotogrammi finali, quindi l'istruzione dovrebbe descrivere una continuazione, non una nuova scena. "Completa la rotazione con cui termina la clip" le offre il filo fisico da seguire; indicare la velocità della telecamera protegge la deriva attraverso la giunzione.

Confronto diretto

FLUX 3 vs Veo vs Seedance 2.5

Tre modelli audio-native, tre filosofie di controllo. Gli stessi prompt su tutti e tre, valutati in base a ciò che rilasceremmo — provvisoriamente per i due più recenti. Confrontali tu stesso da un unico riquadro del prompt.

JobFLUX 3VeoSeedance 2.5
Fotogramma chiave / controllo strutturale 10 fissati + primo/ultimo Solo prompt Primo/ultimo fotogramma
Stili non cinematografici Il meglio — dallo stop-motion allo strano Discreto Buono
Filmato realistico Buono (presto) Migliore Buono (presto)
Lunghezza max clip 20 s + estensione sensibile alle giunture 8 s 30 s nativo
Ritmo guidato dall'audio da una traccia No No
Iterazione economica Varianti di bozza integrate Nessun livello bozza Bozza tramite elementi di pari livello rapidi
Roadmap dei pesi aperti Sviluppo pianificato, solida esperienza Nessuno Nessuno
Comprovata esperienza Settimane di età Stabilito Settimane
Cronologia versioni

Dal laboratorio di immagini al multimodale

lug 2026 · Attuale

FLUX 3

annunciato il 23 luglio: un'unica architettura per immagini, video, audio e azioni. Il video è stato rilasciato per primo (20 s, audio nativo, keyframe); la generazione di immagini verrà implementata nelle settimane successive; il rilascio Dev open-weight è previsto più avanti nel corso dell'anno. La versione in questa pagina.

Prima

FLUX.2 e la famiglia FLUX.1

l’era delle immagini che ha reso famoso il nome: FLUX.1 dev è diventato una delle release di diffusione aperte più scaricate e ottimizzate ovunque, la spina dorsale di innumerevoli flussi di lavoro della community.

Origine

Prima di FLUX

il team fondatore ha costruito l'architettura di diffusione latente alla base di Stable Diffusion. La credibilità open-source che questa storia garantisce è il motivo per cui "FLUX 3 Dev" ha più peso come promessa rispetto alla maggior parte degli impegni open-weight.

FAQ

FLUX 3 domande, risposte dirette

1. Che cos'è FLUX 3?

Il primo modello fondazionale multimodale di Black Forest Labs, annunciato il 23 luglio 2026 — un’unica architettura addestrata congiuntamente su immagini, video, audio e previsione delle azioni, dal team di Friburgo i cui fondatori hanno costruito l’architettura alla base di Stable Diffusion. La parte con cui puoi generare oggi è il video: fino a 20 secondi con una colonna sonora sincronizzata nello stesso passaggio, da testo, un’immagine iniziale, keyframe fissati o una clip esistente che vuoi estendere.

Altri modelli

Non è lo strumento giusto? Prova quelli vicini

Veo

Il realista. Quando la clip deve sembrare un filmato reale, con audio.

Seedance 2.5

Il piano sequenza. Riprese da 30 secondi montate sulla tua colonna sonora.

Wan 3.0

Il lettore di documenti. Presentazioni, PDF e fogli di calcolo in ingresso, video in uscita.