Generator wideo AI FLUX 3

Pierwszy model wideo Black Forest Labs: 20-sekundowe klipy ze zsynchronizowanym dźwiękiem, do 10 przypiętych klatek kluczowych oraz style od live-action po animację poklatkową. Wpisz poniżej prompt i wypróbuj go.

Model
Prześlij obraz
Kliknij lub upuść tutaj obraz JPG, JPEG, PNG lub WEBP do 10 MB
Polecenie
0/5000
Proporcje wyjściowe
Auto
Rozdzielczość
Auto
Czas trwania(sekundy)
Auto
Próbka wideo
 

Programista

Black Forest Labs

Typ

Multimodalne (wideo teraz, obraz wkrótce)

Audio

Natywne, zsynchronizowane, to samo hasło

Czas trwania

Do 20 s na przebieg

Klatki kluczowe

Do 10 przypiętych + pierwszy/ostatni

Otwórz wagi

Planowane prace deweloperskie, koniec 2026

Poziom tutaj

Płatne kredyty + tryb roboczy

Nasz werdykt w jednym wierszu: wybór storyboardu. Gdy dokładnie wiesz, które kadry ujęcie musi zawierać — albo chcesz uzyskać wygląd, który nie jest „kinowym wideo AI” — zacznij tutaj.

FLUX 3 pochodzi z laboratorium we Freiburgu, którego założyciele stworzyli architekturę stojącą za Stable Diffusion, i jest ich pierwszym modelem, który się porusza: jedna sieć wspólnie trenowana na obrazach, wideo, audio i akcjach, w pierwszej kolejności dostarczająca wideo. Dwie rzeczy wyróżniają go w zatłoczonym miesiącu — możesz przypiąć do dziesięciu dokładnych klatek i pozwolić modelowi animować przejścia między nimi, a wynik nie jest ograniczony do błyszczącego wyglądu „kinowego AI”. Surowy, nostalgiczny, ręcznie robiony, dziwny: liczy się zakres.

Szczera opinia

Gdzie FLUX 3 wygrywa — a gdzie nie

Wczesne wrażenia z naszych testowych renderów oraz opublikowanych materiałów BFL — z zachowaniem ich własnych zastrzeżeń. Zaktualizujemy, gdy pojawią się niezależne dane.

Naprawdę silne

  • • Sterowanie klatkami kluczowymi.

    Przypnij do 10 dokładnych klatek oraz pierwszą i ostatnią, a model wygeneruje między nimi ruch, pracę kamery, dialog i dźwięk. Storyboard jako format wejściowy — nic innego, co hostujemy, nie przyjmuje tylu punktów zakotwiczenia.

  • • Zakres estetyczny.

    Animacja poklatkowa, makro, time-lapse, nostalgiczne domowe wideo, celowo dziwne — wymyka się jednolitemu kinowemu połyskowi, do którego domyślnie dąży większość modeli wideo. Jeśli wygląd Twojej marki nie jest "zwiastunem filmowym", ma to znaczenie.

  • • Dźwięk w tym samym przebiegu.

    Do 20 sekund ze zsynchronizowaną ścieżką dźwiękową — z dialogami — oraz rozszerzaniem świadomym łączenia, które przenosi ruch, kamerę i dźwięk przez punkt połączenia podczas wydłużania klipu.

  • • Ekonomika trybu wersji roboczej.

    Każdy punkt końcowy ma szybką wersję roboczą do tanich podglądów. Iteruj na wersji roboczej, wydaj prawdziwe kredyty tylko raz na finalną wersję — przepływ pracy, który promuje cała ta strona, wbudowany w rodzinę modeli.

Znane ograniczenia

  • • Części obrazu jeszcze tu nie ma.

    Nazwa FLUX jest znana z obrazów, ale generowanie obrazów w FLUX 3 jest nadal stopniowo udostępniane. Jeśli jesteś tu, by tworzyć obrazy, to jeszcze kwestia tygodni — zajrzyj do FAQ, zanim przepalisz kredyty, przekonując się o tym.

  • • Benchmarki to numery domów.

    Wykres premierowy został oznaczony jako wstępna ocena wczesnego kandydata, a najbardziej efektowne wskaźniki zwycięstw uzyskano przeciwko modelom, które nie wyznaczają obecnie tempa. Późniejsze twierdzenia BFL są mocniejsze, ale nadal wewnętrzne.

  • • 20 sekund, nie 30.

    Wan 3.0 i Seedance 2.5 osiągają 30 za jednym podejściem. FLUX 3 odpowiada rozszerzeniem, które respektuje szew — ale jeśli brief zakłada pojedyncze, nieprzerwane pół minuty, to nie jest właściwy wybór.

  • • Wagi deweloperskie: zaplanowane, bez daty.

    Wydanie z otwartymi wagami zapowiedziano na późniejszą część 2026 roku, bez daty ani warunków licencji. Dorobek BFL w zakresie open source jest naprawdę dobry, ale plan to wciąż tylko plan.

Przepisy na prompty

Trzy prompty, które pokaż, do czego to służy

Jedno na wygląd, jedno na klatki kluczowe, jedno na szew. Skopiuj, zamień nawiasy, wyrenderuj — najpierw w trybie roboczym.

Antykinematograficzne — prezentowana gama stylów

"Ręcznie wykonana scena poklatkowa: gliniany [astronaut] wbija małą papierową flagę na kuchennym stole-księżycu z mąki. Widoczne odciski palców w glinie, lekko szarpany ruch 12fps, miękkie światło z okna, odgłosy filcowych kroków i przytłumiona kwestia dialogowa piskliwym głosem."

Dlaczego to działa

Nazwanie niedoskonałości — odcisków palców, szarpanej liczby klatek — to właśnie to, co odciąga FLUX 3 od domyślnego połysku. Większość modeli stawia opór przy „rękodziele”; ten traktuje je jako cel stylistyczny.

Blokada storyboardu — klatki kluczowe jako skrypt

Prześlij: 4 klatki kluczowe (produkt w pudełku → rozpakowany → w dłoni → karta z logo)

"20-sekundowe rozpakowanie, które pokazuje te cztery kadry po kolei, mniej więcej co 5 sekund. Naturalne wrażenie nagrania z ręki, odgłosy rozrywanego papieru i taśmy, cicha radość w głosie spoza kadru przy trzecim kadrze."

Dlaczego to działa

Klatki niosą kompozycję, więc prompt musi jedynie sterować timingiem, ruchem i dźwiękiem. Wskazówki dotyczące odstępów („mniej więcej co 5 sekund”) powstrzymują model przed zbyt szybkim przechodzeniem przez kolejne akcenty. To jest przepływ pracy, na który zespoły pracujące najpierw nad storyboardem czekały.

Płynne rozszerzenie

Zacznij od: klip, który już wygenerowałeś

"Przedłuż o 10 sekund: [dancer] kończy obrót, na którym kończy się klip, kamera nadal przesuwa się w lewo z tą samą prędkością, muzyka trwa bez zakłóceń — bez cięcia, bez resetu."

Dlaczego to działa

Rozszerzenie odczytuje ruch i dźwięk z końcowych klatek, więc instrukcja powinna opisywać kontynuację, a nie nową scenę. "Dokończa obrót, na którym kończy się klip" daje mu fizyczny wątek do pociągnięcia; wskazanie prędkości kamery chroni płynne przesunięcie na styku.

Bezpośrednie starcie

FLUX 3 vs Veo vs Seedance 2.5

Trzy modele audio-native, trzy filozofie sterowania. Te same prompty we wszystkich trzech, oceniane według tego, co byśmy wypuścili — wstępnie dla dwóch nowszych. Porównaj je samodzielnie z jednego pola promptu.

JobFLUX 3VeoSeedance 2.5
Klatka kluczowa / kontrola strukturalna 10 przypiętych + pierwszy/ostatni Tylko prompt Pierwsza/ostatnia klatka
Style niekinematograficzne Najlepsze — od animacji poklatkowej po dziwaczne Dostateczny Dobrze
Realistyczne nagranie Dobry (wcześnie) Najlepsze Dobre (wcześnie)
Maks. długość klipu 20 s + rozszerzanie z uwzględnieniem szwów 8 s 30 s natywnie
Tempo sterowane dźwiękiem ze ścieżki Nie Nie Tak
Tania iteracja Wbudowane warianty wersji roboczych Brak wersji roboczej poziomu Szkic przez szybkie elementy równorzędne
Mapa drogowa otwartych wag Rozwój zaplanowany, solidna historia Brak Brak
Udokumentowane osiągnięcia Wiek w tygodniach Ustanowiono Tygodni
Historia wersji

Od laboratorium obrazów do multimodalności

lip 2026 · Obecnie

FLUX 3

ogłoszono 23 lipca: jedna architektura dla obrazu, wideo, audio i akcji. Najpierw udostępniono wideo (20 s, natywny dźwięk, klatki kluczowe); generowanie obrazów będzie wdrażane w kolejnych tygodniach; otwartowagowe wydanie Dev planowane jest na później w tym roku. Wersja na tej stronie.

Wcześniej

FLUX.2 i rodzina FLUX.1

era obrazów, która rozsławiła tę nazwę: FLUX.1 dev stał się jednym z najczęściej pobieranych i dostrajanych otwartych wydań dyfuzyjnych na świecie, podstawą niezliczonych przepływów pracy społeczności.

Pochodzenie

Przed FLUX

zespół założycielski zbudował architekturę dyfuzji latentnej stojącą za Stable Diffusion. Wiarygodność open source, którą daje ta historia, sprawia, że "FLUX 3 Dev" jako obietnica ma większą wagę niż większość deklaracji otwartych wag.

FAQ

FLUX 3 pytania, odpowiedzi wprost

1. Czym jest FLUX 3?

Pierwszy multimodalny model bazowy Black Forest Labs, ogłoszony 23 lipca 2026 r. — jedna architektura wspólnie trenowana na obrazach, wideo, audio i przewidywaniu działań, od zespołu z Freiburga, którego założyciele stworzyli architekturę stojącą za Stable Diffusion. Część, z której możesz generować już dziś, to wideo: do 20 sekund z zsynchronizowaną ścieżką dźwiękową w tym samym przebiegu, z tekstu, obrazu początkowego, przypiętych klatek kluczowych lub istniejącego klipu, który chcesz wydłużyć.

Inne modele

Nie to narzędzie? Wypróbuj sąsiednie

Veo

Realista. Gdy klip musi uchodzić za prawdziwe nagranie, z dźwiękiem.

Seedance 2.5

Długie ujęcie. 30-sekundowe ujęcia zmontowane do twojej ścieżki dźwiękowej.

Wan 3.0

Czytnik dokumentów. Wprowadzasz prezentacje, pliki PDF i arkusze kalkulacyjne, otrzymujesz wideo.