Pierwszy model wideo Black Forest Labs: 20-sekundowe klipy ze zsynchronizowanym dźwiękiem, do 10 przypiętych klatek kluczowych oraz style od live-action po animację poklatkową. Wpisz poniżej prompt i wypróbuj go.
Programista
Black Forest Labs
Typ
Multimodalne (wideo teraz, obraz wkrótce)
Audio
Natywne, zsynchronizowane, to samo hasło
Czas trwania
Do 20 s na przebieg
Klatki kluczowe
Do 10 przypiętych + pierwszy/ostatni
Otwórz wagi
Planowane prace deweloperskie, koniec 2026
Poziom tutaj
Płatne kredyty + tryb roboczy
Nasz werdykt w jednym wierszu: wybór storyboardu. Gdy dokładnie wiesz, które kadry ujęcie musi zawierać — albo chcesz uzyskać wygląd, który nie jest „kinowym wideo AI” — zacznij tutaj.
FLUX 3 pochodzi z laboratorium we Freiburgu, którego założyciele stworzyli architekturę stojącą za Stable Diffusion, i jest ich pierwszym modelem, który się porusza: jedna sieć wspólnie trenowana na obrazach, wideo, audio i akcjach, w pierwszej kolejności dostarczająca wideo. Dwie rzeczy wyróżniają go w zatłoczonym miesiącu — możesz przypiąć do dziesięciu dokładnych klatek i pozwolić modelowi animować przejścia między nimi, a wynik nie jest ograniczony do błyszczącego wyglądu „kinowego AI”. Surowy, nostalgiczny, ręcznie robiony, dziwny: liczy się zakres.
Wczesne wrażenia z naszych testowych renderów oraz opublikowanych materiałów BFL — z zachowaniem ich własnych zastrzeżeń. Zaktualizujemy, gdy pojawią się niezależne dane.
• Sterowanie klatkami kluczowymi.
Przypnij do 10 dokładnych klatek oraz pierwszą i ostatnią, a model wygeneruje między nimi ruch, pracę kamery, dialog i dźwięk. Storyboard jako format wejściowy — nic innego, co hostujemy, nie przyjmuje tylu punktów zakotwiczenia.
• Zakres estetyczny.
Animacja poklatkowa, makro, time-lapse, nostalgiczne domowe wideo, celowo dziwne — wymyka się jednolitemu kinowemu połyskowi, do którego domyślnie dąży większość modeli wideo. Jeśli wygląd Twojej marki nie jest "zwiastunem filmowym", ma to znaczenie.
• Dźwięk w tym samym przebiegu.
Do 20 sekund ze zsynchronizowaną ścieżką dźwiękową — z dialogami — oraz rozszerzaniem świadomym łączenia, które przenosi ruch, kamerę i dźwięk przez punkt połączenia podczas wydłużania klipu.
• Ekonomika trybu wersji roboczej.
Każdy punkt końcowy ma szybką wersję roboczą do tanich podglądów. Iteruj na wersji roboczej, wydaj prawdziwe kredyty tylko raz na finalną wersję — przepływ pracy, który promuje cała ta strona, wbudowany w rodzinę modeli.
• Części obrazu jeszcze tu nie ma.
Nazwa FLUX jest znana z obrazów, ale generowanie obrazów w FLUX 3 jest nadal stopniowo udostępniane. Jeśli jesteś tu, by tworzyć obrazy, to jeszcze kwestia tygodni — zajrzyj do FAQ, zanim przepalisz kredyty, przekonując się o tym.
• Benchmarki to numery domów.
Wykres premierowy został oznaczony jako wstępna ocena wczesnego kandydata, a najbardziej efektowne wskaźniki zwycięstw uzyskano przeciwko modelom, które nie wyznaczają obecnie tempa. Późniejsze twierdzenia BFL są mocniejsze, ale nadal wewnętrzne.
• 20 sekund, nie 30.
Wan 3.0 i Seedance 2.5 osiągają 30 za jednym podejściem. FLUX 3 odpowiada rozszerzeniem, które respektuje szew — ale jeśli brief zakłada pojedyncze, nieprzerwane pół minuty, to nie jest właściwy wybór.
• Wagi deweloperskie: zaplanowane, bez daty.
Wydanie z otwartymi wagami zapowiedziano na późniejszą część 2026 roku, bez daty ani warunków licencji. Dorobek BFL w zakresie open source jest naprawdę dobry, ale plan to wciąż tylko plan.
Jedno na wygląd, jedno na klatki kluczowe, jedno na szew. Skopiuj, zamień nawiasy, wyrenderuj — najpierw w trybie roboczym.
"Ręcznie wykonana scena poklatkowa: gliniany [astronaut] wbija małą papierową flagę na kuchennym stole-księżycu z mąki. Widoczne odciski palców w glinie, lekko szarpany ruch 12fps, miękkie światło z okna, odgłosy filcowych kroków i przytłumiona kwestia dialogowa piskliwym głosem."
Nazwanie niedoskonałości — odcisków palców, szarpanej liczby klatek — to właśnie to, co odciąga FLUX 3 od domyślnego połysku. Większość modeli stawia opór przy „rękodziele”; ten traktuje je jako cel stylistyczny.
Prześlij: 4 klatki kluczowe (produkt w pudełku → rozpakowany → w dłoni → karta z logo)
"20-sekundowe rozpakowanie, które pokazuje te cztery kadry po kolei, mniej więcej co 5 sekund. Naturalne wrażenie nagrania z ręki, odgłosy rozrywanego papieru i taśmy, cicha radość w głosie spoza kadru przy trzecim kadrze."
Klatki niosą kompozycję, więc prompt musi jedynie sterować timingiem, ruchem i dźwiękiem. Wskazówki dotyczące odstępów („mniej więcej co 5 sekund”) powstrzymują model przed zbyt szybkim przechodzeniem przez kolejne akcenty. To jest przepływ pracy, na który zespoły pracujące najpierw nad storyboardem czekały.
Zacznij od: klip, który już wygenerowałeś
"Przedłuż o 10 sekund: [dancer] kończy obrót, na którym kończy się klip, kamera nadal przesuwa się w lewo z tą samą prędkością, muzyka trwa bez zakłóceń — bez cięcia, bez resetu."
Rozszerzenie odczytuje ruch i dźwięk z końcowych klatek, więc instrukcja powinna opisywać kontynuację, a nie nową scenę. "Dokończa obrót, na którym kończy się klip" daje mu fizyczny wątek do pociągnięcia; wskazanie prędkości kamery chroni płynne przesunięcie na styku.
Trzy modele audio-native, trzy filozofie sterowania. Te same prompty we wszystkich trzech, oceniane według tego, co byśmy wypuścili — wstępnie dla dwóch nowszych. Porównaj je samodzielnie z jednego pola promptu.
ogłoszono 23 lipca: jedna architektura dla obrazu, wideo, audio i akcji. Najpierw udostępniono wideo (20 s, natywny dźwięk, klatki kluczowe); generowanie obrazów będzie wdrażane w kolejnych tygodniach; otwartowagowe wydanie Dev planowane jest na później w tym roku. Wersja na tej stronie.
era obrazów, która rozsławiła tę nazwę: FLUX.1 dev stał się jednym z najczęściej pobieranych i dostrajanych otwartych wydań dyfuzyjnych na świecie, podstawą niezliczonych przepływów pracy społeczności.
zespół założycielski zbudował architekturę dyfuzji latentnej stojącą za Stable Diffusion. Wiarygodność open source, którą daje ta historia, sprawia, że "FLUX 3 Dev" jako obietnica ma większą wagę niż większość deklaracji otwartych wag.
Pierwszy multimodalny model bazowy Black Forest Labs, ogłoszony 23 lipca 2026 r. — jedna architektura wspólnie trenowana na obrazach, wideo, audio i przewidywaniu działań, od zespołu z Freiburga, którego założyciele stworzyli architekturę stojącą za Stable Diffusion. Część, z której możesz generować już dziś, to wideo: do 20 sekund z zsynchronizowaną ścieżką dźwiękową w tym samym przebiegu, z tekstu, obrazu początkowego, przypiętych klatek kluczowych lub istniejącego klipu, który chcesz wydłużyć.
Realista. Gdy klip musi uchodzić za prawdziwe nagranie, z dźwiękiem.
Długie ujęcie. 30-sekundowe ujęcia zmontowane do twojej ścieżki dźwiękowej.
Czytnik dokumentów. Wprowadzasz prezentacje, pliki PDF i arkusze kalkulacyjne, otrzymujesz wideo.