Das erste Videomodell von Black Forest Labs: 20-sekündige Clips mit synchronisiertem Audio, bis zu 10 angeheftete Keyframes und Looks von Live-Action bis Stop-Motion. Gib unten einen Prompt ein und probiere es aus.
Entwickler
Black Forest Labs
Typ
Multimodal (Video jetzt, Bild demnächst)
Audio
Nativ, synchronisiert, dasselbe Passwort
Dauer
Bis zu 20 s pro Durchlauf
Schlüsselbilder
Bis zu 10 angeheftete + erste/letzte
Gewichtungen öffnen
Entwicklung geplant, Ende 2026
Stufe hier
Bezahlte Credits + Entwurfsmodus
Unser Urteil in einer Zeile: die Storyboard-Wahl. Wenn du genau weißt, welche Frames die Aufnahme treffen muss — oder du einen Look möchtest, der nicht nach „cinematic AI video“ aussieht — beginne hier.
FLUX 3 stammt aus dem Freiburger Labor, dessen Gründer die Architektur hinter Stable Diffusion entwickelt haben, und es ist ihr erstes Modell, das sich bewegt: ein Netzwerk, das gemeinsam mit Bildern, Video, Audio und Aktionen trainiert wurde und zuerst Video ausliefert. Zwei Dinge heben es in einem überfüllten Monat ab — du kannst bis zu zehn exakte Frames fixieren und das Modell dazwischen animieren lassen, und die Ausgabe ist nicht auf den glänzenden „AI cinematic“-Look festgelegt. Roh, nostalgisch, handgemacht, seltsam: die Bandbreite ist der Punkt.
Erste Eindrücke aus unseren Test-Renderings plus BFLs veröffentlichtes Material — mit den eigenen Vorbehalten unverändert weitergegeben. Wir überarbeiten, sobald unabhängige Zahlen vorliegen.
• Keyframe-Steuerung.
Pinne bis zu 10 exakte Frames plus den ersten und letzten, und das Modell generiert Bewegung, Kamera, Dialog und Audio dazwischen. Storyboarding als Eingabeformat — nichts anderes, das wir hosten, akzeptiert so viele Anker.
• Ästhetischer Bereich.
Stop-Motion, Makro, Zeitraffer, nostalgisches Heimvideo, absichtlich seltsam — es entkommt dem einheitlichen filmischen Glanz, auf den die meisten Videomodelle standardmäßig setzen. Wenn der Look deiner Marke nicht "Filmtrailer" ist, ist das wichtig.
• Audio im selben Durchlauf.
Bis zu 20 Sekunden mit synchronisiertem Soundtrack — inklusive Dialog — und nahtbewusster Erweiterung, die Bewegung, Kamera und Audio über die Schnittstelle hinweg fortführt, wenn Sie einen Clip verlängern.
• Wirtschaftlichkeit des Entwurfsmodus.
Jeder Endpunkt hat eine schnelle Entwurfsvariante für günstige Vorschauen. Iterieren Sie am Entwurf, geben Sie echte Credits nur einmal für die finale Version aus — der Workflow, den diese ganze Website propagiert, integriert in die Modellfamilie.
• Der Bildteil ist noch nicht hier.
Der Name FLUX ist für Bilder bekannt, aber die Bildgenerierung von FLUX 3 wird noch ausgerollt. Wenn du hier bist, um Bilder zu erstellen, dauert das noch Wochen — lies die FAQ, bevor du Credits verbrennst, um das herauszufinden.
• Benchmarks sind Hausnummern.
Die Launch-Grafik wurde als vorläufige Bewertung eines frühen Kandidaten gekennzeichnet, und die auffälligsten Gewinnraten wurden gegen Modelle erzielt, die derzeit nicht das Tempo vorgeben. Die späteren Aussagen von BFL sind stärker, aber weiterhin intern.
• 20 Sekunden, nicht 30.
Wan 3.0 und Seedance 2.5 erreichen beide 30 in einem Durchlauf. FLUX 3 antwortet mit einer Erweiterung, die die Naht respektiert — aber wenn ein einzelner, ununterbrochener Halbminuten-Clip das Briefing ist, ist es nicht die richtige Wahl.
• Entwicklungsgewichtungen: geplant, nicht datiert.
Die Open-Weight-Veröffentlichung ist für später im Jahr 2026 angekündigt, ohne Datum oder Lizenzbedingungen. BFLs Open-Source-Bilanz ist wirklich gut, aber ein Plan bleibt ein Plan.
Eins für den Look, eins für die Keyframes, eins für die Naht. Kopieren, Klammern austauschen, rendern — zuerst im Entwurfsmodus.
"Eine handgemachte Stop-Motion-Szene: Ein [astronaut] aus Ton steckt eine kleine Papierflagge auf einen Küchentisch-Mond aus Mehl. Sichtbare Fingerabdrücke im Ton, leicht ruckelige 12fps-Bewegung, weiches Fensterlicht, Filz-Schrittgeräusche und eine gedämpfte Dialogzeile mit quietschiger Stimme."
Die Benennung der Unvollkommenheiten — Fingerabdrücke, ruckelige Bildrate — ist es, was FLUX 3 vom standardmäßigen Hochglanz wegführt. Die meisten Modelle wehren sich gegen „handgemacht“; dieses behandelt es als Stilziel.
Hochladen: 4 Keyframes (Produkt verpackt → ausgepackt → in der Hand → Logokarte)
"Ein 20-sekündiges Unboxing, das diese vier Frames der Reihe nach trifft, etwa 5 Sekunden auseinander. Natürliches Handheld-Gefühl, Geräusche von reißendem Papier und Klebeband, leise Freude von einer Stimme aus dem Off bei Frame drei."
Die Frames tragen die Komposition, sodass der Prompt nur Timing, Bewegung und Ton steuern muss. Hinweise zum Abstand („ungefähr 5 Sekunden auseinander“) verhindern, dass das Modell die Beats überstürzt. Das ist der Workflow, auf den Storyboard-first-Teams gewartet haben.
Beginnen ab: ein Clip, den du bereits erstellt hast
"Um 10 Sekunden verlängern: [dancer] vollendet die Drehung, auf der der Clip endet, die Kamera driftet mit derselben Geschwindigkeit weiter nach links, die Musik läuft ohne Unterbrechung weiter — kein Schnitt, kein Zurücksetzen."
Die Erweiterung liest die Bewegung und den Ton der letzten Frames aus, daher sollte die Anweisung eine Fortsetzung beschreiben, keine neue Szene. "Vervollständigt die Drehung, mit der der Clip endet" gibt ihr den physischen Faden, an dem sie ziehen kann; die Angabe der Kamerageschwindigkeit schützt das Driften über die Naht hinweg.
Drei audio-native Modelle, drei Steuerungsphilosophien. Dieselben Prompts bei allen dreien, bewertet nach dem, was wir ausliefern würden — vorläufig für die beiden neueren. Vergleichen Sie sie selbst aus einem Prompt-Feld.
angekündigt am 23. Juli: eine Architektur für Bild, Video, Audio und Aktion. Video wurde zuerst ausgeliefert (20 s, natives Audio, Keyframes); die Bildgenerierung wird in den folgenden Wochen eingeführt; die Open-Weight-Dev-Veröffentlichung ist für später in diesem Jahr geplant. Die Version auf dieser Seite.
die Bild-Ära, die den Namen bekannt machte: FLUX.1 dev wurde zu einer der am häufigsten heruntergeladenen und feinabgestimmten offenen Diffusionsveröffentlichungen überhaupt, dem Rückgrat unzähliger Community-Workflows.
das Gründungsteam entwickelte die Architektur der latenten Diffusion hinter Stable Diffusion. Die Open-Source-Glaubwürdigkeit, die diese Vorgeschichte verschafft, ist der Grund, warum "FLUX 3 Dev" als Versprechen mehr Gewicht hat als die meisten Open-Weight-Zusagen.
Das erste multimodale Foundation-Modell von Black Forest Labs, angekündigt am 23. Juli 2026 — eine Architektur, die gemeinsam mit Bildern, Video, Audio und Aktionsvorhersage trainiert wurde, vom Team aus Freiburg, dessen Gründer die Architektur hinter Stable Diffusion entwickelt haben. Der Teil, mit dem du heute generieren kannst, ist Video: bis zu 20 Sekunden mit synchronisiertem Soundtrack im selben Durchlauf, aus Text, einem Startbild, angehefteten Keyframes oder einem vorhandenen Clip, den du verlängern möchtest.
Der Realist. Wenn der Clip als echtes Filmmaterial durchgehen muss, mit Ton.
Die lange Einstellung. 30-sekündige Aufnahmen, geschnitten zu deinem Soundtrack.
Der Dokumentenleser. Präsentationen, PDFs und Tabellen rein, Video raus.