FLUX 3 KI-Videogenerator

Das erste Videomodell von Black Forest Labs: 20-sekündige Clips mit synchronisiertem Audio, bis zu 10 angeheftete Keyframes und Looks von Live-Action bis Stop-Motion. Gib unten einen Prompt ein und probiere es aus.

Modell
Bild hochladen
Klicken Sie oder legen Sie hier ein Bild im Format JPG, JPEG, PNG oder WEBP mit bis zu 10 MB ab
Prompt
0/5000
Ausgabe-Seitenverhältnisse
Auto
Auflösung
Auto
Dauer(Sekunden)
Auto
Videobeispiel
 

Entwickler

Black Forest Labs

Typ

Multimodal (Video jetzt, Bild demnächst)

Audio

Nativ, synchronisiert, dasselbe Passwort

Dauer

Bis zu 20 s pro Durchlauf

Schlüsselbilder

Bis zu 10 angeheftete + erste/letzte

Gewichtungen öffnen

Entwicklung geplant, Ende 2026

Stufe hier

Bezahlte Credits + Entwurfsmodus

Unser Urteil in einer Zeile: die Storyboard-Wahl. Wenn du genau weißt, welche Frames die Aufnahme treffen muss — oder du einen Look möchtest, der nicht nach „cinematic AI video“ aussieht — beginne hier.

FLUX 3 stammt aus dem Freiburger Labor, dessen Gründer die Architektur hinter Stable Diffusion entwickelt haben, und es ist ihr erstes Modell, das sich bewegt: ein Netzwerk, das gemeinsam mit Bildern, Video, Audio und Aktionen trainiert wurde und zuerst Video ausliefert. Zwei Dinge heben es in einem überfüllten Monat ab — du kannst bis zu zehn exakte Frames fixieren und das Modell dazwischen animieren lassen, und die Ausgabe ist nicht auf den glänzenden „AI cinematic“-Look festgelegt. Roh, nostalgisch, handgemacht, seltsam: die Bandbreite ist der Punkt.

Ehrliche Einschätzung

Wo FLUX 3 gewinnt — und wo nicht

Erste Eindrücke aus unseren Test-Renderings plus BFLs veröffentlichtes Material — mit den eigenen Vorbehalten unverändert weitergegeben. Wir überarbeiten, sobald unabhängige Zahlen vorliegen.

Wirklich stark

  • • Keyframe-Steuerung.

    Pinne bis zu 10 exakte Frames plus den ersten und letzten, und das Modell generiert Bewegung, Kamera, Dialog und Audio dazwischen. Storyboarding als Eingabeformat — nichts anderes, das wir hosten, akzeptiert so viele Anker.

  • • Ästhetischer Bereich.

    Stop-Motion, Makro, Zeitraffer, nostalgisches Heimvideo, absichtlich seltsam — es entkommt dem einheitlichen filmischen Glanz, auf den die meisten Videomodelle standardmäßig setzen. Wenn der Look deiner Marke nicht "Filmtrailer" ist, ist das wichtig.

  • • Audio im selben Durchlauf.

    Bis zu 20 Sekunden mit synchronisiertem Soundtrack — inklusive Dialog — und nahtbewusster Erweiterung, die Bewegung, Kamera und Audio über die Schnittstelle hinweg fortführt, wenn Sie einen Clip verlängern.

  • • Wirtschaftlichkeit des Entwurfsmodus.

    Jeder Endpunkt hat eine schnelle Entwurfsvariante für günstige Vorschauen. Iterieren Sie am Entwurf, geben Sie echte Credits nur einmal für die finale Version aus — der Workflow, den diese ganze Website propagiert, integriert in die Modellfamilie.

Bekannte Einschränkungen

  • • Der Bildteil ist noch nicht hier.

    Der Name FLUX ist für Bilder bekannt, aber die Bildgenerierung von FLUX 3 wird noch ausgerollt. Wenn du hier bist, um Bilder zu erstellen, dauert das noch Wochen — lies die FAQ, bevor du Credits verbrennst, um das herauszufinden.

  • • Benchmarks sind Hausnummern.

    Die Launch-Grafik wurde als vorläufige Bewertung eines frühen Kandidaten gekennzeichnet, und die auffälligsten Gewinnraten wurden gegen Modelle erzielt, die derzeit nicht das Tempo vorgeben. Die späteren Aussagen von BFL sind stärker, aber weiterhin intern.

  • • 20 Sekunden, nicht 30.

    Wan 3.0 und Seedance 2.5 erreichen beide 30 in einem Durchlauf. FLUX 3 antwortet mit einer Erweiterung, die die Naht respektiert — aber wenn ein einzelner, ununterbrochener Halbminuten-Clip das Briefing ist, ist es nicht die richtige Wahl.

  • • Entwicklungsgewichtungen: geplant, nicht datiert.

    Die Open-Weight-Veröffentlichung ist für später im Jahr 2026 angekündigt, ohne Datum oder Lizenzbedingungen. BFLs Open-Source-Bilanz ist wirklich gut, aber ein Plan bleibt ein Plan.

Prompt-Rezepte

Drei Prompts, die zeigen, wofür es ist

Eins für den Look, eins für die Keyframes, eins für die Naht. Kopieren, Klammern austauschen, rendern — zuerst im Entwurfsmodus.

Das Antikinematografische — gezeigte Stilpalette

"Eine handgemachte Stop-Motion-Szene: Ein [astronaut] aus Ton steckt eine kleine Papierflagge auf einen Küchentisch-Mond aus Mehl. Sichtbare Fingerabdrücke im Ton, leicht ruckelige 12fps-Bewegung, weiches Fensterlicht, Filz-Schrittgeräusche und eine gedämpfte Dialogzeile mit quietschiger Stimme."

Warum es funktioniert

Die Benennung der Unvollkommenheiten — Fingerabdrücke, ruckelige Bildrate — ist es, was FLUX 3 vom standardmäßigen Hochglanz wegführt. Die meisten Modelle wehren sich gegen „handgemacht“; dieses behandelt es als Stilziel.

Storyboard-Sperre — Keyframes als Skript

Hochladen: 4 Keyframes (Produkt verpackt → ausgepackt → in der Hand → Logokarte)

"Ein 20-sekündiges Unboxing, das diese vier Frames der Reihe nach trifft, etwa 5 Sekunden auseinander. Natürliches Handheld-Gefühl, Geräusche von reißendem Papier und Klebeband, leise Freude von einer Stimme aus dem Off bei Frame drei."

Warum es funktioniert

Die Frames tragen die Komposition, sodass der Prompt nur Timing, Bewegung und Ton steuern muss. Hinweise zum Abstand („ungefähr 5 Sekunden auseinander“) verhindern, dass das Modell die Beats überstürzt. Das ist der Workflow, auf den Storyboard-first-Teams gewartet haben.

Die nahtlose Erweiterung

Beginnen ab: ein Clip, den du bereits erstellt hast

"Um 10 Sekunden verlängern: [dancer] vollendet die Drehung, auf der der Clip endet, die Kamera driftet mit derselben Geschwindigkeit weiter nach links, die Musik läuft ohne Unterbrechung weiter — kein Schnitt, kein Zurücksetzen."

Warum es funktioniert

Die Erweiterung liest die Bewegung und den Ton der letzten Frames aus, daher sollte die Anweisung eine Fortsetzung beschreiben, keine neue Szene. "Vervollständigt die Drehung, mit der der Clip endet" gibt ihr den physischen Faden, an dem sie ziehen kann; die Angabe der Kamerageschwindigkeit schützt das Driften über die Naht hinweg.

Direkter Vergleich

FLUX 3 vs Veo vs Seedance 2.5

Drei audio-native Modelle, drei Steuerungsphilosophien. Dieselben Prompts bei allen dreien, bewertet nach dem, was wir ausliefern würden — vorläufig für die beiden neueren. Vergleichen Sie sie selbst aus einem Prompt-Feld.

JobFLUX 3VeoSeedance 2.5
Keyframe / strukturelle Steuerung 10 angeheftet + erste/letzte Nur Prompt Erster/letzter Frame
Nicht-filmische Stile Am besten — von Stop-Motion bis seltsam Ausreichend Gut
Realistisches Filmmaterial Gut (früh) Beste Gut (früh)
Max. Cliplänge 20 s + nahtbewusst erweitern 8 s 30 s nativ
Audiogesteuerte Taktung aus einem Track Nein Nein Ja
Günstige Iteration Integrierte Entwurfsvarianten Keine Entwurfsstufe Entwurf über schnelle gleichgeordnete Elemente
Roadmap für offene Gewichte Entwicklung geplant, starke Bilanz Keine Keine
Nachgewiesene Erfolgsbilanz Wochen alt Hergestellt Wochen alt
Versionsverlauf

Vom Bildlabor zur Multimodalität

Juli 2026 · Aktuell

FLUX 3

angekündigt am 23. Juli: eine Architektur für Bild, Video, Audio und Aktion. Video wurde zuerst ausgeliefert (20 s, natives Audio, Keyframes); die Bildgenerierung wird in den folgenden Wochen eingeführt; die Open-Weight-Dev-Veröffentlichung ist für später in diesem Jahr geplant. Die Version auf dieser Seite.

Früher

FLUX.2 und die FLUX.1-Familie

die Bild-Ära, die den Namen bekannt machte: FLUX.1 dev wurde zu einer der am häufigsten heruntergeladenen und feinabgestimmten offenen Diffusionsveröffentlichungen überhaupt, dem Rückgrat unzähliger Community-Workflows.

Ursprung

Vor FLUX

das Gründungsteam entwickelte die Architektur der latenten Diffusion hinter Stable Diffusion. Die Open-Source-Glaubwürdigkeit, die diese Vorgeschichte verschafft, ist der Grund, warum "FLUX 3 Dev" als Versprechen mehr Gewicht hat als die meisten Open-Weight-Zusagen.

FAQ

FLUX 3 Fragen, direkt beantwortet

1. Was ist FLUX 3?

Das erste multimodale Foundation-Modell von Black Forest Labs, angekündigt am 23. Juli 2026 — eine Architektur, die gemeinsam mit Bildern, Video, Audio und Aktionsvorhersage trainiert wurde, vom Team aus Freiburg, dessen Gründer die Architektur hinter Stable Diffusion entwickelt haben. Der Teil, mit dem du heute generieren kannst, ist Video: bis zu 20 Sekunden mit synchronisiertem Soundtrack im selben Durchlauf, aus Text, einem Startbild, angehefteten Keyframes oder einem vorhandenen Clip, den du verlängern möchtest.

Andere Modelle

Nicht das richtige Tool? Probiere die benachbarten aus

Veo

Der Realist. Wenn der Clip als echtes Filmmaterial durchgehen muss, mit Ton.

Seedance 2.5

Die lange Einstellung. 30-sekündige Aufnahmen, geschnitten zu deinem Soundtrack.

Wan 3.0

Der Dokumentenleser. Präsentationen, PDFs und Tabellen rein, Video raus.