Realismus-Benchmark von Google DeepMind: Aufnahmen, die als echt durchgehen, mit Umgebungsgeräuschen und gesprochenen Dialogen, die im selben Durchlauf generiert werden. Gib unten einen Prompt ein und probiere es aus.
Entwickler
Google DeepMind
Typ
Text / Bild zu Video
Audio
Nativ, mit Dialog
Dauer
8 s pro Clip
Max. Ausgabe
1080p
Renderzeit
1–3 Min.
Stufe hier
Bezahlte Guthaben
Unser Fazit in einem Satz: wenn der Clip als Filmmaterial durchgehen muss, rendere ihn in Veo. Wenn du noch am Ausprobieren bist, erstelle den Entwurf zuerst auf den schnellen Stufen.
Veo ist das Modell, an dem die Neulinge gemessen werden. Jedes Flaggschiff, das diesen Sommer veröffentlicht wurde — Seedance 2.5, MiniMax H3, Wan 3.0, FLUX 3 — hat Veo in seine Vergleichsdiagramme aufgenommen, weil es die zwei Dinge besitzt, die am schwersten vorzutäuschen sind: physikalischen Realismus, der einer genauen Prüfung standhält, und eine Erfolgsbilanz, die länger ist als eine Launch-Woche. Sein natives Audio leistet weiterhin, was die meisten Konkurrenten nicht können: Eine zitierte Dialogzeile im Prompt kommt gesprochen zurück, synchron zum Gesicht.
Beurteilt anhand unserer eigenen Renderings und der veröffentlichten Dokumentation, überarbeitet, sobald sich die Fakten ändern — das ist ein Merkmal dieser Seite, kein Haftungsausschluss.
• Physikalischer Realismus.
Licht prallt ab, Stoff fällt, Flüssigkeiten fließen wie Flüssigkeiten. Die wenigsten „AI tells“ von allem, was wir hosten, und die Standardantwort, wenn ein Kunde genau hinschauen wird.
• Native Audiospur mit Dialog.
Ambiente, Effekte und kurze gesprochene Zeilen, synchron zur Handlung. Schreibe den Sound in den Prompt, und er wird gerendert — kein Scoring-Durchlauf.
• Einhaltung des Prompts.
Kameraanweisungen — Dollyfahrt, Schwenk, Rack Focus — werden befolgt, nicht bloß als Inspiration genutzt. Shotlist-Prompts zahlen sich hier mehr aus als irgendwo sonst.
• Nachweisliche Erfolgsbilanz.
Unabhängige Rankings, monatelanger Produktionseinsatz, bekannte Fehlermodi. In einem Sommer voller eine Woche alter Flaggschiffe ist langweilige Zuverlässigkeit ein Feature.
• Obergrenze von 8 Sekunden.
Die kürzesten Clips in unserem aktuellen Angebot — Seedance 2.5 erreicht 30 Sekunden, FLUX 3 zwanzig. Längere Sequenzen bedeuten Verketten und das Planen von Schnitten.
• Kosten und Geschwindigkeit.
1–3 Minuten pro Rendering bei den hier höchsten Credit-Kosten. Es ist das Modell für den Feinschliff, nicht das Skizziermodell.
• Strengste Filter.
Personen des öffentlichen Lebens, Kinder, Gewalt — werden auf Modellebene abgelehnt. Blockierte Aufträge verbrauchen hier keine Credits, aber rechne mit etwas Umformulierung.
• Stilisierte Animation.
Anime- und handgemachte Looks wirken seltsam glänzend. FLUX 3 und Seedance handhaben Stilisierung besser.
In den Generator oben kopieren, die Klammern austauschen, rendern.
"Halbnahaufnahme eines [wettergegerbten Fischers] auf einem Steg bei Morgengrauen, der knapp an der Kamera vorbeischaut. Er sagt: 'Der Sturm kommt dieses Jahr früh.' Möwen in der Ferne, knarrendes Seil. Bedecktes Licht, dokumentarischer Stil."
In Anführungszeichen gesetzter Dialog erzeugt gesprochene Audiodaten, die mit dem Gesicht synchronisiert sind. Halte Zeilen unter ~10 Wörtern. Die Demo neben dem Generator ist genau dieser Prompt.
"Langsame 180°-Umfahrt um eine [mattschwarze Espressomaschine] auf einer Betonarbeitsplatte. Dampf steigt auf; wir hören das leise Zischen der Dampflanze und sanftes Café-Ambiente. Morgenlicht durchs Fenster, geringe Schärfentiefe, 35mm."
Den Ton in den Prompt zu schreiben ('wir hören...') ist der Veo-spezifische Kniff — die Hälfte des Werts steckt in diesem Satz.
Hochladen: ein Standbild
"Subtile Handkamerabewegung, als wäre es mit einem Telefon gefilmt. [subject] atmet und verlagert das Gewicht auf natürliche Weise; der Hintergrund bleibt fixiert. Leiser Raumton, entfernter Verkehr."
"Wie mit einem Handy gefilmt" verankert die Physik, und minimale Bewegungsanweisungen verhindern, dass Gesichter bei Bild-zu-Video abdriften.
Drei audio-native Modelle. Dieselben Prompts bei allen drei, beurteilt nach dem, was wir veröffentlichen würden — diese Tabelle entspricht der auf der FLUX 3-Seite, sodass die Daten überall übereinstimmen, egal wo du landest. Alle drei sind oben im Generator auswählbar.
schärfere Physik, längere kohärente Bewegung, zuverlässigere Dialogsynchronisation. Die Version im Generator oben.
die Veröffentlichung, die 'KI-Video mit Ton' zu einer Kategorie machte; die viralen Straßeninterview-Clips stammten aus dieser Version.
solides stummes Video, weitgehend auf Forschung ausgerichtet. Der Sprung beim Audio machte daraus statt einer Demo ein Werkzeug.
Das Videogenerierungsmodell von Google DeepMind — am stärksten bei Aufnahmen, die real wirken, mit nativ zusammen mit dem Bild erzeugtem Audio: Ambiente, Effekte und kurze Dialoge. Funktioniert mit Text oder animiert ein Standbild, mit bis zu 1080p, 8 Sekunden pro Clip.
Der Regisseur. Multi-Shot-Storytelling bis zu 4K mit dem Regisseur-Modus.
Die lange Einstellung. 30-Sekunden-Aufnahmen, passend zu deinem Soundtrack geschnitten.
Der Stylist. Keyframe-Steuerung und Looks von cineastisch bis Stop-Motion.