Grok Imagine 1.5 KI-Video-Generator

xAIs Bild-zu-Video-Spezialist: dein Standbild wird zum ersten Frame — Komposition, Licht und Identität bleiben erhalten — und Musik, Effekte sowie lippensynchroner Dialog werden im selben Durchlauf generiert. Gib unten einen Prompt ein und probiere es aus.

Modell
Bild: 0/1
Start-Frame-Bild hochladen
(JPG, JPEG, PNG, WEBP, max. 30 MB)
Prompt
0/5000
Videobeispiel
 

Entwickler

xAI

Typ

Bild zuerst · auch T2V

Dauer

Bis zu 15 s

Max. Ausgabe

720p (offiziell)

Audio

Musik · SFX · Lippensynchronisation, ein Durchlauf

Geschwindigkeit

Rendert in Sekunden

Arena

#1 i2v zum Start (Elo 1473)

Unser Ein-Zeilen-Urteil: die Wahl für Bild-zu-Video. Wenn die Aufnahme mit einem Standbild beginnt, das Sie bereits haben — einem Produktfoto, einem Porträt, einem Einzelbild — animiert es hier nichts schneller oder originalgetreuer.

Grok Imagine Video 1.5 ist das Modell, das im Juni die Image-to-Video-Krone errungen hat: Ende Mai eingeführt, debütierte es auf Platz 1 der crowdgesourcten i2v-Arena mit 1473 Elo — ein Sprung um 52 Punkte gegenüber seinem Vorgänger, vorbei an Seedance 2.0 und Veo. Seine Architektur erklärt die Spezialisierung: Aurora erzeugt Frames sequenziell, wobei jeder auf allem Vorherigen basiert; so behält Ihr hochgeladenes Standbild — behandelt als buchstäblich erster Frame — seine Komposition, Beleuchtung und Motividentität, statt abzudriften. Musik, Soundeffekte und lippensynchrone Dialoge werden im selben Durchlauf gerendert, und Clips sind in Sekunden statt Minuten fertig. Eine Klarstellung, bevor Sie Geld ausgeben: Dies ist das Videomodell von xAI, nicht der Grok-Chatbot — gleiche Marke, anderes Produkt.

Ehrliche Einschätzung

Wo Grok Imagine 1.5 punktet — und wo nicht

Beurteilt anhand unserer eigenen Renderings und der veröffentlichten Aufzeichnungen, überarbeitet, sobald sich die Fakten ändern — das ist ein Merkmal dieser Seite, kein Haftungsausschluss.

Wirklich stark

  • • Bildtreue nach Architektur.

    Die Quelle ist weiterhin das erste Frame, keine lose Referenz — Auroras sequenzielle Konditionierung bewahrt Komposition, Licht und Identität über den gesamten Clip hinweg. Genau damit wurde die Krone der i2v-Arena gewonnen.

  • • Audio in einem Durchgang, Dialoge inklusive.

    Hintergrundmusik, Soundeffekte und lippensynchronisierte Sprache werden zusammen mit dem Bild generiert. Lippensynchronisation ist die wichtigste Verbesserung gegenüber 1.0 — ein Talking-Head-Clip benötigt keinen zweiten Durchlauf.

  • • Zeitgestempelte Aufnahmesteuerung.

    Schreibe den Prompt als Zeitleiste — '(0-5s) Halbnahaufnahme... (5-10s) Kamerafahrt nach vorn...' — und die Beats landen dort, wo du sie platzierst. Shotlist-Prompting, nativ.

  • • Geschwindigkeit als Workflow-Funktion.

    Renderings sind in der Regel in Sekunden fertig. Iterationsschleifen, die anderswo Minuten kosten, laufen hier im Gesprächstempo — der günstigste Qualitätsmultiplikator, den es gibt.

Bekannte Limits

  • • 720p ist die offizielle Obergrenze.

    Die eigene Linie von xAI ist 720p (einige Gateways bieten höhere Werte). In einem Bereich, in dem Konkurrenten 1080p bis 4K liefern, ist dies die Spezifikation, die manche Briefings früh beendet.

  • • Text-to-Video ist die schwächere Hälfte.

    xAIs eigene Empfehlung: t2v ist 'generativer und weniger kontrolliert' als der Bildpfad. Wenn du kein Ausgangs-Standbild hast, passen die prompt-first-Flaggschiffe besser.

  • • Die Markenverwirrungssteuer.

    Es trägt denselben Namen wie der Grok-Chatbot, ist aber ein separates Produkt — das Denkvermögen des Chatbots sagt in keiner Richtung etwas über dieses Modell aus. Beurteilen Sie es anhand der Renderings.

  • • Arena-Rang ≠ Produktionsdatensatz.

    Der Elo-Wert misst die Präferenz der Masse bei i2v-Paaren, und das Modell ist einige Wochen alt. Betrachten Sie die Krone als starkes Signal, nicht als endgültiges Urteil.

Prompt-Rezepte

Drei Prompts, die zeigen, wofür es ist

In den Generator oben kopieren, die Klammern austauschen, rendern.

Das Produktstill, zum Leben erweckt

Hochladen: dein Produktfoto

"(0-4s) die [Flasche] steht in weichem Morgenlicht, während Staubpartikel schweben. (4-9s) langsames Heranfahren, während ein warmes Hauptlicht von links aufblendet. (9-12s) auf einer Nahaufnahme verweilen, während das Etikett das Licht einfängt. Ruhiger Ambient-Score, ein sanfter Glockenton am Ende."

Warum es funktioniert

Zeitstempel verwandeln den Prompt in eine Shotlist, und die Architektur mit Standbild als erstem Frame hält das Produkt genau so, wie es fotografiert wurde. Die Demo neben dem Generator ist dieser Prompt.

Das sprechende Porträt

Hochladen: ein Porträtfoto

"Sie blickt vom Notizbuch auf und sagt warm: 'Ich habe Jahre gebraucht, um das zu lernen.' Dann ein kleines Lächeln, zurück zum Schreiben. Raumton, Kratzen des Bleistifts, keine Musik."

Warum es funktioniert

Dialog in Anführungszeichen aktiviert die Lippensynchronisation — die stolzeste Korrektur der Generation 1.5. Halte die Zeilen kurz und lass den Prompt die Aktion davor und danach benennen, damit der Vortrag einen Zielpunkt hat.

Die verkettete Sequenz

Erzeuge einen ersten Clip → Erweitere ab seinem letzten Frame → "Fortsetzen: die Kamera driftet weiter nach rechts am Fenster vorbei; draußen hat der Regen eingesetzt. Die Musik läuft nahtlos weiter."

Warum es funktioniert

Die Erweiterung setzt exakt am letzten Frame an, sodass Bewegung, Licht und Audio fortgesetzt werden, statt zurückgesetzt zu werden. Verketten Sie zwei oder drei Erweiterungen, und aus einer 15-Sekunden-Grenze wird unauffällig eine 40-Sekunden-Sequenz.

Direkter Vergleich

Grok Imagine 1.5 vs. Seedance 2.0 vs. Veo

Das Image-to-Video-Podium, wie es die Juni-Arena eingestuft hat — der neue Spitzenreiter gegen die beiden, die er überholt hat. Dieselben Standbilder und Prompts bei allen drei, bewertet danach, was wir ausliefern würden. Alle drei sind im Generator oben auswählbar.

JobGrok Imagine 1.5Seedance 2.0Veo
i2v-arena-rang zum start #1 (Elo 1473) Bestanden Bestanden
Quellbildtreue Am besten — das Standbild ist Bild eins Gut Gut
Rendergeschwindigkeit Sekunden Minuten 1–3 Minuten
Ein-Pass-Audio Musik + SFX + Lippensynchronisation Native Audio Umgebungsgeräusche + Dialog
Steuerung zeitgestempelter Aufnahmen Native Syntax Nein Nein
Max. Auflösung 720p offiziell 1080p + hochauflösende Pipeline 1080p
Realismus auf dem Prüfstand Gut Gut Beste
Nachgewiesene Erfolgsbilanz Wochen alt Arena-Ära, Monate Etabliert
Versionsverlauf

Wie es hierhergekommen ist

Juni 2026 · Aktuell

Grok Imagine Video 1.5

Vorschau 30.–31. Mai, #1 i2v arena-Debüt, GA in der xAI API bis Mitte Juni als grok-imagine-video-1.5. 15-Sekunden-Clips, One-Pass-Audio mit verbesserter Lippensynchronisation, Erweiterung und Referenzführung. Die Version im Generator oben.

Früher in 2026

Grok Imagine Video 1.0

die 10-sekündige Erstveröffentlichung, die xAI auf die Video-Landkarte brachte; der Arena-Sprung von 1.5 wurde daran gemessen.

Ursprung

Polarlicht

Das autoregressive Bild-Backbone von xAI, dessen Stärke in der Charakterkonsistenz der architektonische Grund dafür ist, dass die Videolinie dein Standbild als Ground Truth behandelt.

FAQ

Fragen zu Grok Imagine 1.5, direkt beantwortet

1. Was ist Grok Imagine 1.5?

Das Videogenerierungsmodell von xAI — offiziell Grok Imagine Video 1.5, Ende Mai 2026 veröffentlicht und seit Mitte Juni allgemein in der xAI API verfügbar. Es ist bildbasiert: Laden Sie ein Standbild hoch, beschreiben Sie die Bewegung, und es animiert die Szene mit der Quelle als buchstäblichem ersten Frame, wobei Musik, Soundeffekte und lippensynchrone Dialoge im selben Durchlauf generiert werden. Clips können bis zu 15 Sekunden lang sein und werden innerhalb von Sekunden gerendert.