Lo specialista di xAI per trasformare immagini in video: la tua immagine statica diventa il primo fotogramma — composizione, luce e identità preservate — con musica, effetti e dialoghi sincronizzati con il labiale generati nello stesso passaggio. Digita un prompt qui sotto e provalo.
Sviluppatore
xAI
Tipo
Prima l’immagine · anche T2V
Durata
Fino a 15 s
Output max
720p (ufficiale)
Audio
Musica · SFX · sincronizzazione labiale, un solo passaggio
Velocità
Renderizza in pochi secondi
Arena
#1 i2v al lancio (Elo 1473)
Il nostro verdetto in una riga: la scelta per trasformare immagini in video. Quando l'inquadratura parte da un'immagine statica che hai già — una foto prodotto, un ritratto, un fotogramma — niente qui la anima più velocemente o con maggiore fedeltà.
Grok Imagine Video 1.5 è il modello che ha conquistato la corona dell’image-to-video a giugno: lanciato alla fine di maggio, ha debuttato al #1 nell’arena i2v crowd-sourced con 1473 Elo — un salto di 52 punti rispetto al suo predecessore, davanti a Seedance 2.0 e Veo. La sua architettura ne spiega la specialità: Aurora genera i frame in sequenza, ciascuno condizionato da tutto ciò che lo precede, quindi l’immagine statica che carichi — trattata come il primo frame letterale — mantiene composizione, illuminazione e identità del soggetto invece di deviare. Musica, effetti sonori e dialoghi sincronizzati con il labiale vengono generati nello stesso passaggio, e le clip arrivano in pochi secondi anziché in minuti. Una precisazione prima di spendere: questo è il modello video di xAI, non il chatbot Grok — stesso brand, prodotto diverso.
Valutato in base ai nostri rendering e al registro pubblicato, aggiornato man mano che i fatti evolvono — questa è una caratteristica di questa pagina, non una dichiarazione di esclusione di responsabilità.
• Fedeltà dell'immagine per architettura.
La sorgente è ancora il primo fotogramma, non un riferimento libero — il condizionamento sequenziale di Aurora mantiene composizione, luce e identità per tutta la clip. La corona dell'arena i2v è stata conquistata proprio su questo.
• Audio in un solo passaggio, dialoghi inclusi.
Musica di sottofondo, effetti sonori e parlato sincronizzato con le labbra vengono generati insieme all'immagine. La sincronizzazione labiale è il miglioramento principale rispetto alla versione 1.0 — una clip con testa parlante non richiede un secondo passaggio.
• Controllo dello scatto con timestamp.
Scrivi il prompt come una timeline — '(0-5s) campo medio... (5-10s) carrellata in avanti...' — e i beat cadono dove li posizioni. Prompting con shot list, nativo.
• La velocità come funzionalità del flusso di lavoro.
I rendering in genere si completano in pochi secondi. I cicli di iterazione che altrove richiedono minuti qui procedono al ritmo di una conversazione — il moltiplicatore di qualità più conveniente che esista.
• 720p è il limite ufficiale.
La linea propria di xAI è a 720p (alcuni gateway espongono valori superiori). In un settore in cui i concorrenti offrono da 1080p a 4K, questa è la specifica che chiude alcuni brief in anticipo.
• Text-to-video è la metà più debole.
Le indicazioni di xAI: t2v è 'più generativo e meno controllato' rispetto al percorso basato sull'immagine. Se non hai un'immagine statica di partenza, le soluzioni di punta prompt-first sono più adatte.
• La tassa sulla confusione del marchio.
Condivide il nome con il chatbot Grok, ma è un prodotto separato — il ragionamento del chatbot non dice nulla su questo modello, né in un senso né nell'altro. Valutalo dai rendering.
• Classifica arena ≠ record di produzione.
L'Elo misura la preferenza del pubblico sulle coppie i2v, e il modello ha qualche settimana. Considera la corona un segnale forte, non un verdetto definitivo.
Copia nel generatore sopra, sostituisci le parentesi, renderizza.
Carica: la foto del tuo prodotto
"(0-4s) la [bottiglia] si staglia nella morbida luce dell’alba mentre granelli di polvere fluttuano. (4-9s) lento avvicinamento mentre una calda luce principale aumenta gradualmente da sinistra. (9-12s) fermarsi su un primo piano mentre l’etichetta cattura la luce. Colonna sonora ambient tranquilla, un delicato rintocco alla fine."
I timestamp trasformano il prompt in una shot list, e l’architettura con immagine statica come primo frame mantiene il prodotto esattamente come fotografato. La demo accanto al generatore è questo prompt.
Carica: una foto ritratto
"Alza lo sguardo dal taccuino e dice, con calore: 'Mi ci sono voluti anni per impararlo.' Poi un piccolo sorriso, torna a scrivere. Suono d'ambiente della stanza, fruscio della matita, niente musica."
Il dialogo tra virgolette attiva la sincronizzazione labiale — la correzione di cui la generazione 1.5 va più fiera. Mantieni le battute brevi e lascia che il prompt indichi l'azione prima e dopo, così la recitazione avrà un punto di arrivo.
Genera un primo clip → Estendi dal suo fotogramma finale → "Continua: la telecamera continua a spostarsi lentamente verso destra oltre la finestra; fuori ha iniziato a piovere. La musica prosegue senza stacchi."
L’estensione si basa esattamente sull’ultimo fotogramma, quindi movimento, luce e audio continuano invece di ripristinarsi. Collega due o tre estensioni e un limite di 15 secondi diventa silenziosamente una sequenza di 40 secondi.
Il podio image-to-video secondo la classifica dell’arena di giugno — il nuovo leader contro i due che ha superato. Stesse immagini statiche e stessi prompt in tutti e tre, valutati in base a ciò che pubblicheremmo. Tutti e tre selezionabili nel generatore qui sopra.
anteprima 30–31 maggio, debutto al #1 in i2v arena, GA nell'xAI API entro metà giugno come grok-imagine-video-1.5. Clip di 15 secondi, audio in un solo passaggio con sincronizzazione labiale migliorata, estensione e guida di riferimento. La versione nel generatore sopra.
la prima release di 10 secondi che ha messo xAI sulla mappa dei video; il salto nell'arena di 1.5 è stato misurato rispetto a essa.
Il backbone di immagini autoregressivo di xAI, la cui forza nella coerenza dei personaggi è la ragione architetturale per cui la linea video tratta la tua immagine statica come ground truth.
Il modello di generazione video di xAI — formalmente Grok Imagine Video 1.5, rilasciato a fine maggio 2026 e disponibile in GA nell'API di xAI da metà giugno. È incentrato sull'immagine: carica un'immagine statica, descrivi il movimento e anima la scena usando la sorgente come primo fotogramma letterale, generando musica, effetti sonori e dialoghi sincronizzati con il labiale nello stesso passaggio. I clip durano fino a 15 secondi e vengono renderizzati in pochi secondi.