Grok Imagine 1.5 AI動画生成ツール

xAIの画像から動画へのスペシャリスト:静止画が最初のフレームになります—構図、光、アイデンティティを保持—音楽、エフェクト、リップシンクされた台詞も同じ処理で生成されます。以下にプロンプトを入力して試してみてください。

モデル
画像: 0/1
開始フレーム画像をアップロード
(JPG,JPEG,PNG,WEBP,最大30MB)
プロンプト
0/5000
動画サンプル
 

開発者

xAI

タイプ

画像優先 · T2Vにも対応

期間

最大15秒

最大出力

720p (公式)

オーディオ

音楽 · SFX · リップシンク、1パス

速度

数秒でレンダリング

アリーナ

ローンチ時点で#1のi2v (Elo 1473)

私たちの一行評価: 画像から動画への変換に最適です。ショットがすでにある静止画—商品写真、ポートレート、フレーム—から始まる場合、ここでこれより速く、またはより忠実にアニメーション化できるものはありません。

Grok Imagine Video 1.5は、6月に画像から動画への生成分野の王座を獲得したモデルです。5月末にリリースされ、クラウドソース型i2vアリーナで1473Eloを記録して初登場1位となり、前身モデルを52ポイント上回り、Seedance 2.0とVeoを抜きました。そのアーキテクチャがこの強みを説明しています。Auroraはフレームを順次生成し、各フレームはそれ以前のすべてを条件として生成されるため、アップロードした静止画—文字どおり最初のフレームとして扱われる—は、構図、照明、被写体の同一性を保ち、ずれることがありません。音楽、効果音、リップシンクされたセリフは同じパスでレンダリングされ、クリップは数分ではなく数秒で完成します。利用前に一点だけ明確にしておくと、これはxAIの動画モデルであり、Grokチャットボットではありません—同じブランドですが、別の製品です。

正直な感想

Grok Imagine 1.5が優れている点—そしてそうでない点

当社独自のレンダリングと公開記録に基づいて判断し、事実の変化に応じて改訂しています — これはこのページの特徴であり、免責事項ではありません。

本当に強い

  • • アーキテクチャ別の画像忠実度。

    ソースは依然として最初のフレームであり、緩い参照ではありません—Auroraのシーケンシャルコンディショニングは、クリップ全体を通して構図、光、アイデンティティを保持します。i2vアリーナの王冠はまさにこれで勝ち取られました。

  • • ワンパス音声、会話込み。

    BGM、効果音、リップシンク音声が画像と一緒に生成されます。リップシンクは1.0からの目玉の改善点です—トーキングヘッドクリップに2回目の処理は不要です。

  • • タイムスタンプ付きショットコントロール。

    プロンプトをタイムラインとして書く — '(0-5s)ミディアムショット... (5-10s)プッシュイン...' — すると、ビートは配置した場所に決まります。ショットリストプロンプティングをネイティブに。

  • • ワークフロー機能としてのスピード。

    レンダリングは通常、数秒で完了します。他では数分かかる反復ループも、ここでは会話のペースで進みます—存在する中で最も安価な品質向上要因です。

既知の制限

  • • 720pが公式上限です。

    xAI独自のラインは720pです(一部のゲートウェイではそれ以上が公開されています)。競合が1080pから4Kを提供する分野では、これが一部のブリーフを早期に終わらせる仕様です。

  • • Text-to-videoは弱いほうの半分です。

    xAI独自のガイダンス: t2vは画像パスより'より生成的で、制御性が低い'です。開始用の静止画がない場合は、prompt-firstのフラッグシップのほうが適しています。

  • • ブランド混乱税。

    Grokチャットボットと同じ名前ですが、別の製品です—チャットボットの推論能力からこのモデルについては、良くも悪くも何も分かりません。レンダリング結果で評価してください。

  • • アリーナランク≠本番記録。

    Eloはi2vペアに対する群衆の好みを測定し、モデルは数週間前のものです。王冠は確定した評決ではなく、強いシグナルとして扱ってください。

プロンプトレシピ

3つのプロンプトが 何のためのものかを表示

上のジェネレーターにコピーし、括弧を入れ替え、レンダリングしてください。

商品スチルに命を吹き込む

アップロード: あなたの商品写真

"(0-4s)[ボトル]が柔らかな夜明けの光の中に立ち、塵の粒子が漂う。(4-9s)左から暖かなキーライトが徐々に明るくなりながら、ゆっくりプッシュイン。(9-12s)ラベルが光を受けるクローズアップで落ち着く。静かなアンビエントスコア、最後に柔らかなチャイムが1回。"

機能する理由

タイムスタンプはプロンプトをショットリストに変え、静止画を最初のフレームにするアーキテクチャにより、商品は撮影されたとおり正確に保たれます。ジェネレーターの横にあるデモがこのプロンプトです。

話すポートレート

アップロード: ポートレート写真

"彼女はノートから顔を上げ、温かく言う:'これを身につけるのに何年もかかったの。'それから小さく微笑み、また書き始める。部屋の環境音、鉛筆のかすれる音、音楽なし。"

機能する理由

引用符付きのセリフはリップシンクを有効にします——1.5世代で最も誇れる修正です。セリフは短くし、プロンプトに前後の動作を指定させて、話し方に着地点を作りましょう。

連鎖シーケンス

最初のクリップを生成 → 最終フレームから延長 → "続行: カメラは窓を通り過ぎて右へ漂い続ける; 外では雨が降り始めている。音楽は継ぎ目なく続く。"

機能する理由

拡張は正確な最後のフレームを条件にするため、モーション、光、音声はリセットされずに継続します。2つまたは3つの拡張をつなげると、15秒の上限がいつの間にか40秒のシーケンスになります。

対戦成績

Grok Imagine 1.5とSeedance 2.0とVeo

6月のアリーナでのランキングによる画像から動画生成の表彰台—追い抜いた2つを相手にした新しいリーダー。同じ静止画とプロンプトを3つすべてで使用し、私たちが出荷できる品質かで審査。3つすべて上のジェネレーターで選択可能。

JobGrok Imagine 1.5Seedance 2.0Veo
ローンチ時のi2vアリーナランキング #1 (Elo 1473) 合格 合格
ソース画像の忠実度 最適 — 静止画はフレーム1 良い 良い
レンダリング速度 1–3分
ワンパス音声 音楽 + SFX + リップシンク ネイティブ音声 環境音 + セリフ
タイムスタンプ付きショット制御 ネイティブ構文 いいえ いいえ
最大解像度 720p公式 1080p + 高解像度パイプライン 1080p
リアリズムを検証 良い 良い 最高
実績のある信頼性 週齢 アリーナ時代、月数 確立済み
バージョン履歴

ここに至った経緯

2026年6月 · 現在

Grok Imagineビデオ1.5

プレビュー5月30–31日、i2v arenaデビューで#1、6月中旬までにgrok-imagine-video-1.5としてxAI APIでGA。15秒クリップ、リップシンクが改善されたワンパス音声、延長と参照ガイダンス。上記のジェネレーター内のバージョン。

2026年以前

Grok Imagine Video 1.0

xAIを動画分野で知らしめた10秒の初回リリース; 1.5のアリーナでの躍進はそれを基準に測られた。

出所

オーロラ

xAIの自己回帰型画像バックボーンであり、そのキャラクター一貫性の強みこそが、動画ラインがあなたの静止画をグラウンドトゥルースとして扱うアーキテクチャ上の理由です。

よくある質問

Grok Imagine 1.5の質問に、率直に回答

1. Grok Imagine 1.5とは何ですか?

xAIの動画生成モデル—正式名称はGrok Imagine Video 1.5で、2026年5月下旬にリリースされ、6月中旬までにxAI APIで一般提供が開始されました。画像起点です。静止画をアップロードし、動きを説明すると、その画像を文字どおり最初のフレームとしてシーンをアニメーション化し、同じ処理で音楽、効果音、リップシンクされた対話を生成します。クリップは最長15秒で、数秒でレンダリングされます。