xAIの画像から動画へのスペシャリスト:静止画が最初のフレームになります—構図、光、アイデンティティを保持—音楽、エフェクト、リップシンクされた台詞も同じ処理で生成されます。以下にプロンプトを入力して試してみてください。
開発者
xAI
タイプ
画像優先 · T2Vにも対応
期間
最大15秒
最大出力
720p (公式)
オーディオ
音楽 · SFX · リップシンク、1パス
速度
数秒でレンダリング
アリーナ
ローンチ時点で#1のi2v (Elo 1473)
私たちの一行評価: 画像から動画への変換に最適です。ショットがすでにある静止画—商品写真、ポートレート、フレーム—から始まる場合、ここでこれより速く、またはより忠実にアニメーション化できるものはありません。
Grok Imagine Video 1.5は、6月に画像から動画への生成分野の王座を獲得したモデルです。5月末にリリースされ、クラウドソース型i2vアリーナで1473Eloを記録して初登場1位となり、前身モデルを52ポイント上回り、Seedance 2.0とVeoを抜きました。そのアーキテクチャがこの強みを説明しています。Auroraはフレームを順次生成し、各フレームはそれ以前のすべてを条件として生成されるため、アップロードした静止画—文字どおり最初のフレームとして扱われる—は、構図、照明、被写体の同一性を保ち、ずれることがありません。音楽、効果音、リップシンクされたセリフは同じパスでレンダリングされ、クリップは数分ではなく数秒で完成します。利用前に一点だけ明確にしておくと、これはxAIの動画モデルであり、Grokチャットボットではありません—同じブランドですが、別の製品です。
当社独自のレンダリングと公開記録に基づいて判断し、事実の変化に応じて改訂しています — これはこのページの特徴であり、免責事項ではありません。
• アーキテクチャ別の画像忠実度。
ソースは依然として最初のフレームであり、緩い参照ではありません—Auroraのシーケンシャルコンディショニングは、クリップ全体を通して構図、光、アイデンティティを保持します。i2vアリーナの王冠はまさにこれで勝ち取られました。
• ワンパス音声、会話込み。
BGM、効果音、リップシンク音声が画像と一緒に生成されます。リップシンクは1.0からの目玉の改善点です—トーキングヘッドクリップに2回目の処理は不要です。
• タイムスタンプ付きショットコントロール。
プロンプトをタイムラインとして書く — '(0-5s)ミディアムショット... (5-10s)プッシュイン...' — すると、ビートは配置した場所に決まります。ショットリストプロンプティングをネイティブに。
• ワークフロー機能としてのスピード。
レンダリングは通常、数秒で完了します。他では数分かかる反復ループも、ここでは会話のペースで進みます—存在する中で最も安価な品質向上要因です。
• 720pが公式上限です。
xAI独自のラインは720pです(一部のゲートウェイではそれ以上が公開されています)。競合が1080pから4Kを提供する分野では、これが一部のブリーフを早期に終わらせる仕様です。
• Text-to-videoは弱いほうの半分です。
xAI独自のガイダンス: t2vは画像パスより'より生成的で、制御性が低い'です。開始用の静止画がない場合は、prompt-firstのフラッグシップのほうが適しています。
• ブランド混乱税。
Grokチャットボットと同じ名前ですが、別の製品です—チャットボットの推論能力からこのモデルについては、良くも悪くも何も分かりません。レンダリング結果で評価してください。
• アリーナランク≠本番記録。
Eloはi2vペアに対する群衆の好みを測定し、モデルは数週間前のものです。王冠は確定した評決ではなく、強いシグナルとして扱ってください。
上のジェネレーターにコピーし、括弧を入れ替え、レンダリングしてください。
アップロード: あなたの商品写真
"(0-4s)[ボトル]が柔らかな夜明けの光の中に立ち、塵の粒子が漂う。(4-9s)左から暖かなキーライトが徐々に明るくなりながら、ゆっくりプッシュイン。(9-12s)ラベルが光を受けるクローズアップで落ち着く。静かなアンビエントスコア、最後に柔らかなチャイムが1回。"
タイムスタンプはプロンプトをショットリストに変え、静止画を最初のフレームにするアーキテクチャにより、商品は撮影されたとおり正確に保たれます。ジェネレーターの横にあるデモがこのプロンプトです。
アップロード: ポートレート写真
"彼女はノートから顔を上げ、温かく言う:'これを身につけるのに何年もかかったの。'それから小さく微笑み、また書き始める。部屋の環境音、鉛筆のかすれる音、音楽なし。"
引用符付きのセリフはリップシンクを有効にします——1.5世代で最も誇れる修正です。セリフは短くし、プロンプトに前後の動作を指定させて、話し方に着地点を作りましょう。
最初のクリップを生成 → 最終フレームから延長 → "続行: カメラは窓を通り過ぎて右へ漂い続ける; 外では雨が降り始めている。音楽は継ぎ目なく続く。"
拡張は正確な最後のフレームを条件にするため、モーション、光、音声はリセットされずに継続します。2つまたは3つの拡張をつなげると、15秒の上限がいつの間にか40秒のシーケンスになります。
6月のアリーナでのランキングによる画像から動画生成の表彰台—追い抜いた2つを相手にした新しいリーダー。同じ静止画とプロンプトを3つすべてで使用し、私たちが出荷できる品質かで審査。3つすべて上のジェネレーターで選択可能。
プレビュー5月30–31日、i2v arenaデビューで#1、6月中旬までにgrok-imagine-video-1.5としてxAI APIでGA。15秒クリップ、リップシンクが改善されたワンパス音声、延長と参照ガイダンス。上記のジェネレーター内のバージョン。
xAIを動画分野で知らしめた10秒の初回リリース; 1.5のアリーナでの躍進はそれを基準に測られた。
xAIの自己回帰型画像バックボーンであり、そのキャラクター一貫性の強みこそが、動画ラインがあなたの静止画をグラウンドトゥルースとして扱うアーキテクチャ上の理由です。
xAIの動画生成モデル—正式名称はGrok Imagine Video 1.5で、2026年5月下旬にリリースされ、6月中旬までにxAI APIで一般提供が開始されました。画像起点です。静止画をアップロードし、動きを説明すると、その画像を文字どおり最初のフレームとしてシーンをアニメーション化し、同じ処理で音楽、効果音、リップシンクされた対話を生成します。クリップは最長15秒で、数秒でレンダリングされます。