Google DeepMindのリアリズムベンチマーク:本物に見える映像に、環境音と話し言葉の対話が同じパスで生成されます。下にプロンプトを入力して試してみてください。
開発者
Google DeepMind
タイプ
テキスト / 画像から動画
オーディオ
ネイティブ、会話あり
期間
クリップあたり8秒
最大出力
1080p
レンダリング時間
1~3分
ここにティア
有料クレジット
私たちの一言での評価: クリップを映像素材として通用させる必要がある場合は、Veoでレンダリングしてください。まだ試行錯誤している段階では、まず高速ティアで下書きしてください。
Veoは新規参入組が比較対象として測られるモデルです。この夏にリリースされたすべてのフラッグシップ——Seedance 2.5、MiniMax H3、Wan 3.0、FLUX 3——は比較チャートにVeoを入れました。なぜなら、Veoにはごまかすのが最も難しい2つのものがあるからです。精査に耐える物理的リアリズムと、ローンチ週より長い実績です。そのネイティブ音声はいまでも、ほとんどのライバルにできないことをこなします。プロンプト内の引用されたセリフが、顔に同期して話された状態で返ってくるのです。
私たち自身のレンダリングと公開記録に基づいて判断し、事実が変わるにつれて改訂される—それがこのページの特徴であり、免責事項ではありません。
• 物理的リアリズム。
光は反射し、布は自然に垂れ、液体は液体らしく注がれます。私たちがホストする中で最も「AIらしさ」が少なく、クライアントが細部まで確認する場合の標準的な答えです。
• ネイティブ音声(会話付き)。
アクションに同期した環境音、効果音、短いセリフ。プロンプトに音を書き込むとレンダリングされます—スコアリング工程は不要です。
• プロンプト遵守度。
カメラ指示—ドリー、パン、ラックフォーカス—は、単なる着想ではなく、そのまま従われます。ショットリストのプロンプトは、ここでこそ最も効果を発揮します。
• 実績があります。
独立したランキング、本番環境での数か月の使用、既知の障害モード。登場から1週間のフラッグシップがあふれる夏には、退屈なほどの信頼性こそが機能です。
• 8秒の上限。
現在のラインナップで最も短いクリップ — Seedance 2.5は30秒、FLUX 3は20秒に達します。より長い作品には連結とカット計画が必要です。
• コストと速度。
ここでは最高のクレジットコストで、レンダー1回あたり1–3分です。これは仕上げ用モデルで、スケッチ用モデルではありません。
• 最も厳格なフィルター。
公人、子ども、暴力—モデルレベルで拒否されます。ブロックされたジョブではここでクレジットは消費されませんが、多少の言い換えが必要になる場合があります。
• スタイライズされたアニメーション。
アニメ風や手作り風の見た目は妙に光沢が出ます。FLUX 3とSeedanceのほうがスタイライズをうまく処理します。
上のジェネレーターにコピーし、括弧を入れ替え、レンダリングします。
"夜明けの桟橋にいる[風雨にさらされた漁師]のミディアムクローズアップ。カメラの少し先を見ている。彼は言う:'今年は嵐が早く来る。'遠くにカモメ、きしむロープ。曇った光、ドキュメンタリースタイル。"
引用符で囲まれた会話は、顔に同期した音声を生成します。各行は約~10語以内にしてください。ジェネレーターの横にあるデモは、このプロンプトそのものです。
"コンクリートのカウンターに置かれた[マットブラックのエスプレッソマシン]の周りをゆっくり180°周回。蒸気が立ち上る;スチームワンドの低いシューという音と柔らかなカフェの雰囲気が聞こえる。朝の窓明かり、浅い被写界深度、35mm。"
プロンプトに音声を書き込む('聞こえる...')ことがVeo特有の一手です — 価値の半分はその一文にあります。
アップロード: 静止画像
"スマートフォンで撮影したかのような、さりげない手持ちの動き。[subject]は自然に呼吸し、重心を移動する。背景は固定されたまま。静かな室内音、遠くの交通音。"
「スマホで撮影されたかのように」で物理挙動を現実的に固定し、最小限の動きの指示によって画像から動画生成で顔がずれるのを防ぎます。
3つの音声ネイティブモデル。同じプロンプトを3つすべてで使用し、実際に出荷する基準で評価しています—この表はFLUX 3ページの表を反映しているため、どこから見てもデータは一致します。3つすべて上のジェネレーターで選択できます。
よりシャープな物理表現、より長く一貫した動き、より信頼性の高い台詞同期。上のジェネレーター内のバージョン。
'音声付きAI動画'をカテゴリーにしたリリース;バイラルな街頭インタビュークリップはこのバージョンでした。
しっかりした無音動画で、主に研究者向け。音声の飛躍によって、デモからツールへと変わった。
Google DeepMindの動画生成モデル—実写のように見える映像に最も強く、環境音、効果音、短い会話などの音声を映像と同時にネイティブ生成します。テキストから生成するか静止画をアニメーション化でき、最大1080p、1クリップあたり8秒です。
ディレクター。ディレクターモードで最大4Kのマルチショットストーリーテリング。
長回し。あなたのサウンドトラックに合わせて編集された30秒ショット。
スタイリスト。キーフレーム制御と、映画風からストップモーションまでのルック。