Google DeepMind的真實感基準:足以以假亂真的影片,環境音和口語對話在同一輪生成中生成。在下方輸入提示詞並試試看。
開發者
Google DeepMind
類型
文字 / 圖像轉影片
音訊
原生,含對話
時長
每個片段8秒
最大輸出
1080p
渲染時間
1–3分鐘
等級在此
付費額度
我們的一句話結論: 當剪輯必須像實拍素材一樣過關時,請在Veo上渲染。仍在探索時,先在快速等級上打草稿。
Veo是新進者用來衡量自己的標竿模型。今年夏天發布的每一款旗艦——Seedance 2.5、MiniMax H3、Wan 3.0、FLUX 3——都把Veo放進了自己的比較圖表,因為它具備最難偽造的兩樣東西:經得起檢視的物理真實感,以及比發布週更長的實績記錄。它的原生音訊仍然能做到大多數競爭對手做不到的事:提示詞中一行帶引號的對白會以語音形式返回,並與臉部同步。
根據我們自己的渲染圖和已發布紀錄作出判斷,並隨著事實變化而修訂——這是此頁面的一項特性,不是免責聲明。
• 物理真實感。
光線會反射,布料會自然垂墜,液體會像液體一樣傾倒。在我們託管的所有內容中「AI痕跡」最少,也是客戶會仔細查看時的預設答案。
• 帶對話的原生音訊。
與動作同步的環境音、音效和簡短台詞。將聲音寫入提示詞即可渲染—無需配樂流程。
• 提示詞遵循度。
攝影機指令——推軌、搖攝、焦點轉移——會被遵循,而不只是作為靈感。分鏡表提示詞在這裡比任何地方都更能發揮作用。
• 久經驗證的良好記錄。
獨立排名、數月的生產環境使用、已知故障模式。在一個滿是問世僅一週的旗艦的夏天,乏味的可靠性就是一項功能。
• 8秒上限。
我們目前陣容中最短的片段——Seedance 2.5可達30秒,FLUX 3為20秒。更長的作品意味著需要串接和規劃剪輯。
• 成本和速度。
這裡的點數成本最高,每次渲染需要1–3分鐘。它是精修模型,不是草圖模型。
• 最嚴格的篩選條件。
公眾人物、兒童、暴力—會在模型層級被拒絕。被封鎖的任務在這裡不會消耗點數,但可能需要重新措辭。
• 風格化動畫。
動漫和手工風格的效果會顯得異常光亮。FLUX 3和Seedance在風格化處理上更好。
複製到上方的生成器中,替換括號,渲染。
"黎明時分碼頭上一位[飽經風霜的漁夫]的中近景,目光越過鏡頭旁邊。他說:'今年暴風雨來得早。'遠處有海鷗,繩索嘎吱作響。陰天光線,紀錄片風格。"
帶引號的對白會生成與臉部同步的語音。每行保持在約~10個詞以內。生成器旁邊的示範就是這條確切的提示詞。
"在混凝土檯面上,圍繞一台[霧面黑色義式咖啡機]緩慢180°環繞。蒸汽升起;我們聽見蒸汽棒低沉的嘶嘶聲和柔和的咖啡館氛圍聲。清晨窗光,淺景深,35mm。"
把音訊寫進提示詞('我們聽到...')是Veo特有的做法 — 一半的價值就在那句話裡。
上傳: 靜態影像
"細微的手持移動,彷彿用手機拍攝。[subject]自然呼吸並轉移重心;背景保持固定。安靜的房間氛圍聲,遠處的交通聲。"
「彷彿用手機拍攝」能讓物理效果更真實,而最少的動作指令可防止在圖生影片中人臉漂移。
三個音訊原生模型。三個模型使用相同提示詞,並以我們會交付的標準進行評判—此表與FLUX 3頁面上的表一致,因此無論你在哪裡查看,資料都相符。上方生成器中三個都可選擇。
更清晰的物理效果、更長的連貫動作、更可靠的對白同步。上方產生器中的版本。
讓'有聲AI影片'成為一個類別的版本;爆紅的街頭訪談片段就是這個版本。
紮實的無聲影片,主要面向研究。音訊的飛躍讓它從示範變成了工具。
Google DeepMind的影片生成模型——最擅長生成看起來真實的影像,並隨畫面原生生成音訊:環境聲、音效和簡短對話。可根據文字生成,或將靜態圖片製成動畫,最高1080p,每個片段8秒。
導演。使用導演模式進行最高4K的多鏡頭敘事。
長鏡頭。依照你的配樂剪輯的30秒鏡頭。
造型師。關鍵影格控制和從電影感到定格動畫的外觀。