Google DeepMind의 현실감 벤치마크: 실제처럼 보이는 영상에 주변 소리와 음성 대화가 동일한 패스에서 생성됩니다. 아래에 프롬프트를 입력하고 사용해 보세요.
개발자
Google DeepMind
유형
텍스트 / 이미지를 동영상으로
오디오
네이티브, 대화 포함
기간
클립당 8초
최대 출력
1080p
렌더링 시간
1–3분
여기에 등급
유료 크레딧
한 줄로 내린 우리의 평가: 클립이 실제 영상처럼 보여야 할 때는 Veo에서 렌더링하세요. 아직 탐색 중일 때는 먼저 빠른 티어에서 초안을 만드세요.
Veo는 신참들이 기준으로 삼아 평가받는 모델입니다. 올여름 출시된 모든 플래그십 — Seedance 2.5, MiniMax H3, Wan 3.0, FLUX 3 — 은 비교 차트에 Veo를 넣었습니다. 가장 속이기 어려운 두 가지를 갖추고 있기 때문입니다: 면밀한 검토를 견디는 물리적 사실감, 그리고 출시 첫 주보다 더 긴 실적 기록입니다. Veo의 네이티브 오디오는 여전히 대부분의 경쟁자가 못 하는 일을 해냅니다: 프롬프트에 인용된 대사 한 줄이 얼굴과 동기화되어 말로 출력됩니다.
당사의 자체 렌더링과 공개된 기록을 바탕으로 판단하고, 사실이 변함에 따라 수정됩니다 — 이는 이 페이지의 기능이지, 면책 고지가 아닙니다.
• 물리적 사실감.
빛은 반사되고, 천은 자연스럽게 드리워지며, 액체는 액체처럼 흘러내립니다. 저희가 호스팅하는 것 중 ‘AI 티’가 가장 적고, 클라이언트가 자세히 살펴볼 때의 기본 답변입니다.
• 대화가 포함된 원어민 음성.
액션에 동기화된 분위기, 효과음, 짧은 대사. 프롬프트에 사운드를 작성하면 렌더링됩니다 — 스코어링 단계가 없습니다.
• 프롬프트 준수도.
카메라 지시 — 돌리, 패닝, 랙 포커스 —는 단순한 영감에 그치지 않고 그대로 반영됩니다. 샷 리스트 프롬프트는 여기에서 그 어느 곳보다 빛을 발합니다.
• 검증된 실적.
독립적인 순위, 수개월간의 프로덕션 사용, 알려진 실패 모드. 출시된 지 일주일 된 플래그십들이 넘치는 여름에는 지루할 만큼의 안정성이 하나의 기능입니다.
• 8초 제한.
현재 라인업에서 가장 짧은 클립 — Seedance 2.5는 30초, FLUX 3는 20초에 도달합니다. 더 긴 작품은 연결과 컷 계획이 필요합니다.
• 비용 및 속도.
여기에서 가장 높은 크레딧 비용으로 렌더링당 1–3분이 걸립니다. 스케치 모델이 아니라 마무리용 모델입니다.
• 가장 엄격한 필터.
공인, 아동, 폭력 — 모델 수준에서 거부됩니다. 차단된 작업은 여기서 크레딧을 소모하지 않지만, 일부 문구를 수정해야 할 수 있습니다.
• 양식화된 애니메이션.
애니메이션 및 수작업 느낌은 이상하게 광택이 나게 나옵니다. FLUX 3와 Seedance가 스타일화를 더 잘 처리합니다.
위의 생성기에 복사하고, 괄호를 바꾼 다음, 렌더링하세요.
"새벽 부두 위 [풍파에 찌든 어부]의 미디엄 클로즈업, 카메라를 살짝 빗겨 바라본다. 그가 말한다: '올해는 폭풍이 일찍 오겠어.' 멀리 갈매기들, 삐걱거리는 밧줄. 흐린 빛, 다큐멘터리 스타일."
따옴표로 묶인 대화는 얼굴과 동기화된 음성 오디오를 생성합니다. 각 줄은 ~10단어 미만으로 유지하세요. 생성기 옆의 데모는 바로 이 프롬프트입니다.
"콘크리트 카운터 위의 [무광 블랙 에스프레소 머신] 주위를 천천히 180° 궤도 촬영. 증기가 피어오른다; 스팀 완드의 낮은 쉭쉭거림과 부드러운 카페 분위기가 들린다. 아침 창가 빛, 얕은 피사계 심도, 35mm."
프롬프트에 오디오를 써넣는 것('들립니다...')은 Veo에 특화된 한 수입니다 — 가치의 절반은 그 문장에 있습니다.
업로드: 정지 이미지
"휴대폰으로 촬영한 듯한 미묘한 핸드헬드 움직임. [subject]가 자연스럽게 숨을 쉬고 체중을 옮긴다; 배경은 고정된 상태로 유지된다. 조용한 실내 앰비언스, 멀리서 들리는 교통 소음."
"휴대폰으로 촬영한 것처럼"은 물리 효과를 현실감 있게 잡아 주며, 최소한의 움직임 지시는 이미지-투-비디오에서 얼굴이 흐트러지는 것을 방지합니다.
세 가지 오디오 네이티브 모델. 세 가지 모두에 동일한 프롬프트를 사용하고, 실제로 출시할 기준으로 평가했습니다 — 이 표는 FLUX 3 페이지의 표를 반영하므로 어디에서 보든 데이터가 일치합니다. 위 생성기에서 세 가지 모두 선택할 수 있습니다.
더 선명한 물리 효과, 더 길고 일관된 움직임, 더 안정적인 대화 동기화. 위 생성기에 있는 버전.
'사운드가 있는 AI 동영상'을 하나의 카테고리로 만든 릴리스; 바이럴 거리 인터뷰 클립들은 이 버전이었습니다.
탄탄한 무음 영상, 대체로 연구자 대상. 오디오의 도약이 이를 데모에서 도구로 바꿔 놓았습니다.
Google DeepMind의 동영상 생성 모델 — 실제처럼 보이는 영상에 가장 강력하며, 화면과 함께 네이티브로 생성되는 오디오를 제공합니다: 주변음, 효과음, 짧은 대화. 텍스트로 생성하거나 정지 이미지를 애니메이션화하며, 최대 1080p, 클립당 8초까지 지원합니다.
감독. 감독 모드로 최대 4K의 멀티샷 스토리텔링.
롱테이크. 사운드트랙에 맞춰 편집된 30초 샷.
스타일리스트. 키프레임 제어와 시네마틱부터 스톱 모션까지의 룩.