Kling O3 AI 비디오 생성기

Kuaishou의 레퍼런스 우선 모델: 이미지와 클립이 피사체를 정의하고, MVL은 샷마다 이를 동일하게 유지합니다 — 그리고 결과는 대화하듯 수정할 수 있습니다. 아래에 프롬프트를 입력하고 사용해 보세요.

모델
이미지: 0/1
시작 프레임 이미지 업로드
(JPG, JPEG, PNG, WEBP, 최대 30MB)
프롬프트
0/5000
동영상 샘플
 

개발자

Kuaishou

유형

참조 기반 멀티모달 (MVL)

참고 자료

최대 7개 이미지 + 동영상

기간

클립당 3–15초

오디오

네이티브 · 5개 언어로 대화

편집 중

대화형, 제자리에서

여기에 등급

유료 크레딧 (Std / Pro)

한 줄 평결: 시리즈 작업에서 일관성을 위한 선택. 동일한 피사체가 수십 번의 생성에서도 유지되어야 하고 — 클립을 다시 생성하기보다 수정하고 싶다면 — 여기에서 시작하세요.

Kling O3 — Kuaishou 3.0 세대의 레퍼런스 기반 축인 Video 3.0 Omni — 는 업로드한 자료를 기준 사실로 간주합니다. 피사체의 이미지를 최대 7장, 선택적으로 동영상 클립까지 입력하면 MVL 아키텍처가 카메라 이동, 장면 전환, 멀티샷 시퀀스 전반에서 정확히 그 얼굴, 로고 또는 소품을 안정적으로 유지합니다. 독립 리뷰어들은 O3 시리즈를 2026년 초 가장 제어하기 쉬운 AI 동영상으로 평가했습니다. 또 다른 핵심은 대화형 편집입니다 — '지나가는 사람은 제거하고, 나머지는 모두 유지해 줘' — 완성된 클립을 다시 생성하지 않고 그대로 적용합니다. 사람들을 잘못된 페이지로 보내는 표기 관련 참고 사항: Kling O3는 Hailuo 03이 아닙니다. 그것은 다른 회사의 모델인 MiniMax H3입니다.

솔직한 평가

Kling O3가 앞서는 부분 — 그리고 그렇지 않은 부분

자체 렌더링과 공개된 기록을 바탕으로 판단하고, 사실이 변함에 따라 수정됩니다 — 이는 이 페이지의 특징이지 면책 조항이 아닙니다.

진정으로 강력함

  • • 참조로 잠긴 ID.

    최대 7개의 이미지와 선택적 동영상으로 피사체를 정의합니다; MVL은 복잡한 카메라 움직임에서도 얼굴, 의상 디테일, 로고 및 텍스트를 안정적으로 유지합니다. 시리즈 작업의 벤치마크.

  • • 대화형 동영상 편집.

    객체 제거 및 교체, 배경 변경, 효과 — 완성된 클립에 자연어 명령으로 적용됩니다. 다시 생성하는 것보다 수정하는 것이 낫습니다.

  • • 다중 캐릭터 공지시.

    하나의 장면에 여러 참조 캐릭터가 등장하고, 각자 고유한 정체성을 유지합니다 — 단일 참조 모델이 혼란스러워하는 앙상블 샷.

  • • 참조 자료에서 생성된 음성.

    동영상 또는 이미지 입력에서 파생된 맞춤형 음성, 5개 언어의 네이티브 대화 지원 — 모든 클립에서 동일하게 들리는 브랜드 대변인.

알려진 제한

  • • 참조 수는 중간 수준입니다.

    한 피사체에는 7개 이미지 + 비디오로 충분하지만, MiniMax H3는 12개 파일을 받고 Seedance 2.5는 50개를 받습니다 — 전체 에셋 키트 제작에는 더 큰 입력 용량이 필요할 수 있습니다.

  • • 이름 짓기의 함정.

    'Kling O3'와 'Hailuo 03'는 서로 다른 회사의 모델입니다; O3 vs V3 vs 2.6은 신중한 구매자도 혼란스럽게 합니다. 지출하기 전에 모델 칩을 확인하세요.

  • • 1080p 표준.

    O3 라인의 표준 출력은 HD입니다. 이 제품군의 4K는 다른 변형에서 제공됩니다. 해상도 브리프는 Kling 3.0 또는 MiniMax H3로 보내세요.

  • • 프롬프트만으로 하는 작업은 트윈의 일입니다.

    기준으로 삼을 레퍼런스가 없으면 그 장점은 줄어듭니다 — 순수 텍스트-투-비디오 브리프는 보통 프롬프트 우선의 Kling 3.0에서 더 잘 나옵니다.

프롬프트 레시피

세 가지 프롬프트가 무엇을 위한 것인지 표시

위의 생성기에 복사하고, 괄호를 바꾼 다음, 렌더링하세요.

시리즈 잠금 — 7개의 참조, 3개의 장면

업로드: 동일 인물 사진 7장 (각도, 표정, 전신)

"캐릭터가 아침 시장을 걸어 지나간 다음 사무실 책상에 나타나고, 이어서 해질녘 옥상에 등장합니다 — 같은 얼굴, 같은 체격, 의상은 장면마다 바뀝니다. 각 장면에 대사 한 줄. 장소별 주변 소리."

작동하는 이유

다양한 참조 각도는 MVL에 피사체의 균형 잡힌 모델을 제공합니다; 의상 변경('outfits changing per scene')을 명시적으로 허용하면 모델이 얼굴과 함께 의상까지 고정해 버리는 것을 막을 수 있습니다. 생성기 옆의 데모는 이 프롬프트입니다.

대화형 수정

시작 위치: 이미 생성한 클립

"4초 지점에서 피사체 뒤를 지나가는 행인을 제거하세요. 피사체, 카메라 드리프트, 조명 및 모든 오디오는 정확히 그대로 유지하세요."

작동하는 이유

대상에 타임스탬프를 찍은 다음, 그 외 모든 것을 이름으로 보호하세요 — 편집을 수술처럼 정밀하게 유지해 주는 것이 바로 보호 절입니다. 이것이 15초 렌더를 저렴하게 완벽하게 다듬을 수 있게 해 주는 워크플로입니다.

두 등장인물 장면

업로드: 캐릭터 A와 캐릭터 B에 대한 참고 자료

"A와 B가 카페 테이블을 사이에 두고 말다툼을 한다 — A는 숟가락으로 손짓하고, B는 웃으며 뒤로 기댄다. 오버숄더 샷 사이를 컷 전환. 각자는 정확한 참조 외형을 유지한다. 에스프레소 머신의 쉭쉭거리는 소리, 낮은 카페 잡담 소리."

작동하는 이유

누가 무엇을 하는지 명시하는 것은 상호참조 구문입니다: 모델은 각 동작을 올바르게 참조된 정체성에 매핑합니다. 이것이 없으면 두 인물 장면에서 촬영 중간에 얼굴이 바뀝니다.

맞대결

Kling O3 대 MiniMax H3 대 Seedance 2.5

레퍼런스 제어 삼각형: 세 모델 모두 '당신의 피사체를 일관되게 유지,'를 약속하지만, 입력 크기와 편집 철학은 서로 다릅니다. 세 모델 모두에 동일한 프롬프트를 사용하고, 우리가 실제로 출시할 기준으로 평가했습니다. 위의 생성기에서 세 모델 모두 선택할 수 있습니다.

JobKling O3MiniMax H3Seedance 2.5
대화형 인플레이스 편집 최적 — 명령 구문 지침 기반 지역 수준
다중 캐릭터 상호참조 예, 원어민 부분 부분
참조 자료에서 복제된 음성 동영상 또는 이미지에서 파생됨 오디오 참조 트랙 기반 동기화
참조 용량 이미지 7개 + 동영상 파일 12개 파일 50개
최대 해상도 1080p 표준 네이티브2K 파이프라인을 통한 고해상도
최대 클립 길이 15초 15초(~30초로 연장) 30초 네이티브
클립당 비용 중간 (Std / Pro) 2K용 최저 최고
버전 기록

여기에 오게 된 경위

2026년 2월 · 현재

Kling O3 (스탠다드 + Pro)

O1의 후속 모델로, Omni 아키텍처의 네이티브 오디오, 멀티샷 및 대화형 편집을 두 가지 티어로 제공합니다. 위 생성기에 있는 버전입니다.

2025년 12월

Kling O1

Kuaishou의 '업계 최초 통합 멀티모달' 베팅: 레퍼런스 생성, 인페인팅, 스타일 전송, 샷 확장을 하나의 엔진에 융합. O3는 이 아이디어가 성숙한 형태입니다.

출처

Kling 1.x–2.x 시대

Kling을 세계적인 이름으로 만든 프롬프트 기반 모델들로, 이후 이 제품군은 프롬프트 주도 V3 라인과 레퍼런스 주도 O3 라인으로 나뉘었습니다.

자주 묻는 질문

Kling O3 질문, 명확한 답변

1. Kling O3란 무엇이며 — Kling 3.0과 같은 것인가요?

같은 세대, 다른 철학. Kling O3 (Video 3.0 Omni)는 레퍼런스 우선 방식입니다. 이미지와 동영상이 피사체를 정의하고, MVL 아키텍처가 샷 전반에서 그 정체성을 고정해 유지합니다. Kling 3.0 (V3)는 프롬프트 우선의 시네마틱 작업을 위한 것입니다. 여기서는 레퍼런스 기반 브리프를, Kling 3.0 페이지에서는 프롬프트 기반 브리프를 사용하세요.