Kling O3 AI動画生成ツール

Kuaishouのリファレンスファーストモデル:画像やクリップが被写体を定義し、MVLがショットごとに同一性を保ちます——さらに、結果は話しかけるだけで編集できます。下にプロンプトを入力して試してみてください。

モデル
画像: 0/1
開始フレーム画像をアップロード
(JPG,JPEG,PNG,WEBP,最大30MB)
プロンプト
0/5000
動画サンプル
 

開発者

Kuaishou

タイプ

参照主導型マルチモーダル (MVL)

参考文献

最大7枚の画像+動画

期間

クリップあたり3–15秒

オーディオ

ネイティブ·5言語での対話

編集中

会話形式、その場で

ここにティア

有料クレジット(Std / Pro)

私たちの一行評価: シリーズ制作で一貫性を重視するならこれ。同じ被写体を何十世代も維持する必要があり—クリップを再生成するより修正したいなら—ここから始めましょう。

Kling O3—Video 3.0 Omni、Kuaishouの3.0世代における参照主導型の一翼は、アップロードした素材をグラウンドトゥルースとして扱います。被写体の画像を最大7枚、必要に応じて動画クリップも入力すると、そのMVLアーキテクチャが、カメラワーク、シーン変更、複数ショットのシーケンスを通じて、まったく同じ顔、ロゴ、小道具を安定して維持します。独立系レビュアーは、O3シリーズを2026年初頭で最も制御しやすいAI動画と評しました。もう一つの強みは、会話型編集—'通行人を削除して、他はすべてそのままにして'—を、作り直すのではなく完成済みのクリップに適用できることです。人々を間違ったページへ誘導してしまう表記上の注意点が一つあります。Kling O3はHailuo 03ではありません。それはMiniMax H3で、別会社のモデルです。

率直な意見

Kling O3が優れているところ — そしてそうでないところ

当社独自のレンダーと公開記録に基づいて判断し、事実の変化に応じて改訂されます — これはこのページの特徴であり、免責事項ではありません。

本当に強い

  • • 参照ロックされたアイデンティティ。

    最大7枚の画像と任意の動画で被写体を定義;MVLは複雑なカメラワークでも顔、衣服のディテール、ロゴ、テキストを安定して保ちます。シリーズ制作のベンチマーク。

  • • 会話型動画編集。

    オブジェクトの削除と置換、背景変更、エフェクト—完成したクリップに対して自然言語コマンドとして実行。修正は再生成に勝る。

  • • 複数キャラクターの共参照。

    1つのシーンに複数の参照キャラクターが登場し、それぞれが独自のアイデンティティを保つ — 単一参照モデルが混乱するアンサンブルショット。

  • • あなたのリファレンスからの音声。

    動画または画像入力から生成されたカスタム音声、5言語のネイティブな対話に対応 — どのクリップでも同じ声に聞こえるブランドスポークスパーソン。

既知の制限

  • • 参照数は中位です。

    1つの被写体には7枚の画像+動画で十分ですが、MiniMax H3は12ファイル、Seedance 2.5は50ファイルを取り込めます — フルのアセットキット制作では、より大きな取り込み容量が必要になる場合があります。

  • • ネーミングの罠。

    'Kling O3'と'Hailuo 03'は異なる企業のモデルです; O3、V3、2.6は慎重な購入者でさえ混乱させます。購入前にモデルチップを確認してください。

  • • 1080p標準。

    O3ラインの標準出力はHDです;このファミリーの4Kは他のバリアントで提供されています。解像度のブリーフはKling 3.0またはMiniMax H3へ送ってください。

  • • プロンプトのみの作業はツインの仕事です。

    アンカーとなる参照がない場合、その優位性は薄れます—純粋なテキストから動画へのブリーフは、通常、プロンプト重視のKling 3.0のほうがうまく仕上がります。

プロンプトレシピ

3つのプロンプトが 何のためかを表示

上のジェネレーターにコピーし、括弧を入れ替えて、レンダリングします。

シリーズロック — 7つの参照、3つのシーン

アップロード: 同じ人物の7枚の写真(アングル、表情、全身)

"キャラクターが朝の市場を歩き、その後オフィスのデスクに現れ、次に夕暮れの屋上にいる—同じ顔、同じ体格で、衣装はシーンごとに変わる。各シーンにセリフが1つ。場所ごとの環境音。"

なぜ効果があるのか

さまざまな参照角度により、MVLは被写体の丸みのあるモデルを得られます; 衣装変更('outfits changing per scene')を明示的に許可することで、モデルが顔と一緒に服装まで固定してしまうのを防ぎます。ジェネレーターの横にあるデモはこのプロンプトです。

会話型の修正

開始位置: すでに生成したクリップ

"4秒時点で被写体の後ろを横切る通行人を削除してください。被写体、カメラのドリフト、照明、すべての音声はそのまま正確に維持してください。"

なぜ効果があるのか

対象にタイムスタンプを付けてから、それ以外をすべて名前で保護します — 保護句があるからこそ、編集を外科手術のように精密に保てます。これが、15秒のレンダリングを低コストで完璧に仕上げられるワークフローです。

二人の登場人物のシーン

アップロード: キャラクターAとキャラクターBの参考資料

"AとBがカフェのテーブル越しに言い争う—Aはスプーンで身ぶりをし、Bは笑いながら後ろにもたれる。肩越しショットを交互にカット。2人とも正確な参照外観を保つ。エスプレッソマシンのシューという音、低いカフェのざわめき。"

なぜ効果があるのか

誰が何をするかを明示することは共参照構文です:モデルは各アクションを正しく参照されたアイデンティティに対応付けます。これがないと、2人のシーンではショットの途中で顔が入れ替わります。

直接対決

Kling O3対MiniMax H3対Seedance 2.5

リファレンス制御の三角形: 3つのモデルはいずれも'あなたの被写体を一貫して保つ,'ことを約束し、取り込みサイズと編集方針が異なります。同じプロンプトを3つすべてで使用し、実際に出荷する品質で判断しました。上のジェネレーターですべて選択できます。

JobKling O3MiniMax H3Seedance 2.5
会話型のインプレース編集 最適 — コマンド構文 指示ベース リージョンレベル
複数キャラクターの共参照 はい、ネイティブ 部分的 一部
参照音声から複製された音声 動画または画像由来 音声リファレンス トラック駆動同期
参照容量 7枚の画像 + 動画 12個のファイル 50ファイル
最大解像度 1080p標準 ネイティブ2K パイプライン経由の高解像度
最大クリップ長 15秒 15秒(約30秒に延長) 30秒ネイティブ
クリップあたりのコスト 中(Std / Pro) 2Kで最低 最高
バージョン履歴

ここに来た経緯

2026年2月・現在

Kling O3 (標準 + Pro)

O1の後継で、Omniアーキテクチャのネイティブ音声、マルチショット、会話型編集を2つのティアにもたらします。上記のジェネレーター内のバージョン。

2025年12月

Kling O1

Kuaishouの'業界初の統合マルチモーダル'への賭け: 参照生成、インペインティング、スタイル転送、ショット拡張を1つのエンジンに融合。O3はこのアイデアが成熟したものです。

オリジン

Kling 1.x–2.x時代

Klingを世界的な名前にしたプロンプト駆動型モデルで、その後このファミリーはプロンプト主導のV3ラインと参照主導のO3ラインに分かれました。

よくある質問

Kling O3の質問に率直に回答

1. Kling O3とは何ですか—Kling 3.0と同じものですか?

同じ世代、異なる思想。Kling O3 (Video 3.0 Omni)はリファレンスファーストです。画像と動画が被写体を定義し、MVLアーキテクチャがそのアイデンティティをショット間で固定します。Kling 3.0 (V3)はプロンプトファーストのシネマティック制作向けです。リファレンス主導のブリーフはこちら、プロンプト主導のブリーフはKling 3.0ページで。