Kuaishouのリファレンスファーストモデル:画像やクリップが被写体を定義し、MVLがショットごとに同一性を保ちます——さらに、結果は話しかけるだけで編集できます。下にプロンプトを入力して試してみてください。
開発者
Kuaishou
タイプ
参照主導型マルチモーダル (MVL)
参考文献
最大7枚の画像+動画
期間
クリップあたり3–15秒
オーディオ
ネイティブ·5言語での対話
編集中
会話形式、その場で
ここにティア
有料クレジット(Std / Pro)
私たちの一行評価: シリーズ制作で一貫性を重視するならこれ。同じ被写体を何十世代も維持する必要があり—クリップを再生成するより修正したいなら—ここから始めましょう。
Kling O3—Video 3.0 Omni、Kuaishouの3.0世代における参照主導型の一翼は、アップロードした素材をグラウンドトゥルースとして扱います。被写体の画像を最大7枚、必要に応じて動画クリップも入力すると、そのMVLアーキテクチャが、カメラワーク、シーン変更、複数ショットのシーケンスを通じて、まったく同じ顔、ロゴ、小道具を安定して維持します。独立系レビュアーは、O3シリーズを2026年初頭で最も制御しやすいAI動画と評しました。もう一つの強みは、会話型編集—'通行人を削除して、他はすべてそのままにして'—を、作り直すのではなく完成済みのクリップに適用できることです。人々を間違ったページへ誘導してしまう表記上の注意点が一つあります。Kling O3はHailuo 03ではありません。それはMiniMax H3で、別会社のモデルです。
当社独自のレンダーと公開記録に基づいて判断し、事実の変化に応じて改訂されます — これはこのページの特徴であり、免責事項ではありません。
• 参照ロックされたアイデンティティ。
最大7枚の画像と任意の動画で被写体を定義;MVLは複雑なカメラワークでも顔、衣服のディテール、ロゴ、テキストを安定して保ちます。シリーズ制作のベンチマーク。
• 会話型動画編集。
オブジェクトの削除と置換、背景変更、エフェクト—完成したクリップに対して自然言語コマンドとして実行。修正は再生成に勝る。
• 複数キャラクターの共参照。
1つのシーンに複数の参照キャラクターが登場し、それぞれが独自のアイデンティティを保つ — 単一参照モデルが混乱するアンサンブルショット。
• あなたのリファレンスからの音声。
動画または画像入力から生成されたカスタム音声、5言語のネイティブな対話に対応 — どのクリップでも同じ声に聞こえるブランドスポークスパーソン。
• 参照数は中位です。
1つの被写体には7枚の画像+動画で十分ですが、MiniMax H3は12ファイル、Seedance 2.5は50ファイルを取り込めます — フルのアセットキット制作では、より大きな取り込み容量が必要になる場合があります。
• ネーミングの罠。
'Kling O3'と'Hailuo 03'は異なる企業のモデルです; O3、V3、2.6は慎重な購入者でさえ混乱させます。購入前にモデルチップを確認してください。
• 1080p標準。
O3ラインの標準出力はHDです;このファミリーの4Kは他のバリアントで提供されています。解像度のブリーフはKling 3.0またはMiniMax H3へ送ってください。
• プロンプトのみの作業はツインの仕事です。
アンカーとなる参照がない場合、その優位性は薄れます—純粋なテキストから動画へのブリーフは、通常、プロンプト重視のKling 3.0のほうがうまく仕上がります。
上のジェネレーターにコピーし、括弧を入れ替えて、レンダリングします。
アップロード: 同じ人物の7枚の写真(アングル、表情、全身)
"キャラクターが朝の市場を歩き、その後オフィスのデスクに現れ、次に夕暮れの屋上にいる—同じ顔、同じ体格で、衣装はシーンごとに変わる。各シーンにセリフが1つ。場所ごとの環境音。"
さまざまな参照角度により、MVLは被写体の丸みのあるモデルを得られます; 衣装変更('outfits changing per scene')を明示的に許可することで、モデルが顔と一緒に服装まで固定してしまうのを防ぎます。ジェネレーターの横にあるデモはこのプロンプトです。
開始位置: すでに生成したクリップ
"4秒時点で被写体の後ろを横切る通行人を削除してください。被写体、カメラのドリフト、照明、すべての音声はそのまま正確に維持してください。"
対象にタイムスタンプを付けてから、それ以外をすべて名前で保護します — 保護句があるからこそ、編集を外科手術のように精密に保てます。これが、15秒のレンダリングを低コストで完璧に仕上げられるワークフローです。
アップロード: キャラクターAとキャラクターBの参考資料
"AとBがカフェのテーブル越しに言い争う—Aはスプーンで身ぶりをし、Bは笑いながら後ろにもたれる。肩越しショットを交互にカット。2人とも正確な参照外観を保つ。エスプレッソマシンのシューという音、低いカフェのざわめき。"
誰が何をするかを明示することは共参照構文です:モデルは各アクションを正しく参照されたアイデンティティに対応付けます。これがないと、2人のシーンではショットの途中で顔が入れ替わります。
リファレンス制御の三角形: 3つのモデルはいずれも'あなたの被写体を一貫して保つ,'ことを約束し、取り込みサイズと編集方針が異なります。同じプロンプトを3つすべてで使用し、実際に出荷する品質で判断しました。上のジェネレーターですべて選択できます。
O1の後継で、Omniアーキテクチャのネイティブ音声、マルチショット、会話型編集を2つのティアにもたらします。上記のジェネレーター内のバージョン。
Kuaishouの'業界初の統合マルチモーダル'への賭け: 参照生成、インペインティング、スタイル転送、ショット拡張を1つのエンジンに融合。O3はこのアイデアが成熟したものです。
Klingを世界的な名前にしたプロンプト駆動型モデルで、その後このファミリーはプロンプト主導のV3ラインと参照主導のO3ラインに分かれました。
同じ世代、異なる思想。Kling O3 (Video 3.0 Omni)はリファレンスファーストです。画像と動画が被写体を定義し、MVLアーキテクチャがそのアイデンティティをショット間で固定します。Kling 3.0 (V3)はプロンプトファーストのシネマティック制作向けです。リファレンス主導のブリーフはこちら、プロンプト主導のブリーフはKling 3.0ページで。