Penjana Video AI Kling O3

Model rujukan-dahulu Kuaishou: imej dan klip anda mentakrifkan subjek, MVL mengekalkannya sama dari syot ke syot — dan anda mengedit hasilnya dengan bercakap dengannya. Taip gesaan di bawah dan cubalah.

Model
Imej: 0/1
Muat naik imej bingkai permulaan
(JPG, JPEG, PNG, WEBP, maks. 30 MB)
Gesaan
0/5000
Sampel Video
 

Pembangun

Kuaishou

Jenis

Multimodal berpandukan rujukan (MVL)

Rujukan

Sehingga 7 imej + video

Tempoh

3–15 s setiap klip

Audio

Asli · dialog dalam 5 bahasa

Mengedit

Berbual, di tempat

Tahap di sini

Kredit berbayar (Std / Pro)

Keputusan kami dalam satu baris: pilihan untuk konsistensi dalam kerja bersiri. Apabila subjek yang sama mesti bertahan melalui berpuluh-puluh generasi — dan anda lebih suka membaiki klip daripada menjananya semula — mulakan di sini.

Kling O3 — Video 3.0 Omni, separuh berpandukan rujukan daripada generasi 3.0 Kuaishou — menganggap muat naik anda sebagai sumber kebenaran. Berikan kepadanya sehingga tujuh imej bagi sesuatu subjek, secara pilihan satu klip video, dan seni bina MVL-nya mengekalkan wajah, logo atau prop yang tepat itu stabil sepanjang pergerakan kamera, perubahan adegan dan jujukan berbilang syot; pengulas bebas menyifatkan siri O3 sebagai video AI yang paling boleh dikawal pada awal 2026. Separuh lagi kekuatannya: penyuntingan perbualan — 'buang orang yang lalu-lalang, kekalkan yang lain' — diterapkan pada klip yang sudah siap dan bukannya menjana semula klip tersebut. Satu nota ejaan yang menyebabkan orang pergi ke halaman yang salah: Kling O3 bukan Hailuo 03. Itu ialah MiniMax H3, model daripada syarikat lain.

Pandangan jujur

Di mana Kling O3 menang — dan di mana ia tidak

Dinilai berdasarkan render kami sendiri dan rekod yang diterbitkan, disemak semula apabila fakta berubah — itu ialah ciri halaman ini, bukan penafian.

Benar-benar kuat

  • • Identiti dikunci oleh rujukan.

    Sehingga 7 imej serta video pilihan menentukan subjek; MVL mengekalkan wajah, butiran pakaian, logo dan teks agar stabil sepanjang pergerakan kamera yang kompleks. Penanda aras untuk kerja bersiri.

  • • Penyuntingan video secara perbualan.

    Pembuangan dan penggantian objek, perubahan latar belakang, kesan — digunakan sebagai perintah bahasa semula jadi pada klip yang sudah siap. Membetulkan lebih baik daripada menjana semula.

  • • Koreferensi berbilang watak.

    Beberapa watak rujukan dalam satu adegan, masing-masing mengekalkan identiti sendiri — syot ensembel yang mengelirukan model rujukan tunggal.

  • • Suara daripada rujukan anda.

    Suara tersuai yang diperoleh daripada input video atau imej, dengan dialog asli dalam lima bahasa — jurucakap jenama yang kedengaran sama dalam setiap klip.

Had yang diketahui

  • • Kiraan rujukan pada tahap pertengahan.

    7 imej + video sudah banyak untuk satu subjek, tetapi MiniMax H3 menerima 12 fail dan Seedance 2.5 menerima 50 — produksi kit aset penuh mungkin memerlukan kapasiti kemasukan yang lebih besar.

  • • Perangkap penamaan.

    'Kling O3' dan 'Hailuo 03' ialah model syarikat yang berbeza; O3 vs V3 vs 2.6 mengelirukan walaupun pembeli yang teliti. Semak cip model sebelum anda berbelanja.

  • • Standard 1080p.

    Output standard barisan O3 berada pada HD; 4K bagi keluarga ini tersedia pada varian lain. Ringkasan resolusi pergi ke Kling 3.0 atau MiniMax H3.

  • • Kerja prompt sahaja ialah tugas kembar.

    Tanpa rujukan untuk dijadikan sandaran, kelebihannya mengecil — brief text-to-video semata-mata biasanya menjadi lebih baik pada Kling 3.0 yang mengutamakan prompt.

Resipi prompt

Tiga gesaan yang tunjukkan untuk apa ia digunakan

Salin ke dalam penjana di atas, tukar kurungan, render.

Kunci siri — tujuh rujukan, tiga adegan

Muat naik: 7 foto orang yang sama (sudut, ekspresi, seluruh badan)

"Watak itu berjalan melalui pasar pagi, kemudian muncul di meja pejabat, kemudian di atas bumbung pada waktu matahari terbenam — wajah yang sama, binaan tubuh yang sama, pakaian berubah mengikut setiap adegan. Satu dialog dituturkan dalam setiap adegan. Bunyi persekitaran mengikut lokasi."

Mengapa ia berfungsi

Sudut rujukan yang pelbagai memberikan MVL model subjek yang lebih menyeluruh; membenarkan perubahan pakaian secara jelas ('outfits changing per scene') menghalang model daripada membekukan pakaian bersama-sama dengan wajah. Demo di sebelah penjana ialah prompt ini.

Pembetulan perbualan

Mula dari: klip yang telah anda jana

"Alih keluar orang yang lalu-lalang yang melintas di belakang subjek pada tanda 4 saat. Kekalkan subjek, hanyutan kamera, pencahayaan dan semua audio tepat seperti sedia ada."

Mengapa ia berfungsi

Letakkan cap masa pada sasaran, kemudian lindungi semua yang lain mengikut nama — klausa perlindungan inilah yang memastikan suntingan kekal tepat seperti pembedahan. Inilah aliran kerja yang menjadikan penyempurnaan render 15 saat murah.

Adegan dua watak

Muat naik: rujukan untuk watak A dan watak B

"A dan B bertengkar di seberang meja kafe — A membuat isyarat dengan sudu, B bersandar ke belakang sambil ketawa. Potong antara syot atas bahu. Setiap seorang mengekalkan penampilan rujukan tepat mereka. Desisan mesin espresso, perbualan kafe yang perlahan."

Mengapa ia berfungsi

Menamakan siapa melakukan apa ialah sintaksis koreferensi: model memetakan setiap tindakan kepada identiti rujukan yang betul. Tanpanya, adegan dua watak bertukar wajah di pertengahan syot.

Bersemuka

Kling O3 berbanding MiniMax H3 berbanding Seedance 2.5

Segi tiga kawalan rujukan: tiga model yang semuanya menjanjikan 'subjek anda, dikekalkan konsisten,' dengan saiz input dan falsafah penyuntingan yang berbeza. Prompt yang sama merentas ketiga-tiganya, dinilai berdasarkan perkara yang akan kami keluarkan. Ketiga-tiganya boleh dipilih dalam penjana di atas.

JobKling O3MiniMax H3Seedance 2.5
Pengeditan setempat secara perbualan Terbaik — sintaks perintah Berdasarkan arahan Peringkat wilayah
Koreferensi berbilang watak Ya, penutur asli Sebahagian Sebahagian
Suara diklon daripada rujukan Diperoleh daripada video atau imej Rujukan audio Penyegerakan dipacu trek
Kapasiti rujukan 7 imej + video 12 fail 50 fail
Resolusi maksimum 1080p standard 2K asli Resolusi tinggi melalui pipeline
Panjang klip maks. 15 s 15 s (lanjutkan kepada ~30 s) 30 s asli
Kos setiap klip Sederhana (Std / Pro) Terendah untuk 2K Tertinggi
Sejarah versi

Bagaimana ia sampai di sini

Feb 2026 · Semasa

Kling O3 (Standard + Pro)

pengganti O1 yang membawa audio asli, multi-shot dan penyuntingan perbualan seni bina Omni kepada dua peringkat. Versi dalam penjana di atas.

Dis 2025

Kling O1

Pertaruhan Kuaishou terhadap 'multimodal bersatu yang pertama dalam industri': penjanaan rujukan, in-painting, pemindahan gaya dan pelanjutan syot digabungkan dalam satu enjin. O3 ialah idea ini, yang telah matang.

Asal

Era Kling 1.x–2.x

model dipacu prompt yang menjadikan Kling nama global, sebelum keluarga itu berpecah kepada barisan V3 yang dipimpin prompt dan O3 yang dipimpin rujukan.

Soalan Lazim

Soalan tentang Kling O3, dijawab secara terus

1. Apakah Kling O3 — dan adakah ia sama dengan Kling 3.0?

Generasi yang sama, falsafah yang berbeza. Kling O3 (Video 3.0 Omni) mengutamakan rujukan: imej dan video anda mentakrifkan subjek, dan seni bina MVL memastikan identiti itu kekal terkunci merentas syot. Kling 3.0 (V3) ialah karya sinematik yang mengutamakan prompt. Ringkasan berpandukan rujukan di sini, ringkasan berpandukan prompt di halaman Kling 3.0.