Model all-in-one baru dari Alibaba: klip native 30 detik dari prompt, gambar — atau PDF, slide deck, atau spreadsheet. Satu-satunya model di sini yang membaca dokumen. Ketik prompt di bawah dan coba, tanpa daftar tunggu.
Pengembang
Laboratorium Alibaba Tongyi
Jenis
Semua dalam satu: buat + referensi + edit
Durasi
2–30 dtk sekali proses
Output maks
1080p
Input dokumen
pdf / ppt / xls / URL
Buka bobot
Dijanjikan (Apache 2.0)
Tingkat di sini
Kredit berbayar
Kesimpulan kami dalam satu baris: pemilihan dokumen. Ketika materi sumber berupa deck presentasi, manual, atau spreadsheet, tidak ada yang lain yang bahkan bisa membacanya.
Wan 3.0 masuk ke beta publik pada 6 Agustus, dan keunggulan paling tajamnya bukanlah single take 30 detik — Seedance sudah mencapainya lebih dulu — melainkan apa yang diterimanya sebagai input. Berikan manual PDF, pitch deck, atau spreadsheet kuartalan, lalu ia membangun video dari kontennya, menjaga karakter, properti, dan tata letak tetap konsisten dengan sumbernya. Alibaba juga menggabungkan apa yang sebelumnya merupakan empat model Wan terpisah menjadi satu, sehingga pembuatan, referensi, dan pengeditan tidak lagi berarti beralih model di tengah pipeline.
Beta publik baru berusia beberapa hari, jadi ini adalah kesan pertama dari render uji kami serta dokumentasi yang diterbitkan Alibaba — ditandai sebagaimana mestinya. Kami akan merevisinya saat angka independen tersedia.
• Dokumen ke video.
Membaca doc, xls, ppt, pdf dan format serupa hingga 100 MB atau 50 halaman, serta halaman web melalui URL, lalu menghasilkan video dari kontennya. Video pelatihan dari manual, demo dari deck — tidak ada model lain yang kami hosting yang bisa melakukan ini sama sekali.
• Pengambilan gambar tunggal 30 detik.
Satu pembuatan native dari 2 hingga 30 detik, dua kali lipat dari batas Wan sebelumnya, dengan fitur durasi cerdas yang menyarankan panjang yang tepat untuk prompt Anda.
• Alur kerja all-in-one.
Wan 2.7 memisahkan text-to-video, image-to-video, referensi, dan pengeditan ke dalam empat model. Wan 3.0 menggabungkannya — satu ID model, tanpa beralih pipeline, referensi dan editan di tempat yang sama.
• Fidelitas referensi.
Karakter, properti, suara, tata letak spasial, dan gaya tetap konsisten dengan input Anda — kerangka Alibaba adalah “dari menghasilkan satu frame hingga menceritakan sebuah kisah utuh,” dan pengujian awal kami mendukung klaim kontinuitas tersebut.
• Batas 1080p.
Output yang terdokumentasi adalah 480P, 720P, dan 1080P — tidak ada tingkat 2K. Jika resolusi adalah kebutuhannya, MiniMax H3 memegang kartu itu.
• Akses friksi di hulu.
Di Alibaba Cloud, model ini diberi label pratinjau dan harga hanya tersedia melalui undangan. Di sini Anda melewati daftar tunggu, tetapi perkirakan adanya kendala kapasitas upstream saat beta diskalakan.
• Bobot terbuka: dijanjikan, belum dirilis.
Apache 2.0 dijanjikan; rekam jejak lini Wan dalam menghadirkan rilis terbuka tidak konsisten. Percayai unggahannya, bukan pengumumannya.
• Benchmark tertunda.
Ini diluncurkan pada bulan paling padat dalam sejarah video AI — setiap klaim “model terbaik” tentangnya, para pesaingnya, atau dari kami bersifat sementara hingga skor independen tersedia.
Dua di antaranya menggunakan trik dokumen yang tidak dimiliki siapa pun; yang ketiga adalah pengambilan gambar panjang. Salin, tukar tanda kurung, render.
Unggah: deck produk Anda (ppt/pdf, ≤50 halaman)
"Ubah dek presentasi ini menjadi video peluncuran 30 detik: seorang presenter menjelaskan tiga fitur utama secara berurutan, render produk sama persis dengan slide, nuansa korporat yang ceria, akhiri dengan logo dan tagline dari slide terakhir."
Menamai struktur ("tiga fitur utama secara berurutan", "akhiri pada slide terakhir") memberi tahu model cara menghabiskan 30 detiknya pada 12 slide Anda. "Cocokkan slide secara persis" memanggil sistem kesetiaan referensi — sistem ini membaca deck Anda, bukan menghias di sekitarnya.
Unggah: manual peralatan (pdf)
"Klip pelatihan keselamatan 30 detik dari bagian 3 manual ini: seorang operator mendemonstrasikan urutan startup langkah demi langkah, close-up pada setiap kontrol yang disebutkan dalam teks, voiceover instruksional yang tenang, teks yang sesuai dengan terminologi manual."
Menunjuk ke suatu bagian menjaga input 50 halaman tetap terfokus, dan "terminologi yang sesuai dengan manual" adalah instruksi yang membuat output dapat digunakan untuk pelatihan nyata alih-alih b-roll generik. Versi spreadsheet: ganti dengan xls dan minta ringkasan triwulanan berbasis bagan.
"Satu pengambilan gambar kontinu selama 30 detik: seorang [penjual makanan kaki lima] menyiapkan lapaknya saat fajar — membuka gerobak, menyalakan kompor, pelanggan pertama datang saat matahari melewati atap-atap. Kamera perlahan mengitari lapak sepanjang waktu. Suara suasana pagi meningkat menjadi desis masakan dan obrolan."
Awal-tengah-akhir yang ditulis sebagai satu kalimat aksi berkelanjutan adalah bentuk yang diberi penghargaan oleh model long-take. Kamera yang berputar mengelilingi adalah uji stres kontinuitas — jika karakter dan tata letak tetap bertahan sepanjang 360 derajat selama 30 detik, model sedang melakukan tugasnya.
Tiga lab Tiongkok, tiga model unggulan, enam minggu. Prompt yang sama di ketiganya, dinilai berdasarkan apa yang akan kami rilis — sementara, mengingat semuanya masih sangat baru. Bandingkan sendiri dari satu kotak prompt.
beta publik 6 Agustus sebagai wan3.0-video di Alibaba Cloud. Klip native 30 detik, dokumen-ke-video, arsitektur all-in-one, bobot terbuka Apache 2.0 dijanjikan. Versi di halaman ini.
era komersial: generasi 15 detik yang kuat dengan alur kerja dibagi ke empat model khusus, serta kisah open-source yang naik turun. Versi yang dijelaskan oleh sebagian besar ulasan Wan yang ada.
rilis yang membangun komunitas Wan: bobot terbuka yang mumpuni yang melahirkan fine-tune dan alur kerja lokal, serta alasan mengapa "apakah bobotnya benar-benar akan dirilis" menjadi pertanyaan pertama yang diajukan siapa pun tentang Wan 3.0.
Model unggulan baru dari lini video Wan Alibaba Tongyi Lab, diluncurkan dalam beta publik pada 6 Agustus 2026 dengan ID model wan3.0-video. Tiga perubahan utama: klip native 30 detik dalam sekali proses (dua kali batas Wan 2.7), sistem omni-reference yang menerima dokumen — PDF, deck presentasi, spreadsheet, bahkan halaman web — sebagai input kreatif, serta arsitektur all-in-one yang menggabungkan empat model Wan yang sebelumnya terpisah menjadi satu.
Model long-take lainnya. Shot 30 detik dipotong mengikuti soundtrack Anda.
Pilihan 2K. Klip resolusi tinggi termurah dengan karakter dan suara terkunci.
Penata gaya. Klip 20 detik dengan audio, dari sinematik hingga stop-motion.