Le nouveau fleuron de ByteDance : un plan-séquence continu de 30 secondes en une seule passe, jusqu’à 50 fichiers de référence et une bande-son qui pilote le rythme et la synchronisation labiale. Saisissez un prompt ci-dessous et essayez-le.
Développeur
ByteDance
Type
Texte / image / référence à la vidéo
Audio
Natif · synchronisation pilotée par l’audio
Durée
30 s en natif, prolongeable
Langues
10+ (synchronisation labiale)
Références
Jusqu’à 50 fichiers
Niveau ici
Crédits payants
Notre verdict en une ligne : le choix pour le plan-séquence. Quand le brief exige un plan ininterrompu ou un montage guidé par la musique, rien d'autre ici n'atteint 30 secondes.
Seedance 2.5 brise le plafond que tous les modèles vidéo partagent : au lieu de fragments de 5 à 15 secondes, il génère une seule prise continue d’une demi-minute, sans assemblage ni raccords — présentée en avant-première à la conférence FORCE de ByteDance en juin et déployée jusqu’au début août. Fournissez-lui un kit complet de ressources, ou donnez-lui une piste musicale et laissez l’audio diriger le tournage. Le Seedance avec lequel vous faisiez vos brouillons ici vient de gagner un grand frère.
Le déploiement du modèle s’est achevé il y a quelques jours, il s’agit donc de premières impressions tirées de nos rendus de test ainsi que des chiffres de lancement de ByteDance — signalées comme telles. Les benchmarks indépendants décrivent encore son prédécesseur ; nous les réviserons au fur et à mesure de leur publication.
• Le plan-séquence de 30 secondes.
Une génération native unique, et non des clips assemblés — ainsi le mouvement de caméra, le personnage et la lumière restent cohérents pendant toute la demi-minute. L’extension multi-turn va plus loin, et un mode Ultra-Long de 180 secondes existe en bêta en amont.
• Limite de 50 références de fichiers.
Jusqu’à 30 images, 10 clips vidéo et 10 clips audio par génération — la plus grande capacité de référence parmi tout ce que nous hébergeons, conçue pour les équipes disposant d’un véritable kit d’assets.
• L’audio pilote la vidéo.
Fournissez une piste musicale, vocale ou SFX, et elle définit le rythme, cale les coupes sur le beat et synchronise les lèvres — dans plus de 10 langues. Cela inverse le flux de travail habituel : la bande-son dirige le tournage.
• Contrôles de niveau réalisateur.
Des retouches au niveau des régions qui modifient une partie d’une image sans régénérer le clip, des remplacements d’arrière-plan sur fond vert qui conservent le sujet, et du blocking avec modèles blancs pour la prévisualisation. Ce sont des outils de production, pas des curseurs gadget.
• L’astérisque 4K.
Le 4K natif a été annoncé le même jour — pour le pipeline Seedance 2.0. Certains articles l'ont intégré à la fiche technique de la 2.5 ; les trois piliers de ByteDance pour la 2.5 sont la durée, les références et le contrôle. Ne le choisissez pas pour un titre sur la résolution.
• Benchmarks en attente.
Les arènes publiques continuent d’évaluer Seedance 2.0. Toute affirmation de "nouveau roi" ce mois-ci — à propos de ce modèle ou de ses rivaux — est provisoire jusqu’à l’arrivée de chiffres indépendants.
• Pas de déjeuner gratuit en amont.
Sur la propre plateforme de ByteDance, la version 2.5 a été lancée sans aucun quota gratuit — son activation nécessite un compte approvisionné. Quiconque annonce "Seedance 2.5 gratuit et illimité" revend quelque chose, ou raconte des bobards.
• Longues prises, longues attentes.
Trente secondes de vidéo native représentent un rendu important. Prévoyez des temps de génération de plusieurs minutes et planifiez les crédits en conséquence — esquissez toujours d'abord l'idée sur les niveaux rapides.
Tout ici met à l’épreuve ce que seul Seedance 2.5 peut faire dans notre gamme: la durée, le timing piloté par l’audio et les retouches chirurgicales. Copiez, remplacez les crochets, lancez le rendu.
"Un seul plan continu à la caméra portée : nous suivons une [coursière] de dos tandis qu’elle se faufile dans un marché de nuit bondé, se baisse sous l’auvent d’un stand quand la pluie commence, et remet un colis à un vendeur qui sourit largement. La caméra ne coupe jamais. Reflets de néon dans les flaques, bruit de pluie qui s’intensifie, brouhaha du marché tout du long."
"La caméra ne coupe jamais" est maintenant une instruction que vous pouvez réellement donner. Écrivez le plan comme une seule phrase d'action continue avec un début, un milieu et une fin — le modèle conserve l'identité et l'éclairage parce qu'il s'agit d'une seule génération, pas de trois plans assemblés.
Téléverser: une piste musicale de 30 secondes
"Une publicité pour sneakers montée sur ce morceau: le produit tourne et les plans de course urbaine changent sur le beat, ralenti sur les drops de basse, composition finale du logo sur le dernier impact. Palette urbaine au crépuscule, 24 fps."
La piste importée n’est pas une musique de fond — c’est la référence de timing du montage. Nommer ce qui se passe sur les beats et les drops (« changement sur le beat », « ralenti sur les drops ») indique au modèle comment utiliser ses 30 secondes. Aucun autre modèle ici ne suit les indications d’une bande-son.
Commencer à partir de: un clip que vous avez déjà généré
"Dans le tiers gauche du cadre uniquement: remplacez la camionnette garée par un stand de fleurs. Tout le reste — le couple qui marche, la dérive de la caméra, l’audio — reste exactement tel quel."
La modification au niveau de la région signifie qu’un mauvais objet ne vous coûte plus une régénération d’un rendu de 30 secondes. Délimitez la région, nommez le remplacement et protégez explicitement le reste — c’est la clause de protection qui empêche la modification de déborder.
Les deux nouveaux venus ont été lancés à quelques jours d’intervalle, avec Veo comme référence établie. Les mêmes prompts pour les trois, évalués selon ce que nous publierions — provisoirement, étant donné que deux d’entre eux sont très récents. Comparez-les vous-même à partir d’une seule zone d’invite.
présenté en avant-première lors de la conférence FORCE de Volcano Engine le 23 juin, bêta entreprise d'abord, déploiement public achevé début août. Génération native de 30 secondes, 50 références, synchronisation pilotée par l'audio. ByteDance a sauté les versions 2.1–2.4 pour marquer le saut. La version sur cette page.
le champion en titre de l’arène pour la génération texte-vidéo et image-vidéo jusqu’au début 2026, avec audio natif et cohérence multi-plans. Le niveau Fast alimente vos brouillons quotidiens gratuits sur ce site.
l'ère de la vitesse et du prix qui a fait de Seedance le carnet de croquis par défaut de la communauté: sans glamour, rapide, partout. Cette réputation explique pourquoi "faire un brouillon sur Seedance" reste le conseil permanent sur chaque page de ce site.
Le nouveau modèle vidéo phare de ByteDance, présenté en avant-première lors de la conférence Volcano Engine FORCE le 23 juin 2026 et déployé de fin juillet à début août. Trois améliorations majeures : un clip continu de 30 secondes en une seule passe, jusqu'à 50 références multimodales (30 images, 10 vidéos, 10 clips audio) et des contrôles de production plus fins comme le montage au niveau des régions. Le numéro de version passe directement de 2.0 à 2.5 — ByteDance a ignoré les versions 2.1 à 2.4 pour signaler un saut générationnel.