Désormais disponible sur MakeFun
Seedance 2.5 : vidéo IA multimodale professionnelle
Le modèle de création vidéo multimodal professionnel nouvelle génération de ByteDance. Quatre avancées en une seule version — récit long, références solides, montage précis et multilingue. Conçu pour la vraie production, afin que les rushes deviennent réutilisables, livrables et reproductibles à grande échelle.
Quatre avancées dans Seedance 2.5
Tous les chiffres ci-dessous proviennent des notes de version officielles de ByteDance. Le modèle est disponible sur MakeFun dès maintenant : ce que vous obtenez réellement, c’est le résultat de votre propre génération.
Récit long
Un plan unique dure désormais 30 secondes au lieu de 15. C’est assez pour porter un arc émotionnel complet sans assembler des clips au montage. L’extension temporelle haute fidélité peut aussi allonger de courtes prises tout en gardant personnage, décor et caméra cohérents.
Références solides
Jusqu’à 50 éléments de référence par génération, contre 12 dans Seedance 2.0. Fournissez d’un coup un casting, plusieurs décors, des mouvements de caméra de référence et une musique de marque : le modèle les lit ensemble et rend un montage conforme au brief. Visages, expressions et costumes restent stables d’un plan à l’autre.
Montage précis
Fournissez un montage existant comme @video1, décrivez la modification dans le prompt, et le modèle ne réécrit que cette partie tandis que le reste tient. Remplacez un produit, changez le style de l’image, ajustez l’âge ou l’expression d’un comédien, retirez un filigrane ou changez la musique de fond.
Multilingue
Plus de dix langues nativement : les créateurs décrivent leur intention dans leur propre langue, sans détour par la traduction. Un même tournage peut aussi sortir en plusieurs versions localisées en voix off — le clip à gauche est la même scène livrée en anglais, français, japonais, espagnol, coréen et hindi.
Ce qui change par rapport à Seedance 2.0
ByteDance le dit clairement : 2.5 n’est pas un saut générationnel comme l’était 2.0 par rapport à 1.5. La version 2.0 avait déjà apporté la rupture de capacité ; 2.5 est un renforcement systématique tourné vers la vraie production.
| Capacité | Seedance 2.0 | Seedance 2.5 |
|---|---|---|
| Durée d’un plan unique | 15 s | 30 s |
| Éléments de référence par génération | 12 | 50 |
| — Images | 9 | 30 (jusqu’en 4K) |
| — Clips vidéo | 3 | 10 |
| — Clips audio | 3 | 10 |
| Durée totale des références vidéo / audio | 15 s | 30 s |
| Référence audio seule | Non pris en charge | Pris en charge |
| Langues natives | — | Plus de 10 |
Sachez quelle tâche vous lancez
Si ByteDance y consacre une section entière, ce n’est pas un hasard : dans la pratique, référence, montage et prolongation se mélangent, ce qui place mal le prompt, cite les mauvais éléments et vous coûte en contrôle comme en stabilité. Choisissez d’abord la tâche, puis rédigez le prompt correspondant.
Génération par référence
Quand : vous n’avez pas encore de montage. Construisez une vidéo depuis zéro à partir d’images, de vidéos ou d’audio en référence.
Forme du prompt : ce que vous voulez générer, en texte clair, plus @video N @image N @audio N pour citer chaque élément.
Paramètres verrouillés : aucun. Vous choisissez vous-même le format d’image et la durée.
Montage vidéo
Quand : vous avez déjà un montage et voulez en réécrire, remplacer, compléter ou supprimer une partie.
Forme du prompt : la modification souhaitée, plus @video1 pour le montage source, éventuellement @image N ou @audio N.
Paramètres verrouillés : Le format d’image suit exactement la source : rien n’est étiré ni recadré. La durée de sortie suit la source à environ 0,3 seconde près. Le MOV est le format de sortie recommandé. Gardez l’entrée sous 20 secondes.
Prolongation vidéo
Quand : vous avez déjà un montage et voulez le poursuivre dans le même rendu, le même rythme et le même style.
Directions : vers l’avant depuis la dernière image, vers l’arrière depuis la première, ou en comblant l’écart entre deux ou trois clips.
Paramètres verrouillés : Le format d’image suit la source. La durée du nouveau segment vous revient — indiquez-la dans le prompt. Le MOV est également recommandé ici.
Première image et première-dernière image
Fournissez une image comme première image, ou deux images comme première et dernière. Le format d’image suit la première ; si la dernière a une autre forme, elle sera étirée pour correspondre — donnez donc des images de même proportion. La durée reste sous votre contrôle.
Rédiger des prompts pour la 2.5
Le prompt engineering a changé dans cette version et le modèle attend désormais plus du texte. ByteDance conseille de penser comme un réalisateur et d’écrire un prompt structuré en quatre parties.
- Citez vos éléments. Numérotez chaque image, vidéo et fichier audio dans l’ordre d’import et précisez à quoi chacun sert — qui fournit la ressemblance, lequel porte la voix, lequel donne le mouvement, lequel fixe le lieu.
- Résumé en une ligne. Sujet, lieu, événement, genre ou style, et tout travail de caméra particulier.
- Le détail plan par plan. Déroulez les plans dans l’ordre — les horodatages comme « plan N » fonctionnent. Décrivez le cadrage, le mouvement de caméra, l’action, les dialogues et les effets sonores. Formulez au positif.
- Concluez. Ajoutez les détails qui traversent toute la pièce : objectif et position de caméra, environnement, voix, atmosphère.
La skill officielle d’optimisation de prompts
ByteDance recommande vivement sa propre skill de prompt engineering pour Seedance 2.5. Elle s’installe en local via npx et s’exécute dans votre propre fenêtre de chat IA — aucun service tiers n’intervient.
npx --yes skills@latest add \
"https://arkdocs.tos-cn-beijing.volces.com/skills/" \
--skill sd25-pe \
--yes
Tapez ensuite /sd25-pe suivi de votre brouillon de prompt.
Le contrôle négatif est pris en charge
Vous pouvez exclure autant que demander. Sous-titres et audio ont leurs propres interrupteurs — « pas de sous-titres à l’écran », « pas de musique de fond, seulement l’ambiance et les sons de l’action » — et l’audio se pilote séparément en effets sonores, musique de fond ou dialogue.
Quelques écueils silencieux
- Les horodatages se lisent mieux à la seconde près. Indiquer une fréquence dans un intervalle — « secoue la tête trois fois en une seconde » — est déconseillé.
- Les planches de storyboard fonctionnent jusqu’à une quinzaine de cases. Les bonshommes bâtons ou le dessin au trait valent mieux qu’un rendu abouti, et trop de texte dans les cases nuit.
- La prévisualisation en boîtes grises marche mieux grossière que fine : une géométrie simple assemblée sommairement se lit plus clairement qu’un modèle détaillé.
- Associez explicitement les sujets aux éléments. Écrire un nom uniquement sur l’image puis l’employer dans le prompt invite le modèle à confondre les personnes.
Ce que vous pouvez régler à chaque génération
Voici les réglages que ByteDance expose pour le modèle. Ce que propose le formulaire de génération sur MakeFun est ce qui s’applique réellement à votre travail.
- Mode — génération par référence, première / première-dernière image, montage vidéo ou prolongation. Choisissez-le en premier : il détermine lesquels des réglages ci-dessous cessent de vous appartenir.
- Résolution — 480p ou 720p.
- Format d’image — 21:9, 16:9, 4:3, 1:1, 3:4, 9:16, ou laissez le modèle décider à partir de vos éléments.
- Durée — fixez-la en secondes ou confiez-la au modèle.
- Format de sortie — le MOV est recommandé pour les tâches de montage et de prolongation, où il préserve mieux la couleur, la luminosité et la synchro image-son.
- Audio — activé ou désactivé.
- Taille de lot — jusqu’à 8 clips d’un coup.
Docs et API
Vous voulez intégrer Seedance à votre propre produit ? Endpoints, paramètres, authentification et facturation figurent tous dans la documentation développeur de MakeFun, où l’accès MCP est également disponible.
Cinquante références, et combien en utiliser vraiment
Le plafond est de 50 éléments — 30 images, 10 clips vidéo et 10 clips audio. ByteDance est tout aussi clair : atteindre le plafond n’est pas l’objectif. Les proportions ci-dessous viennent de leur propre évaluation à grande échelle.
Limites strictes
- Images : jusqu’à 30, en 4K ou moins, 30 Mo chacune. JPEG, PNG, WebP, BMP, TIFF, GIF, HEIC, HEIF.
- Vidéo : jusqu’à 10 clips, de 480p à 4K, 200 Mo chacun. MP4 ou MOV. Chaque clip 2–30 s, 30 s au total.
- Audio : jusqu’à 10 clips, 15 Mo chacun. MP3 ou WAV. Chaque clip 2–30 s, 30 s au total.
- Les budgets vidéo et audio se comptent séparément, ils ne s’additionnent pas.
Ce qui marche vraiment
- Sujet porté par la vidéo ou l’audio : 1 à 5 éléments fonctionnent bien. De 6 à 10, cela vaut l’essai, mais la stabilité baisse et il faudra peut-être plusieurs tentatives.
- Ces clips donnent le meilleur entre 5 et 10 secondes. Deux secondes portent trop peu pour identifier ; trente diluent les caractéristiques et ajoutent du bruit.
- Sujet porté par des images fixes : 1 à 8 images fonctionnent bien, 9 à 12 valent l’essai.
- Jusqu’à 5 sujets ; les images en vue unique comme multivue conviennent. Au-delà de 5, la vue unique est plus stable — répartissez les angles sur des images distinctes plutôt que de les entasser dans une seule.
Un « sujet », c’est tout élément central que vous voulez garder stable sur l’ensemble du montage — un personnage, un produit ou accessoire vedette, le lieu, le style général. Dans « quelqu’un dans une forêt qui tire sur un lapin à l’arc », la personne, l’arc et le lapin sont trois sujets.
Pourquoi utiliser Seedance sur MakeFun
Démarrez gratuitement, sans abonnement
Générez sans formule mensuelle. Seedance 2.5 fonctionne avec vos crédits existants, et il n’y a rien à activer avant votre premier clip.
Un seul endroit pour tous les modèles
Seedance, Kling, Wan, Sora, Veo, Seedream et d’autres tiennent dans un seul compte et un seul solde. Comparez-les sur le même brief au lieu de payer plusieurs outils.
Pensé pour la livraison
Synchro labiale, clonage vocal, échange de visage et de tête, suppression de sous-titres et agrandissement voisinent avec la génération : un clip passe du prompt au livrable au même endroit.
Modèles vidéo IA associés sur MakeFun
- Wan 3.0 — le modèle tout-en-un de Tongyi Wanxiang, également disponible sur MakeFun. Comparez les deux sur le même brief.
- Seedance 2.0 — la génération précédente, avec audio natif et récit en plusieurs plans.
- Seedance 1.5 Pro — la génération précédente, toujours rapide et économique.
- Kling 2.6 et Sora 2 — d’autres modèles vidéo à comparer sur le même brief.
- Synchro labiale et vidéo vers audio — des outils de finition pour vos rushes générés.