Guide de création Seedance 2.0

D'une idée à une vidéo maîtrisée

Maîtrisez la référence multimodale, la définition du sujet, le séquencement du storyboard, les mouvements de caméra, le montage vidéo et les techniques de prolongation. La page rassemble des exemples complets et des questions fréquentes : copiez et utilisez directement pour générer.

La série Doubao Seedance 2.0 (ci-après dénommée série Seedance 2.0) prend en charge nativement la génération conjointe d'audio et de vidéo, avec une compréhension sémantique exceptionnelle et des capacités d'interaction multimodale. Cet article présente les méthodes d'utilisation des prompts (instructions) pour la série Seedance 2.0 et les techniques associées, afin de vous aider à générer efficacement des vidéos de haute qualité répondant à vos besoins.

Remarque
Tous les visuels (images, vidéos) et contenus audio présentés dans ce guide sont générés de manière autonome par la série de modèles de génération visuelle Seedance/Seedream.

Formule de base

La série Seedance 2.0 prend en charge la référence simultanée à des contenus multimodaux tels que vidéos, images et audio, permettant de cibler avec précision des caractéristiques comme l'apparence des personnages, les effets d'action, le style visuel ou le timbre vocal, réduisant ainsi considérablement le seuil de rédaction des prompts. Grâce à cet avantage, nous pouvons utiliser une formule de base simple pour guider le modèle et tirer parti des caractéristiques des contenus multimodaux afin de générer rapidement des vidéos répondant à des besoins spécifiques.

La génération de vidéos par référence peut être divisée en trois types de tâches : référence multimodale, édition de vidéo et prolongement de vidéo. Vous pouvez choisir la formule de base du prompt en fonction du type de tâche.

Référence multimodale

Extraire certains éléments (sujet, style, scène, effets sonores) du contenu source pour générer une toute nouvelle vidéo.

Scénarios d'application : transfert d'action, réutilisation du sujet, emprunt d'ambiance, etc.
Formule recommandée :
Référence image : Référez-vous à<ImageN> pour le<SujetN>, générez...
Référence vidéo : Référez-vous à<VidéoN> pour le<Action/Mouvement de caméra/Style/Effet sonore>, générez...
Référence audio : Référez-vous à<AudioN> pour le timbre, générez...

Édition de vidéo

Effectuer des modifications locales ou globales sur la vidéo d'origine. Les parties non mentionnées restent inchangées par défaut.

Scénarios d'application : remplacement local, suppression du sujet, modification d'attributs, etc.
Formule recommandée :
Ajouter un élément : Décrivez clairement<Caractéristique de l'élément> + <Moment d'apparition> + <Position d'apparition>
Modifier un élément : Édition stricte<VidéoN>, remplacez<Caractéristique d'origine> par<Nouvelle caractéristique>
Supprimer un élément : Indiquez clairement l'élément à supprimer. Pour les éléments à conserver, insistez dans le prompt pour de meilleurs résultats.

Prolongement de vidéo

Prolonger la vidéo d'origine dans le temps, en veillant à la cohérence du style audio-vidéo, du sujet et de la narration.

Scénarios d'application : Suite de l'histoire, prolongement de l'action, complément de séquence, etc.
Formule recommandée :
Prolongement de vidéo : Prolongement vers l'avant/arrière<VidéoN>, générez...
Complétion de piste :<Vidéo1> + <Description de la transition> + suivi de <Vidéo2> + <Description de la transition> + suivi de <Vidéo3>
Remarque
Pour les tâches d'édition/prolongement de vidéo, utilisez directement «<VidéoN>» pour désigner la vidéo, n'utilisez pas « référence<VidéoN>» pour éviter d'être mal interprété comme une tâche de référence.

Tâches combinées

Les trois types de tâches ci-dessus peuvent également être combinés.

Scénarios d'application : Référencez un contenu source, éditez un autre contenu source.
Formule recommandée :
Référencez<Image/VidéoN> pour sa[Dimension de référence], éditez strictement<VidéoX>,[Contenu d'édition spécifique]

Formule avancée

Seedance 2.0 est essentiellement un réalisateur IA multimodal : il lit simultanément vos prompts textuels, images, vidéos et audio, et décompose en interne les dimensions « couche spatiale » (ce qu'il y a dans l'image) et « couche temporelle » (comment les choses évoluent dans le temps) pour comprendre et générer les images.

Par conséquent, un bon prompt n'est pas une simple « description rédactionnelle », mais une « instruction technique » : qui, dans quelle scène, fait quelle action, comment la caméra bouge, dans quel ordre temporel, le tout adressé respectivement à la couche spatiale et à la couche temporelle. La formule spécifique est la suivante :

Formule avancée du prompt : Sujet précis + Détails d'action + Environnement de scène + Teinte lumineuse et ombre + Mouvement de caméra + Style visuel + Qualité d'image + Conditions de contrainte

En résumé, commencez par définir « qui » fait « quoi », puis précisez « où » et « quelle ambiance », indiquez au modèle « comment filmer », et enfin resserrez le résultat avec le style, la qualité et les contraintes. Voici le détail de chaque élément.

1 Définir le sujet

Dans un contenu source réel, une image contient souvent plusieurs sujets. Pour référencer précisément un objet spécifique, une définition claire du sujet est nécessaire. Le sujet peut être un personnage, un accessoire, une scène, etc.

Méthode de définition de base
Formule recommandée : Définissez<Image/VidéoN> pour le[Caractéristiques principales du sujet]défini comme<SujetN>
Exigences des caractéristiques principalesUtiliser 2 à 3 caractéristiques statiques claires et stables (comme les vêtements, la coiffure, l'apparence, la catégorie) pour décrire, afin d'assurer une identifiabilité unique.
Exemple :
Remplacez le parfum dansImage 1La femme en robe rouge et chapeau de paille dans est définie commeSujet 1
Remplacez le parfum dansImage 1La femme en robe rouge et chapeau de paille dans est définie commeZhang Hong
Même sujet avec plusieurs matériaux

Lorsque des objets de plusieurs matériaux font référence au même sujet, ils doivent être liés de manière unifiée :

Formule recommandée : DéfinissezImage 1 pour le[...],Image 2 pour le[...]défini comme **<SujetN>**
Scène multi-sujet

Lorsque la vidéo contient plusieurs sujets, chacun doit être défini séparément avec des étiquettes distinctes. Les étiquettes doivent être uniques et stables, et être utilisées de manière cohérente dans les descriptions suivantes pour éviter toute confusion.

Formule recommandée : Définissez [caractéristique principale du sujet 1] dans <Image/Vidéo N> comme <Sujet 1>, définissez [caractéristique principale du sujet 2] dans <Image/Vidéo N> comme <Sujet 2>...
Exemple : DéfinissezVidéo1 commepolicier, et l'autre homme petit commevoleur. Le cadre est un marché de jour animé et ensoleillé, entouré de nombreux étals de fruits et de piétons denses, avec une atmosphère de vie urbaine animée.voleurcourt en avant, paniqué, dans la foule dense du marché, policierle poursuit à toute vitesse juste derrière, les deux se faufilant rapidement entre les étals. La caméra à l'épaule suit rapidement par devant, avec de légères secousses réalistes pour créer une tension de poursuite.
Remarque
Chaque fois qu'un sujet est mentionné, il doit être clairement désigné, sans omission. Deux méthodes sont prises en charge :
Pour les scènes simples sans sujet prédéfini, utilisez à chaque mention du sujet<SujetN>@<ImageN>, pour souligner la liaison entre le sujet et le contenu source. Exemple : Zhang San@Image1.
Pour les scènes avec un sujet prédéfini, utilisez le même libellé à chaque mention. Exemple : définissez l'homme grand deVidéo1 commepolicier, et l'autre homme petit commevoleur. Dans la description suivante, utilisez systématiquement «policier» pour l'homme grand et «voleur» pour l'homme petit.
Lors de l'utilisation d'une bibliothèque d'actifs (Asset ID), utilisez toujours<Image/VidéoN>pour désigner le sujet. Le modèle ne pouvant pas associer directement l'Asset ID au contenu de référence, ne remplacez pas<Image/VidéoN>.
Les descriptions doivent être concises, éviter les redondances et les conflits sémantiques (comme des caractéristiques contradictoires pour un même sujet).
Il est recommandé d'exprimer les relations spatiales via des images de référence plutôt que par des descriptions textuelles complexes.

2 Utiliser la chronologie des plans

La modélisation interne du modèle est découplée entre espace et temps. Par conséquent, la forme idéale d'un prompt pour une vidéo complexe est un storyboard chronologique : décomposez la vidéo en plusieurs plans, décrivez dynamiquement chaque plan dans l'ordre des événements : qui + où + fait quoi + comment la caméra bouge.

Conseil pratique

Utilisez l'ordre des plans, écrivez un simple storyboard « Plan 1 / Plan 2 / Plan 3 » pour chaque segment vidéo, puis fusionnez en un prompt complet.

Exemple négatif : « Un homme court nerveusement dans la rue, l'image est très cinématographique. »
Exemple positif :
Plan 1 : Prise de côté dans la ruelle, l'homme commence à courir lentement, avec une respiration haletante.
Plan 2 : L'homme renverse un étal de fruits, la caméra effectue un mouvement rapide et fait un gros plan sur le visage effrayé de l'homme.
Plan 3 : L'homme enjambe un petit mur et disparaît, la caméra recule lentement et s'arrête sur la rue vide.

Règles spécifiques

UtilisezPlan1,Plan2,Plan3comme identifiants, organisez le contenu dans l'ordre des événements (d'abord le principal, puis le secondaire). Ne limitez pas strictement la durée de chaque segment, laissez le modèle générer naturellement le rythme en fonction de l'histoire.
Explication
Le modèle ne prend pas en charge de manière stable les durées précises (comme 0-3 secondes), forcer une limite de durée peut entraîner des résultats anormaux.
Pour chaque plan, il est recommandé d'organiser selon la logique suivante :
Mouvement de caméra ou transition : Par exemple « plan large qui s'approche lentement », « caméra fixe », « transition vers… », etc.
Action et expression du sujet : Décrivez les actions clés et les changements d'expression du personnage/objet principal.
Changement de position ou d'espace : Indiquez la scène, la position ou la relation spatiale du sujet.
Informations audio : Décrivez les effets sonores, la voix ou la musique de fond correspondant au plan.

3 Exigences de description des actions

Détail des membres + quantification du degré
Les actions doivent être spécifiques aux parties du corps comme les mains, les jambes, la tête, les épaules et le dos, tout en ajoutant une description del'amplitude, la vitesse, la force;
Exemple : lever lentement la main, tourner rapidement la tête, pousser fortement le sol, baisser légèrement la tête.
Privilégier les petits mouvements lents et continus
Privilégiez les mouvements lents, doux et fluides, évitez autant que possible les actions à forte intensité comme courir vite, sauter haut ou rouler violemment.
Exemple : marcher lentement, lever doucement la main, baisser légèrement la tête, s'asseoir naturellement
Ajouter des transitions d'action
Décrivez l'inertie et la continuité entre les actions avant et après pour garantir la fluidité et le naturel des mouvements.
Exemple : en profitant de l'inertie de la rotation pour lever la main, passer naturellement d'un état d'arrêt à lever la main.
Expression concrète des émotions
Utilisez des détails corporels spécifiques pour exprimer les émotions, remplaçant des termes abstraits comme « très triste » ou « très en colère ».
Voir le tableau ci-dessous pour des exemples concrets :

Émotion abstraite

Extériorisation en actions et détails

Tristesse

Tête baissée, épaules légèrement tremblantes, yeux rouges, doigts crispés inconsciemment sur le vêtement, larmes aux yeux sans couler.

Joie

Sourire irrépressible, traits détendus, pas légers, fredonnement inconscient, petit tour sur soi-même.

Tension / Anxiété

Regarder fréquemment sa montre, tapoter nerveusement la table, respiration haletante, regard fuyant, se ronger les ongles inconsciemment.

Colère

Poings serrés, mâchoire tendue, poitrine se soulevant violemment, regard acéré comme un couteau, mots prononcés entre les dents.

Soulagement

Long soupir de soulagement, épaules complètement détendues, un sourire discret et rare se dessine, regard au loin.

4 Écriture des mouvements de caméra

Le modèle comprend très bien les termes de mouvement de caméra. Il suffit d'utiliser directement la terminologie standard, comme « plan moyen, gros plan, plan large, travelling avant lent, panoramique horizontal stable, plan fixe ».

Remarque
Dans un plan, essayez de ne spécifier qu'un seul type de mouvement de caméra, ne demandez pas simultanément un zoom avant/arrière et un panoramique, cela augmenterait l'instabilité de l'image.

5 Qualité, style et mots de contrainte

La qualité, le style et les mots de contrainte sont essentiels pour contrôler l'effet de génération vidéo, en délimitant les limites créatives du modèle, en uniformisant la qualité et la tonalité artistique, tout en évitant les défauts visuels et les écarts aléatoires. Ils sont nécessaires pour garantir la stabilité et la conformité du résultat final.

1 Qualité

Définit la netteté de l'image, les détails de texture et la qualité de la lumière et des ombres, améliorant la qualité de base de la vidéo.

Exemple : Haute définition, détails riches, qualité cinématographique, couleurs naturelles, lumière et ombres douces

2 Style

Définit le style artistique global et la tonalité visuelle, unifiant l'ambiance artistique de l'image.

Exemple : Cyberpunk aux tons bleu-violet froids, pellicule rétro, esthétique japonaise douce

3 Mots de contrainte

Les mots de contrainte sont très importants pour éviter efficacement les défauts visuels, les déformations et les éléments irrationnels, en limitant les limites de génération et la stabilité.

Modèle de mots de contrainte courants :

Éviter de générer des sous-titres : « Rester sans sous-titres », « Éviter de générer du texte ou des sous-titres »
Éviter de générer un logo : « Ne pas générer de logo »
Éviter de générer un filigrane : « Ne pas générer de filigrane »

6 Cas pratique

Montre comment utiliser la formule avancée et les éléments présentés ci-dessus pour rédiger un prompt.

Exemple 1 : Mini-drame émotionnel en dortoir (plutôt dialogues / scènes parlées)

Préparation du matériel :

@Image 1 : Photo en buste de l'héroïne
@Image 2 : Image de référence de la scène du dortoir
@Vidéo 1 : Référence de mouvement de caméra pour un dialogue en intérieur (plan moyen avec zoom ou léger panoramique/balancement)
@Audio 1 : Bruit ambiant d'intérieur ou musique douce

Prompt :

La fille de @Image 1 est le personnage principal, @Image 2 sert de référence de style pour la scène du dortoir, en référence au mouvement de caméra de @Vidéo 1.

Plan 1 : Au crépuscule, la fille @Image 1 marche d'un pas léger jusqu'àla porte du dortoir @Image 2. La caméra suit en plan moyen et stable. La lumière jaune et chaude du coucher de soleil entre par la fenêtre dans le couloir. Elle s'arrête un instant devant la porte, prend une profonde inspiration, l'air légèrement nerveuse.

Plan 2 :la fille @Image 1 : Elle pousse la porte et entre dans le dortoir. La caméra passe à un plan moyen à l'intérieur. Les colocataires, tout en rangeant leurs livres, lèvent la tête vers elle. L'une d'elles demande en souriant {Comment s'est passé l'examen ? Tu as réussi ?}. La caméra alterne lentement entre elles en gros plan.

Plan 3 :la fille @Image 1 : Elle baisse d'abord la tête, affichant une expression abattue. La caméra fait un gros plan sur son visage. Puis elle lève la tête, ne pouvant retenir son sourire, et éclate de rire en disant {Je vous ai eues !}. Les colocataires se mettent à la poursuivre en plaisantant. La caméra s'éloigne lentement et se fixe sur un plan d'ensemble de la pièce remplie de rires et de joie.

Tout au long, le style est celui d'un documentaire cinématographique haute définition, aux tons chauds et à la lumière douce. Les visages des personnages sont stables et non déformés, les actions sont naturelles et fluides, sans saccades ni scintillements. Les effets sonores ambiants se fondent naturellement avec @Audio 1.

Exemple 2 : Scène de combat sur falaise en style ancien (plutôt action / ambiance)

Préparation du matériel :

@Image 1 : Héroïne en rouge
@Image 2 : Assassin en noir (adversaire)
@Image 3 : Image de scène de bambouseraie sur falaise
@Vidéo 1 : Référence de mouvement de caméra pour un combat d'arts martiaux
@Audio 1 : Rythme de tambour serré ou effets sonores de combat

Prompt :

La femme en rouge de @Image 1 est l'héroïne, la femme en noir de @Image 2 est l'adversaire. La scène se réfère à l'environnement de bambouseraie sur falaise de @Image 3. Le mouvement de caméra global et le rythme d'action se réfèrent à @Vidéo 1. Les effets sonores de fond sont synchronisés avec @Audio 1.

Plan 1 : Au crépuscule, la caméra part dela femme en rouge @Image 1Plan moyen latéral en travelling avant lent. Elle se tient au bord de la falaise, prend une gourde et boit de l'alcool. Ses vêtements ondulent doucement dans le vent de la montagne. La caméra fait un demi-tour autour d'elle, passant du plan frontal à son dos. Au loin, on distingue une silhouette vêtue de noir parmi les bambous.

Plan 2Transition par fondu zoom vers un plan large. Vue aérienne par drone de l'ensemble de la falaise et de la bambouseraie. Les deux personnages se tiennent aux extrémités de la falaise. Le vent soulève leurs vêtements et la poussière. Le rythme s'accélère légèrement avec les battements de tambour.

Plan 3Retour au plan rapproché au sol. Les deux dégainent lentement leurs épées, face à face. Femme en rouge @image 1Son expression passe de nonchalante à glaciale. Femme en noir @image 2Regard déterminé, la pointe de l'épée tremble légèrement. La caméra suit les deux personnages qui tournent en cercle, puis se fige en gros plan l'instant avant que les épées ne se croisent.

Ambiance générale de film de sabre sous la pluie et la brume, tons froids et faible saturation, texture de pellicule cinéma, richesse des contrastes lumineux. Les visages et proportions des personnages restent stables sans déformation. Les mouvements sont fluides et naturels, sans raideur, sans distorsion ni saccade.

Autres techniques

Génération de texte

La série Seedance 2.0 prend en charge la génération de texte courant. Le modèle peutadapter automatiquementle style et la couleur appropriés en fonction du contexte, et prend également en charge laspécificationde la couleur, du style, du mode d'apparition, du moment et de la position du texte dans le prompt. Lors de la rédaction, privilégiez lescaractères courants, évitezCaractères raresetsymboles spéciaux, pour garantir un rendu optimal. Actuellement pris en charge dans les scénarios publicitaires, sous-titres, bulles, etc. Consultez les exemples et la rédaction dansGénération de texte.

Prolongement vidéo vs montage par segments

Plan-séquence continu (prolongement vidéo) : adapté aux scènes de « dialogue » dans un même décor, comme les longues conversations, les progressions émotionnelles, les déplacements linéaires, pour un effet immersif et fluide en un seul plan.
Changement de scène / d'action (montage par segments) : adapté aux retournements narratifs ou aux scènes d'action complexes et rapides (poursuites, combats, montage). On génère des segments indépendants puis on les assemble pour garantir rythme et impact visuel.

En pratique, on combine souvent les deux méthodes : d'abord un prolongement pour un dialogue fluide, puis un montage de plans vides ou de transitions pour allier immersion et variations rythmiques.

Stratégie de configuration des素材

On répartit généralement les素材 en quatre « rôles fonctionnels » :

Ancrage du personnage : verrouiller l'apparence du personnage
Définition du décor : verrouiller l'environnement et le style
Référence de caméra : verrouiller le langage visuel et le rythme des mouvements
Ambiance rythmique : contrôler l'émotion et le timbre via l'audio

Configuration recommandée (4-5素材 au total) : 1-2 images de personnage (gros plan / plan entier) + 1 image de décor + 1 vidéo de référence de caméra + 1 fichier audio.

Explication
Il est déconseillé d'utiliser le nombre maximum de素材. Trop de素材 rend difficile pour le modèle de prioriser les caractéristiques, ce qui peut entraîner des conflits de style, une identification floue du sujet, et des résultats éloignés des attentes.

Remarques

Normes linguistiques

La langue des dialogues doit être uniforme, éviter le mélange chinois-anglais (sauf pour les noms propres).

Normes pour les caractères spéciaux

Utiliser judicieusement les symboles dans le prompt aide le modèle à comprendre différents types d'informations :

Type d'information

Symbole

Exemple

Musique

()

(Du rock rapide joue en fond)

Effet sonore

<>

<Des aboiements de chien au loin>

Répliques

{}

{Bonjour, le monde}. Si la réplique est dans une langue rare (ni chinois ni anglais), préciser la langue, ex : dire en japonais {こんにちは}.

Sous-titres

【】

【Chapitre 1 : Le Départ】

Problèmes courants

Dérive d'identité du personnage

Phénomène typique

L'apparence du personnage généré ne correspond pas à l'image de référence, ou subit un « changement de visage » (dérive d'identité) en cours de vidéo, ce qui peut entraîner un blocage par modération si le personnage ressemble à une célébrité.

Analyse des causes profondes

Efficacité insuffisante de l'image de référence du visage

Mélange d'images de référence : combiner l'image de référence du visage avec des images de posture (plan entier / demi-corps), de vêtements, de détails, etc., dans une même image fournie au modèle.
Proportion du visage trop faible : dans une image de référence mixte, la zone du visage occupe une trop petite proportion, ce qui réduit le poids accordé par le modèle à l'extraction des traits faciaux, facilement perturbé par l'arrière-plan ou d'autres éléments.

Solutions

Renforcer l'indépendance et le poids de la référence faciale :

Préparer un gros plan du visage : en plus du plan entier, préparer une imagene contenant que la tête du personnage (gros plan, uniquement le visage, de préférence sans expression, minimiser les éléments perturbateurs comme les épaules, le cou, l'arrière-plan). (Gros plan, visage uniquement, expression neutre de préférence, minimiser les éléments perturbateurs comme les épaules, le cou et l'arrière-plan).
Définition claire du sujet dans le prompt : les traits du visage de <sujet1> se réfèrent à l'image 1 (gros plan), le maquillage et la tenue à l'image 2 (plan entier).
Placer les素材 importants en premier : plus un素材 nécessite uneréférence précise, plus il doit être placétôt dans le prompt.
Remarque
Pour la référence du personnage, utiliser uniquement un gros plan + un plan entier,il est déconseillé d'utiliser des vues multiples du personnage. Les素材 multivues montrent le même personnage sous différents angles, ce que le modèle peut interpréter comme plusieurs sujets distincts, aggravant le problème de dérive d'identité.

Avant optimisation

Après optimisation

Les personnages dans la vidéo changent de visage en cours de route, ressemblant à des célébrités.

Le visage reste cohérent avec l'image de référence tout au long.

Sous-titres dans la vidéo

Phénomène typique

Le prompt ne demande pas de sous-titres, mais la vidéo générée en contient.

Solutions

Explication
Actuellement, il est impossible d'éviter à 100 % la génération de sous-titres. Voici des méthodes pour réduire leur probabilité et améliorer le taux de réussite.
Ajouter des instructions explicites dans le prompt : « Garder sans sous-titres », « Éviter de générer du texte ou des sous-titres ».
Si les images/vidéos de référence contiennent du texte non essentiel, il est recommandé de le supprimer d'abord avec un outil (ex. capacités d'édition d'image/vidéo de Seedream/Seedance), puis d'utiliser le素材 sans texte comme entrée.
Si le contexte le permet, privilégier le format paysage pour la génération vidéo (la probabilité de sous-titres est nettement inférieure à celle du portrait), puis recadrer en portrait avec un logiciel de montage.

Logo / filigrane dans la vidéo

Phénomène typique

Le prompt ne mentionne pas de filigrane, mais la vidéo générée contient un logo/filigrane d'une autre plateforme.

Solutions

Ajouter des instructions explicites dans le prompt : « Ne pas générer de filigrane », « Ne pas générer de logo ».

Dérive de style

Phénomène typique

On souhaite un style anime 2D ou 3D, mais l'image de référence est réaliste et le prompt ne précise pas le style, ce qui peut entraîner une dérive vers un style réaliste.

Solutions

Ajouter des termes de style explicites dans le prompt, comme « style anime japonais 2D », « style manga chinois 3D ». Pour un contrôle plus précis, convertir d'abord l'image de référence dans le style souhaité avant de générer la vidéo.

Avant optimisation

Après optimisation

Le style xianxia dérive vers un style réaliste.

Conserver le style CG d'animation chinoise 3D de type xianxia.

Sauts à la jonction des vidéos prolongées

Phénomène typique

Après avoir généré une nouvelle vidéo avec la fonction de prolongement, lors de l'assemblage avec la vidéo originale, des sauts ou des retours en arrière peuvent apparaître à la jonction.

Solutions

Actuellement, il est recommandé de corriger par montage en alignant les images clés. Des améliorations fondamentales seront apportées via les itérations du modèle.

Importer les vidéos à assembler dans CapCut ou un autre logiciel de montage professionnel.
À la première jonction, supprimer6 images de la fin de la première vidéo.
et simultanément supprimer1 image du début de la deuxième vidéo.
Répéter l'opération pour toutes les jonctions.
Exporter et vérifier la fluidité de la vidéo assemblée.
Explication
Même après alignement des images, de légers sauts peuvent subsister. Il est conseillé de terminer la vidéo prolongée sur un moment de transition, et de commencer la vidéo suivante sur la nouvelle scène après la transition.

Avant optimisation

Après optimisation

Apparition à la transition (5e s, 20e s) Saut d'image soudain ou Retour en arrière du contenu

Transitions plus fluides

Problème des jumeaux

Phénomène typique

Dans les scènes avec plusieurs personnages et l'utilisation de vues multiples comme素材 de référence, la vidéo générée peut facilement montrer deux personnages identiques dans la même image.

Analyse des causes profondes

La définition des sujets dans le prompt n'est pas claire, le modèle ne peut pas distinguer précisément les différents personnages ;
L'utilisation de vues multiples comme素材 de référence peut entraîner une confusion dans l'identification des personnages par le modèle, générant ainsi des personnages identiques en double.

Solutions

Explication
Actuellement, il est impossible d'éviter à 100 % le problème des jumeaux. Voici des méthodes pour réduire sa probabilité et améliorer le taux de réussite.
Définir clairement les associations de personnages

Dans le prompt, définir clairement chaque personnage et sa correspondance avec l'image de référence. Il est recommandé d'indiquer l'image de référence après le nom du personnage, en gardant un format uniforme.

Exemple : Zhang San (correspond à l'image 1) jette le livret d'épargne vert vers Li Si (correspond à l'image 2) qui se tient debout.

2. Ajouter une instruction de contrainte globale

Ajouter une contrainte fixe à la fin du prompt :Interdire strictement l'apparition de personnages à l'apparence, aux vêtements et aux accessoires totalement identiques tout au long de la vidéo. Interdire la génération de clones ou d'effets de jumeaux. Dans une même image, ne conserver qu'un seul personnage correspondant, sans duplication..

3. Optimiser les素材 de référence

Privilégier les photos individuelles de personnages seuls comme素材 de référence. Éviter les素材 multivues ou à vues multiples.

4. Simplifier et optimiser le prompt

Ne pas utiliser un script complet comme prompt. Un contenu textuel trop redondant peut perturber la compréhension du modèle. Il faut réduire les informations non pertinentes et garantir des instructions claires et ciblées.

Avant optimisation

Après optimisation

À la 8e seconde, apparition des « jumeaux »

Dégradation de la qualité lors du prolongement vidéo

Phénomène typique

Lors de l'utilisation d'une vidéo générée par le modèle comme素材 d'entrée pour un prolongement, la qualité se dégrade. Les prolongements multiples cumulent la dégradation, en particulier au niveau du visage qui peut présenter des taches de couleur.

Solutions

Actuellement, les méthodes suivantes peuvent atténuer la dégradation. Des améliorations fondamentales seront apportées via les itérations du modèle :

Convertir la vidéo originale en vidéo de modèle blanc via Seedance 2.0, puis l'utiliser comme素材 d'entrée pour le prolongement.
Prompt de référence : Convertir la vidéo en modèle 3D blanc, les personnages sont uniformément des modèles 3D blancs, sans couleur, sans texture, sans ombre, fond blanc pur, structure stable, mouvement fluide.
Privilégier les images haute définition comme素材 de référence.
Contrôler raisonnablement le nombre de prolongements pour éviter les cumuls.

Avant optimisation

Après optimisation

Continuer directement l'écriture du résultat du modèle.

Convertir le résultat du modèle en vidéo en maquette blanche avant de continuer l'écriture.

Effets spéciaux non conformes aux attentes

Phénomène typique

Lors de la description d'effets spéciaux spécifiques dans le prompt, le résultat peut ne pas correspondre aux attentes. Exemple : le prompt spécifie « le chiffre « 2999 » apparaît avec une animation de compte à rebours », mais l'effet de défilement des chiffres généré présente des sauts désordonnés, ne respectant pas la logique standard du compte à rebours.

Solutions

Il est recommandé d'utiliser unevidéo de référence pour définir l'effet : fournir la vidéo de l'effet souhaité comme素材 de référence au modèle, afin qu'il comprenne précisément la forme et la logique de mouvement de l'effet, pour un résultat plus proche des attentes. Exemple : la façon dont le chiffre « 2999 » apparaît se réfère à la vidéo 1.

Avant optimisation

Après optimisation

L'effet de défilement numérique présente une sensation de saut désordonné évidente.

Après avoir ajouté un effet vidéo de défilement numérique correct, le résultat de l'effet est conforme aux attentes.

Animation d'effet spécial

Trop de personnages de référence

Phénomène typique

Lorsque le nombre de personnages de référence dépasse 4, la stabilité de sortie du modèle diminue, et la vidéo générée peut présenter un nombre de personnages incorrect (trop peu, trop nombreux) ou des répétitions.

Solutions

Actuellement, les méthodes suivantes peuvent atténuer ce problème. Des améliorations fondamentales seront apportées via les itérations du modèle :

Générer des images par étapes : regrouper les personnages, en veillant à ce que chaque groupe ne dépasse pas 4 personnages. Par exemple, 6 personnages peuvent être divisés en 2 groupes de 3, et générer des images pour chaque groupe.
Générer la vidéo à partir des images : utiliser les images de groupe générées à la première étape comme素材 de référence pour générer la vidéo finale.

Avant optimisation

Après optimisation

Saisie de 8 personnages de référence, la vidéo de sortie en montre 9.

Générer 2 images avec les 8 personnages, puis utiliser l'image pour générer la vidéo.

Bruit à la fin de la vidéo

Phénomène typique

Lorsque la vidéo contient une narration, la fin peut présenter un bruit de clic ou un son coupé.

Solutions

Régénérer la vidéo, ou utiliser un outil de montage comme CapCut pour appliquer un fondu audio sur la piste sonore de fin vial'enveloppe de volumeafin d'éliminer le bruit de coupure.

Étapes détaillées (avec CapCut) :

Importer la vidéo générée dans CapCut.
Sélectionner la piste vidéo sur la timeline, cliquer surAudio.
dans la barre d'outils, choisirl'enveloppe de volumeFondu (certaines versions se trouvent dans le menu de base/réglage), et sélectionner un point clé. Une ligne représentant le volume et des points clés apparaissent alors sur la piste audio.
Vers la fin de la vidéo, abaissez le point clé de volume final à 0 pour créer une pente descendante.
Exemple de prompt Seedance 2.0
Prévisualisez pour confirmer que l'audio de fin s'estompe naturellement, sans coupure brutale ni bruit parasite.

Avant optimisation

Après optimisation

Bruit en fin de vidéo

Pas de bruit en fin de vidéo

Prononciation chinoise imprécise

Phénomène typique

Le modèle a tendance à mal prononcer les caractères polyphoniques, rares ou de forme similaire.

Solutions

Remplacez les caractères facilement mal prononcés par deshomophones courants de même prononciationpour éviter les écarts de prononciation et restaurer l'effet audio attendu. Notez que cette solution n'est qu'un moyen d'optimisation et ne peut pas résoudre complètement tous les problèmes de prononciation.

Exemple : remplacez « 螭龙山 » dans le prompt par l'homophone « 吃龙山 ».

Avant optimisation

Après optimisation

La prononciation de « 螭 » dans « 螭龙山 » est incorrecte.

Après correction en « 吃龙山 », la prononciation est correcte.

Référence de timbre vocal imprécise

Phénomène typique

Lors de l'utilisation d'un fichier audio de référence pour spécifier un timbre, le timbre de l'audio final de la vidéo générée présente un écart notable par rapport à la référence.

Solutions

Gardez le style des dialogues vidéo proche du ton et de l'expression de l'audio de référence pour améliorer la fidélité et la stabilité du timbre.

Avant optimisation

Après optimisation

Le timbre ne correspond pas à l'audio d'entrée.

Exemple de prompt Seedance 2.0

L'audio d'entrée

Après avoir ajouté une description du timbre vocal dans le prompt, la correspondance du timbre s'est nettement améliorée.

« Utiliser la voix masculine d'âge moyen, grave, chaude, avec une légère granularité de @audio1 pour dire »

Annexe : Exemples de prompts

Présentation d'exemples de prompts utilisant les modèles de la série Seedance 2.0 dans différents contextes, pour vous aider à réaliser plus précisément le contrôle par référence multimodale et la génération de texte.

Génération de texte

Slogan publicitaire

Modèle de prompt de référence :

« Contenu du texte » + « Moment d'apparition » + « Position d'apparition » + « Manière d'apparition », « Caractéristiques du texte (couleur, style) »
Explication
Seedance 2.0 peut adapter le style de texte au contexte. Si vous avez des exigences strictes sur le rendu du texte, reportez-vous à la sectionRéférence multi-image > Référence Logo.

Exemple de référence :

[Rendu final]

[Prompt]

Style dessin animé fait main, trois personnes sont assises en cercle en mangeant duImage 1poulet frit. L'ambiance est amicale et joyeuse. Puis l'image devient progressivement floue, et le texte « Le bonheur est dans Seedance » apparaît au centre.

[Matériel de référence]

Exemple de prompt Seedance 2.0

▲ Image 1

Sous-titres

Modèle de prompt de référence :

Des sous-titres apparaissent en bas de l'écran, avec le contenu « ... », parfaitement synchronisés avec le rythme audio.

Exemple de référence :

[Rendu final]

[Matériel de référence]

Exemple de prompt Seedance 2.0

[Prompt]

Générer une vidéo avec voix off. Une voix masculine grave et calme dit : « Dans l'immensité de l'univers, notre monde n'est qu'un instant éphémère. Pourtant, en son sein, la vie prospère contre toute attente. » La scène doit passer lentement de la nuit à l'aube, les étoiles disparaissant progressivement, le soleil se levant derrière la montagne. Des sous-titres apparaissent en bas de l'écran en suivant les répliques.

[Rendu final]

[Matériel de référence]

Exemple de prompt Seedance 2.0

[Prompt]

Les deux personnes dans l'image discutent au bureau. La femme parle en premier : « Tu arrives toujours à la dernière minute, tu aimes cette sensation de justesse ? » L'homme répond en souriant : « J'ai mon propre rythme. » La conversation est naturelle et décontractée. Des sous-titres apparaissent en bas de l'écran.

Bulles de dialogue

Modèle de prompt de référence :

« Personnage » dit : « … », une bulle apparaît autour du personnage lorsqu'il parle, avec le dialogue écrit à l'intérieur.

Exemple de référence :

[Rendu final]

[Matériel de référence]

Exemple de prompt Seedance 2.0

[Prompt]

Image 1Les deux personnes dans portent des survêtements et courent sur la piste de l'école. La fille regarde le garçon et dit avec un sourire confiant : « We can definitely do it ! » La caméra passe en plan rapproché du garçon, qui répond avec hésitation : « Are you sure ? » La caméra revient en plan moyen de la fille, qui dit d'un ton léger : « Yes ! » L'émotion est lumineuse et déterminée. Des bulles apparaissent autour des personnages qui parlent, contenant les répliques correspondantes.

[Rendu final]

[Matériel de référence]

Exemple de prompt Seedance 2.0

[Prompt]

RéférencezImage 1,Image 2l'image de la fille, la fille est dans une fraisière. Elle cueille une fraise, en prend une bouchée, sourit et dit : « This is the real deal! » Une bulle apparaît autour de la fille, avec le dialogue écrit à l'intérieur.

Référence image

Le modèle Seedance 2.0 prend en charge les références multi-angles du sujet ainsi que les références multi-images (images de scène, storyboards, etc.).

Si l'ordre des images est important, vous devez lestélécharger dans l'ordreet utiliser dans le promptImage 1,Image 2Image npour une référence précise.

Référence multi-angle du sujet

Il suffit d'indiquer clairement l'objet de référence ; le modèle peut répondre à des instructions incluant, sans s'y limiter, les exemples suivants.

Produit :

Produits 3C numériques


[Rendu final]

[Matériel de référence]

Exemple de prompt Seedance 2.0

[Prompt]

Extrayez l'appareil photo deImage 1,Image 2,Image 3, remplacez l'arrière-plan par du blanc. L'appareil photo est sur une table blanche. La caméra se concentre sur l'appareil photo en gros plan, puis tourne lentement autour de lui pour montrer clairement ses faces avant, latérale et arrière.

Objets domestiques


[Rendu final]

[Matériel de référence]

Exemple de prompt Seedance 2.0

[Prompt]

L'arrière-plan est une scène domestique aux tons chauds. La gourde de l'image de référence est présentée en plan moyen. La caméra s'approche doucement en gros plan de la gourde. Une main entre naturellement dans le cadre, saisit légèrement le corps de la gourde et la soulève. La caméra suit le léger mouvement de rotation de la main pour la montrer.


Personnage :

[Rendu final]

[Prompt]

RéférencezImage 1,Image 2,Image 3l'image de la femme, générez une scène où elle mange un gâteau dans un café.

[Matériel de référence]

Exemple de prompt Seedance 2.0

Référence multi-image

Référence Logo


[Rendu final]

[Matériel de référence]

Exemple de prompt Seedance 2.0

[Prompt]

L'arrière-plan est une passerelle aérienne futuriste d'une ville aux néons clignotants, où se mêlent véhicules volants et publicités holographiques. En référence àImage 2la fille, montrez-la d'abord en plan moyen en train de lâcher une lampe flottante argentée à projection holographique, puis la caméra s'éloigne pour révéler une multitude de lampes flottantes. L'image devient progressivement floue, puis apparaît le logo deImage 1. Le style général est un style d'animation 3D cyberpunk de science-fiction.

Référence multi-sujet


[Rendu final]

[Matériel de référence]

Exemple de prompt Seedance 2.0

[Prompt]

En référence au chat et au chien de l'image, dans un appartement chaleureux, le chien est couché en train de manger des croquettes. Le chat s'approche, tend la patte et touche le chien. Le chien s'arrête de manger en voyant le chat. Le chat se blottit contre le chien. La scène utilise des tons chauds.

Référence multi-élément


[Rendu final]

[Matériel de référence]

Exemple de prompt Seedance 2.0

[Prompt]

La scène se déroule dansl'image 4Le restaurant de, animé par des allées et venues. Image 1La fille dans porte les vêtements deImage 2Elle range des objets sur le comptoir. Image 3Le garçon dans est un client qui s'approche pour demander ses coordonnées. L'image 5Le logo de reste affiché en bas à droite de l'écran.

Référence de storyboard multi-cases


[Rendu final]

[Matériel de référence]

Exemple de prompt Seedance 2.0

[Prompt]

En référence au storyboard de l'image, générez une scène de combat intense. Les différentes compositions des cases du storyboard doivent apparaître dans l'ordre, puis les deux personnages se battent violemment.

Référence de storyboard


[Rendu final]

[Matériel de référence]

Exemple de prompt Seedance 2.0

[Prompt]

RéférencezImage 3Dans la composition du storyboard, une fille attend que son père finisse de cuisiner. Elle dit : « 아빠, 배고파요 ! 밥 다 됐어요 ? », l'apparence de la fille est basée surImage 1Puis la caméra effectue un panoramique horizontal vers la droite pour passer àl'image 4Le cadre et la composition, l'apparence du père est basée surImage 2Le père lui répond : « 거의 다 됐어, 조금만 기다려 ! », puis la caméra revient sur un gros plan du visage légèrement déçu de la fille, qui dit : « 아직 멀었어요 ? 맛있는 냄새 나는데... », puis on passe à un gros plan du visage du père, qui dit : « 이제 진짜 금방이야. '빨리빨리' 하지 말고 손부터 씻고 와 ! ».

Référence vidéo

Le modèle Seedance 2.0 prend en charge la référence vidéo. Il suffit d'indiquer clairement le contenu à générer et l'objet de référence.

Si l'ordre des vidéos est important, vous devez utilisertélécharger dans l'ordreet utiliser dans le promptVidéo1,Vidéo 2Vidéo npour une référence précise.

Référence d'action

Cinéma et télévision


[Rendu final]

[Matériel de référence]

▲ Vidéo 1

Exemple de prompt Seedance 2.0

[Prompt]

RéférencezVidéo1Les actions des personnages et le langage caméra de pour générerImage 2etImage 1Une scène de combat entre, oùImage 2est le personnage de gauche,Image 1est le personnage de droite. Avec une musique de fond intense.

Marketing


[Rendu final]

[Matériel de référence]

▲ Vidéo 1

[Prompt]

RéférencezVidéo1la forme de course du cheval, générez un cheval doré galopant dans une prairie, puis figez sa posture de course élégante pour la transformer en un pendentif en or en forme de cheval.

Référence de mouvement de caméra

[Rendu final]

[Prompt]

RéférencezVidéo1Utiliser le mouvement de caméra de pour réaliser une vidéo conceptuelle d'un parc technologique, avecImage 1Le gratte-ciel de comme centre visuel, en plongée à la première personne, pour mettre en valeurImage 1L'aspect technologique du parc dans.

[Matériel de référence]

▲ Vidéo 1

Exemple de prompt Seedance 2.0

▲ Image 1

Référence d'effet spécial

Cinéma et télévision


[Rendu final]

[Matériel de référence]

▲ Vidéo 1

Exemple de prompt Seedance 2.0

▲ Image 1

[Prompt]

RéférencezVidéo1l'effet de particules dorées, faites en sorte queImage 2le personnage jouant de la flûte soit entouré des mêmes particules.

Effet de gameplay


[Rendu final]

[Matériel de référence]

▲ Vidéo 1

Exemple de prompt Seedance 2.0

▲ Image 1

[Prompt]

RéférencezVidéo1L'effet spécial fait pousser les mêmes ailes à la fille dansImage 1La trajectoire de génération des ailes est identique.

Édition vidéo

Le modèle Seedance 2.0 prend en charge l'édition vidéo : ajout, suppression ou modification d'éléments, prolongation avant ou arrière, et complément de piste.

Si l'ordre des vidéos est important, vous devez utilisertélécharger dans l'ordreet utiliser dans le promptVidéo1,Vidéo 2Vidéo npour une référence précise.

Ajout/Suppression/Modification d'éléments

Ajouter un élément


[Rendu final]

[Matériel de référence]

▲ Vidéo 1

[Prompt]

Ajoutez des snacks comme du poulet frit et de la pizza sur la surface deVidéo1.

Supprimer un élément


[Rendu final]

[Matériel de référence]

▲ Vidéo 1

[Prompt]

Nettoyer Vidéo1Les autres pièces et outils sur la table, garder la table propre et rangée, avec seulement ceux qu'ils tiennent.

Modifier un élément


[Rendu final]

[Matériel de référence]

▲ Vidéo 1

Exemple de prompt Seedance 2.0

▲ Image 1

[Prompt]

Remplacez le parfum dansVidéo1par la crème dansImage 1, en conservant les mêmes actions et mouvements de caméra.

Prolongation vidéo

Remarque
Le modèle découpera automatiquement la partie de jonction pour la synthèse ; les segments originaux de la vidéo d'entrée ne seront pas régénérés.

Prolongation arrière


[Rendu final]

[Matériel de référence]

▲ Vidéo 1

[Prompt]

Générez le contenu aprèsVidéo1. Deux hommes en retard courent vers eux. Les cinq personnes se rencontrent enfin et discutent amicalement.

Prolongation avant


[Rendu final]

[Matériel de référence]

▲ Vidéo 1

[Prompt]

Prolongation avant Vidéo1, plan par-dessus l'épaule de l'homme en blanc. L'homme en blanc dit : « It’s not that bad. You're just stressed. Everyone goes through this, you just need to keep going. »

Complément de piste

Explication
Le modèle Seedance 2.0 accepte jusqu'à 3 segments vidéo en entrée, pour une durée totale ne dépassant pas 15 secondes.
Lors de la génération, les parties de jonction des vidéos de début et de fin seront automatiquement découpées, ne conservant que les segments nécessaires à la synthèse.

Exemple de référence :

[Rendu final]

[Prompt]

Vidéo1, au moment où la feuille touche le sol, elle déclenche un effet de particules dorées. Un vent souffle, puis Vidéo 2.

[Matériel de référence]

▲ Vidéo 1

▲ Vidéo 2

Guide des prompts Seedance 2.0 : formules, exemples et FAQ