Die Doubao Seedance 2.0-Serie (im Folgenden Seedance 2.0-Serie genannt) unterstützt nativ die gemeinsame Generierung von Audio und Video und verfügt über herausragende semantische Verständnisfähigkeiten sowie multimodale Interaktionsfähigkeiten. Dieser Artikel stellt die Verwendung von Prompts und relevante Techniken für die Seedance 2.0-Serie vor, um Ihnen zu helfen, mit diesem Modell effizienter hochwertige Videos nach Ihren Anforderungen zu erstellen.
Grundformel
Die Seedance 2.0-Serie unterstützt die gleichzeitige Referenzierung multimodaler Materialien wie Video, Bild und Audio. Sie kann präzise Merkmale wie Personenmerkmale, Aktionseffekte, visuellen Stil und Sprachfarbe erfassen und den Aufwand für die Prompt-Erstellung erheblich reduzieren. Basierend auf diesem Vorteil können wir das Modell mit einer einfachen Grundformel anleiten, die Eigenschaften multimodaler Materialien nutzt, um schnell Videos zu generieren, die spezifische Anforderungen erfüllen.
Die referenzbasierte Videogenerierung kann in drei Aufgabentypen unterteilt werden: multimodale Referenz, Videobearbeitung und Videoverlängerung. Sie können die grundlegende Prompt-Formel basierend auf dem Aufgabentyp wählen.
Multimodale Referenz
Extrahiert einige Elemente (wie Subjekt, Stil, Szene, Soundeffekte) aus dem Material und generiert ein völlig neues Video.
<Bild N>das/die<Subjekt N>in, generiere...<Video N>das/die<Aktion/Kamerabewegung/Stil/Soundeffekt>in, generiere...<Audio N>die Sprachfarbe in, generiere...Videobearbeitung
Nimmt teilweise oder globale Änderungen am Originalvideo vor. Nicht erwähnte Teile bleiben standardmäßig unverändert.
<Elementmerkmal> + <Auftrittszeitpunkt> + <Auftrittsposition><Video N>, ändere<ursprüngliches Merkmal>darin zu<neues Merkmal>Video verlängern
Setzt das Originalvideo zeitlich fort, wobei Audio-/Videostil, Subjekt und Erzählung konsistent bleiben müssen.
<Video N>in, generiere...<Video 1> + <Übergangsbeschreibung> + gefolgt von <Video 2> + <Übergangsbeschreibung> + gefolgt von <Video 3><Video N>“ zur Bezeichnung des Videos. Verwenden Sie nicht „Referenz<Video N>“, um Fehlinterpretationen als Referenzaufgabe zu vermeiden.Kombinationsaufgaben
Die oben genannten 3 Aufgabentypen können auch kombiniert verwendet werden.
<Bild/Video N>das/die[Referenzdimension], bearbeite streng<Video X>,[spezifischer Bearbeitungsinhalt]Fortgeschrittene Formel
Seedance 2.0 ist im Wesentlichen ein multimodaler KI-Regisseur: Er liest gleichzeitig Ihre Text-Prompts, Bilder, Videos und Audiodaten und zerlegt sie intern in eine „räumliche Ebene“ (was im Bild ist) und eine „zeitliche Ebene“ (wie sich Dinge im Laufe der Zeit ändern), um das Bild zu verstehen und zu generieren.
Daher ist ein guter Prompt keine reine „textartige Beschreibung“, sondern eine „technische Anweisung“: Wer, in welcher Szene, welche Aktion ausführt, wie sich die Kamera bewegt, in welcher zeitlichen Reihenfolge dies geschieht, wird jeweils an die räumliche und zeitliche Ebene übermittelt. Die spezifische Formel lautet wie folgt:
Prompt-Formel: Präzises Motiv + Bewegungsdetails + Szenenumgebung + Licht und Farbe + Kameraführung + Visueller Stil + Bildqualität + Einschränkungen
Einfach gesagt: Legen Sie zuerst fest, „wer“ „was tut“, dann geben Sie an, „wo“ und „welche Atmosphäre“, dann sagen Sie dem Modell, „wie gefilmt wird“, und schließlich grenzen Sie das Ergebnis mit Stil, Bildqualität und Einschränkungen ein. Im Folgenden werden die einzelnen Elemente detailliert aufgeschlüsselt.
1 Subjekt definieren
In tatsächlich referenzierten Materialien, wie einem Bild, gibt es oft mehrere Subjekte. Um ein bestimmtes Objekt im Material präzise zu referenzieren, muss das Subjekt klar definiert werden. Subjekte können Personen, Requisiten, Szenen usw. sein.
<Bild/Video N>das/die[Hauptmerkmal der Figur]definiert als<Subjekt N>Wenn mehrere Materialien auf dasselbe Motiv verweisen, sollte eine einheitliche Bindung erfolgen:
[...],Bild2das/die[...]definiert als **<Subjekt N>**Wenn mehrere Hauptmotive im Video vorhanden sind, müssen diese einzeln definiert und mit Tags unterschieden werden. Die Tags sollten eindeutig und stabil sein und in der folgenden Beschreibung durchgängig verwendet werden, um Verwechslungen zu vermeiden.
<Subjekt N>@<Bild N>, um die Bindung zwischen Subjekt und Material zu betonen. Beispiel: Zhang San@Bild 1.<Bild/Video N>zur Referenzierung des Subjekts verwendet werden. Da das Modell die Asset-ID nicht direkt mit dem referenzierten Inhalt verknüpfen kann, darf die Asset-ID nicht direkt<Bild/Video N>.
2 Verwendung von Storyboard-Zeitabläufen
Die interne Modellierung des Modells ist räumlich und zeitlich entkoppelt. Daher ist die ideale Form für einen Prompt eines komplexen Videos ein zeitachsenbasiertes Storyboard: Zerlegen Sie das Video in mehrere Einstellungen und beschreiben Sie jede Einstellung dynamisch in der Reihenfolge des Ereignisablaufs: Wer + wo + was tun + wie sich die Kamera bewegt.
Praktischer Tipp
Verwenden Sie die Einstellungsreihenfolge, schreiben Sie für jedes Videosegment ein einfaches „Einstellung 1 / Einstellung 2 / Einstellung 3“-Storyboard und fügen Sie es dann zu einem vollständigen Prompt zusammen.
Spezifische Regeln
Einstellung 1,Einstellung 2,Einstellung 3als Kennzeichnungen, organisieren Sie den Inhalt in der Reihenfolge des Ereignisablaufs (Hauptsache vor Nebensache). Die Dauer jedes Segments ist nicht strikt begrenzt; lassen Sie das Modell vorzugsweise den Rhythmus natürlich basierend auf der Handlung generieren.3 Anforderungen an die Aktionsbeschreibung
Abstrakte Emotion | Externalisiert in Handlungen und Details |
Traurigkeit | Kopf gesenkt, Schultern leicht zitternd, Augenränder gerötet, Finger krampfhaft den Stoff des Kleidungsstücks umklammernd, Tränen in den Augenwinkeln, aber nicht fallend. |
Freude | Ein unkontrollierbares Lächeln umspielt die Lippen, die Augenbrauen und der Blick werden weich, der Schritt wird leicht, unbewusst summt man eine Melodie vor sich hin, kann nicht anders, als sich einmal um die eigene Achse zu drehen. |
Nervosität / Angst | Häufig auf die Uhr schauen, ununterbrochen mit den Fingern auf den Tisch trommeln, flache Atmung, ausweichender Blick, unbewusst an den Nägeln kauen. |
Wut | Fäuste geballt, Kiefer angespannt, Brustkorb hebt und senkt sich heftig, Blick scharf wie ein Messer, Worte zwischen zusammengebissenen Zähnen hervorpressen. |
Erleichterung | Ein langes, tiefes Ausatmen, die angespannten Schultern entspannen sich vollständig, ein langes, leichtes Lächeln erscheint im Gesicht, der Blick schweift in die Ferne. |
4 Kamerabewegungsbeschreibung
Das Modell versteht Kamerabewegungen sehr gut. Verwenden Sie einfach Standardbegriffe wie „Halbtotale, Nahaufnahme, Panorama, langsamer Schwenk, ruhiger Seitwärts-Schwenk, feste Kamera“.
5 Bildqualität, Stil und Einschränkungen
Bildqualität, Stil und Einschränkungen sind entscheidend für die Steuerung der Videogenerierung. Sie grenzen den kreativen Rahmen des Modells ein, vereinheitlichen Bildqualität und künstlerischen Stil und vermeiden gleichzeitig Bildfehler und zufällige Abweichungen. Sie sind eine notwendige Konfiguration, um stabile und konforme Endergebnisse zu gewährleisten.
1 Bildqualität
Definiert Bildschärfe, Detailtextur und Licht-/Schattenqualität, verbessert die grundlegende Bildqualität des Ergebnisses.
Beispiele: Hochauflösend, detailreich, filmische Qualität, natürliche Farben, weiches Licht und Schatten
2 Stil
Legt den gesamten künstlerischen Stil und die visuelle Stimmung fest, vereinheitlicht die künstlerische Atmosphäre des Bildes.
Beispiele: Cyberpunk mit kühlen Blau-Lila-Tönen, Retro-Film, japanisch frisch
3 Einschränkungen
Einschränkungen sind sehr wichtig, um Bildfehler, Verformungen, Zusammenbrüche und unangemessene Elemente effektiv zu vermeiden und die Generierungsgrenzen und -stabilität einzuschränken.
Häufige Einschränkungsvorlagen:
6 Praxisbeispiel
Zeigt, wie die oben vorgestellte fortgeschrittene Formel und die einzelnen Elemente zum Schreiben von Prompts verwendet werden.
Materialvorbereitung:
Prompt:
Das Mädchen aus @Bild 1 als Hauptfigur, @Bild 2 als Stilreferenz für das Wohnheimszenario, Kameraführung nach @Video 1.
Einstellung 1: Abenddämmerung, Mädchen @Bild 1 geht leichtfüßig zurWohnheimtür @Bild 2, Kamera folgt ruhig in mittlerer Einstellung, warmes gelbes Sonnenlicht fällt durch das Fenster in den Flur, sie hält kurz an der Tür inne, atmet tief durch, Gesichtsausdruck leicht nervös.
Einstellung 2:Mädchen @Bild 1 öffnet die Tür und betritt das Wohnheim, Kamera schwenkt auf die Innenaufnahme in mittlerer Einstellung, Mitbewohnerinnen blicken beim Bücherordnen auf, eine fragt lächelnd {Wie war's, bestanden?}, Kamera wechselt langsam zwischen Halbkörper-Nahaufnahmen der Personen.
Einstellung 3:Mädchen @Bild 1 senkt zuerst den Kopf mit enttäuschtem Ausdruck, Kamera zeigt ihre Nahaufnahme, dann hebt sie den Kopf, kann das Lachen nicht unterdrücken, lacht laut und sagt {Hab euch reingelegt}, Mitbewohnerinnen jagen sie spielerisch, Kamera zoomt langsam heraus, endet in einer Totalen des fröhlichen Wohnheims.
Durchgehend hochauflösender, filmischer Dokumentarstil, warme Farbtöne, weiches Licht; Gesichter stabil und unverzerrt, Bewegungen natürlich und flüssig, ohne Ruckeln oder Flackern; Umgebungsgeräusche verschmelzen natürlich mit @Audio 1.
Materialvorbereitung:
Prompt:
Die Frau in Rot aus @Bild 1 als Protagonistin, die Frau in Schwarz aus @Bild 2 als Gegnerin, Szene nach @Bild 3 (Klippen-Bambuswald), Kameraführung und Bewegungsrhythmus nach @Video 1, Hintergrundgeräusche synchron mit @Audio 1.
Einstellung 1: Abenddämmerung, Kamera vonFrau in Rot @Bild 1 Halbtotale seitlich, langsame Kamerafahrt nach vorne. Sie steht am Rand einer Klippe, hebt die Weinflasche und trinkt. Ihre Kleidung weht sanft im Bergwind. Die Kamera umkreist sie eine halbe Runde, fährt von vorne auf ihren Rücken zu. In der Ferne ist schemenhaft eine schwarz gekleidete Gestalt im Bambuswald zu erkennen.
Einstellung 2: Die Kamera zoomt und blendet zur Totale über. Aus der Vogelperspektive überblickt man die gesamte Klippe und den Bambuswald. Die beiden Personen stehen an den Enden der Klippe. Der Bergwind lässt Kleidung und Staub aufwirbeln. Das Tempo beschleunigt sich leicht mit dem Trommelrhythmus.
Einstellung 3: Die Kamera schneidet zurück zur Nahaufnahme am Boden. Die beiden ziehen langsam ihre Schwerter und stehen sich gegenüber. Die Frau in Rot @Bild 1 Ihr Blick wechselt von lässig zu eiskalt. Die Frau in Schwarz @Bild 2 Ihr Blick ist entschlossen, die Schwertspitze zittert leicht. Die Kamera folgt ruhig, wie sie sich im Kreis bewegen, und hält schließlich auf eine Großaufnahme einen Augenblick vor dem Zusammenprall der beiden Schwerter.
Das Gesamtbild hat eine filmische Atmosphäre von „Regen und Nebel in der Jianghu-Welt“. Kalte Farbtöne, geringe Sättigung, Filmkorn-Textur, reichhaltige Licht- und Schattenabstufungen. Die Proportionen von Gesichtern und Körpern der Figuren sind stabil und verzerren nicht. Die Bewegungen sind flüssig und natürlich, nicht steif, ohne Ruckeln oder Verzerrungen.
Weitere Tipps
Texterzeugung
Die Seedance 2.0-Serie unterstützt die Generierung von gebräuchlichem Text. Das Modell kann basierend auf dem Kontextautomatischeinen passenden Stil und Farbe zuweisen. Es unterstützt auch dieAngabevon Farbe, Stil, Erscheinungsweise, -zeitpunkt und -position des Textes im Prompt. Verwenden Sie beim Schreiben vorzugsweisegebräuchliche Zeichen, vermeiden SieSonderzeichenundSpezialsymbole, um eine optimale Darstellung zu gewährleisten. Derzeit werden Szenarien wie Werbeslogans, Untertitel und Sprechblasen unterstützt. Spezifische Formulierungen und Beispiele finden Sie unterTexterzeugung.
Video-Verlängerung vs. Segment-Zusammenfügung
In der Praxis werden beide Methoden oft kombiniert, z. B. zuerst eine durchgehende Dialogszene verlängern und dann Leeraufnahmen oder Übergangssegmente einfügen, um sowohl Immersion als auch Rhythmuswechsel zu erreichen.
Strategie zur Materialkonfiguration
In der Regel werden die Materialien in vier „Funktionsrollen“ unterteilt:
Empfohlene Konfiguration (insgesamt 4–5 Materialien): 1–2 Charakterbilder (Nahaufnahme/Ganzkörper) + 1 Szenenbild + 1 Kamerabewegungsvideo + 1 Audiospur.
Hinweise
Sprachliche Normen
Die Dialogsprache muss einheitlich sein, eine Mischung aus Chinesisch und Englisch ist zu vermeiden (außer bei Eigennamen).
Normen für Sonderzeichen
Die sinnvolle Verwendung von Symbolen in Prompts hilft dem Modell, verschiedene Informationstypen genau zu verstehen:
Informationstyp | Symbol | Beispiele |
Musik | () | (Im Hintergrund läuft schneller Rock) |
Soundeffekt | <> | <In der Ferne ist Hundegebell zu hören> |
Dialog | {} | {Hallo, Welt}. Wenn der Dialog in einer kleinen Sprache (nicht Chinesisch/Englisch) ist, muss die Sprache angegeben werden, z.B.: Sage auf Japanisch {こんにちは}. |
Untertitel | 【】 | 【Kapitel 1: Aufbruch】 |
Häufige Probleme
Charakter-ID-Drift
Typisches Phänomen
Das generierte Charakterbild stimmt nicht mit dem Referenzbild überein, oder es kommt während des Videos zu einem „Gesichtstausch“ (ID-Drift), was dazu führt, dass die Figur einem Prominenten ähnelt und von der Prüfung blockiert wird.
Ursachenanalyse
Unzureichende Wirksamkeit des Gesichtsreferenzbildes
Lösung
Stärkung der Unabhängigkeit und des Gewichts der Gesichtsreferenz:
Vor der Optimierung | Nach der Optimierung |
Die Figur im Video „wechselt mitten drin das Gesicht“, ähnelt einem Prominenten. | Das Gesicht bleibt während des gesamten Videos konsistent mit dem Referenzbild. |
Video enthält Untertitel
Typisches Phänomen
Der Prompt forderte keine Untertitel, aber das generierte Video enthält welche.
Lösung
Video enthält Logo/Wasserzeichen
Typisches Phänomen
Der Prompt erwähnte keine Wasserzeichen, aber das generierte Video enthält Logos/Wasserzeichen anderer Videoplattformen.
Lösung
Fügen Sie klare Einschränkungen im Prompt hinzu: „Kein Wasserzeichen generieren“, „Kein Logo generieren“.
Stil-Drift
Typisches Phänomen
Es wird ein 2D- oder 3D-Animationsstil erwartet, aber die eingegebenen Referenzbilder sind eher fotorealistisch, und der Prompt betont den Stil nicht. Das generierte Video driftet dann wahrscheinlich in einen fotorealistischen Stil ab.
Lösung
Fügen Sie klare Stilbeschränkungen im Prompt hinzu, z. B. „2D-Japan-Anime-Stil“, „3D-Chinese-Comic-Stil“. Für eine präzisere Stilkontrolle wird empfohlen, die Referenzbilder zunächst in den Zielstil zu konvertieren, bevor das Video generiert wird.
Vor der Optimierung | Nach der Optimierung |
Der Xianxia-Stil driftet in einen realistischen Stil ab. | Behalte den 3D-CG-Xianxia-Stil bei. |
Sprung an der Verbindungsstelle verlängerter Videos
Typisches Phänomen
Nach der Verwendung der Videoverlängerungsfunktion zur Generierung eines neuen Videos und dessen Zusammenfügung mit dem Originalvideo kann es an der Verbindungsstelle zu Bildsprüngen oder Rückwärtssprüngen kommen.
Lösung
Derzeit wird empfohlen, dies durch Nachbearbeitung zu beheben, indem Schlüsselbilder angeglichen werden. Eine grundlegende Optimierung durch Modelliterationen ist in Zukunft geplant.
Vor der Optimierung | Nach der Optimierung |
An den Übergängen (5. Sekunde, 20. Sekunde) erscheintDas Bild springt sofortoderDer Inhalt geht zurück | Die Übergänge sind fließender. |
Zwillinge-Problem
Typisches Phänomen
In Szenen mit vielen Personen, wenn Dreiviertelansichten als Referenzmaterial verwendet werden, treten im generierten Video leicht zwei identische Personen auf.
Ursachenanalyse
Lösung
Definieren Sie jede Person im Prompt klar und geben Sie die Entsprechung zwischen Charakter und Referenzbild an. Es wird empfohlen, nach dem Personennamen das entsprechende Referenzbild zu notieren und ein einheitliches Format beizubehalten.
Beispiel: Zhang San (entspricht Bild 1) wirft das grüne Sparbuch auf den stehenden Li Si (entspricht Bild 2).
2. Globale Einschränkungsanweisung hinzufügen
Fügen Sie am Ende des Prompts eine feste Einschränkung hinzu:Im gesamten Video ist es verboten, Figuren mit vollständig identischem Aussehen, Kleidung oder Accessoires zu zeigen. Keine Doppelgänger- oder Zwillings-Effekte generieren. Im selben Bild nur die entsprechende einzelne Person zeigen, keine Wiederholung von Personen..
3. Referenzmaterial optimieren
Verwenden Sie vorzugsweise einzelne, unabhängige Fotos als Personenreferenz. Die Verwendung von Dreiviertel- oder Mehrfachansichten wird nicht empfohlen.
4. Prompt optimieren und straffen
Verwenden Sie nicht das gesamte Drehbuch als Prompt. Zu umfangreicher Text führt zu Verwirrung beim Modell. Reduzieren Sie irrelevante Formulierungen und stellen Sie sicher, dass die Anweisungen klar und fokussiert sind.
Vor der Optimierung | Nach der Optimierung |
In der 8. Sekunde des Bildes erscheinen „Zwillinge“. |
Verschlechterung der Videoqualität bei Verlängerung
Typisches Phänomen
Bei Verwendung eines vom Modell generierten Videos als Eingangsmaterial für eine Verlängerung kommt es zu einer Verschlechterung der Bildqualität. Mehrfache Verlängerungen verstärken diesen Effekt, insbesondere im Gesichtsbereich treten fleckige Farbblöcke auf.
Lösung
Derzeit kann die Qualitätsverschlechterung durch folgende Methoden gemildert werden. Eine grundlegende Optimierung durch Modelliterationen ist in Zukunft geplant:
Vor der Optimierung | Nach der Optimierung |
Schreibe das Modellprodukt direkt fort. | Wandle das Modellprodukt zuerst in ein Weißmodell-Video um und schreibe es dann fort. |
Spezialeffekte entsprechen nicht den Erwartungen
Typisches Phänomen
Bei der Beschreibung bestimmter Effekte durch Text im Prompt kann es vorkommen, dass der generierte Effekt nicht den Erwartungen entspricht. Beispiel: Der Prompt gibt vor: „Die Zahl ‚2999‘ erscheint in einem Countdown-Animation“, aber der generierte Zahlen-Roll-Effekt zeigt ungeordnete Sprünge und entspricht nicht der Standard-Countdown-Logik.
Lösung
Es wird empfohlen,Referenzvideoszur Definition von Effekten zu verwenden: Geben Sie das Video mit dem gewünschten Effekt als Referenzmaterial in das Modell ein, damit es die Form und Bewegungslogik des Effekts genau versteht. Das Ergebnis entspricht dann eher den Erwartungen. Beispiel: Die Art, wie die Zahl „2999“ erscheint, bezieht sich auf Video 1.
Vor der Optimierung | Nach der Optimierung |
Der Zahlen-Scroll-Effekt hat ein deutliches Gefühl von ungeordnetem Springen. | Nachdem das korrekte Video mit dem Zahlen-Scroll-Effekt hinzugefügt wurde, entspricht das Effektergebnis den Erwartungen. Effekt-Animation |
Zu viele Referenzpersonen
Typisches Phänomen
Wenn die Anzahl der Referenzpersonen 4 übersteigt, sinkt die Stabilität des Modelloutputs. Das generierte Video kann dann eine falsche Anzahl von Personen (z. B. zu wenige, zu viele) oder sich wiederholende Personen aufweisen.
Lösung
Derzeit kann das Problem durch folgende Methoden gemildert werden. Eine grundlegende Optimierung durch Modelliterationen ist in Zukunft geplant:
Vor der Optimierung | Nach der Optimierung |
8 Referenzfiguren eingegeben, das ausgegebene Video zeigt 9 Personen. | Generiere zuerst 2 Bilder aus den 8 Figuren, dann verwende Bild-zu-Video. |
Rauschen am Videoende
Typisches Phänomen
Wenn das Video einen Voice-Over enthält, kann am Ende des Videos ein abruptes Klickgeräusch oder abgeschnittenes Rauschen auftreten.
Lösung
Generieren Sie das Video neu oder verwenden Sie ein Schnitttool wie CapCut, um die Tonspur am Ende mit einerLautstärkehüllkurveauszublenden und so das abgeschnittene Rauschen zu eliminieren.
Konkrete Schritte (mit CapCut):

Vor der Optimierung | Nach der Optimierung |
Am Ende gibt es Rauschen. | Am Ende gibt es kein Rauschen. |
Ungenauigkeiten in der chinesischen Aussprache
Typisches Phänomen
Das Modell neigt dazu, bei mehrsilbigen Zeichen, seltenen Zeichen und ähnlich aussehenden Zeichen Fehler zu machen.
Lösung
Ersetzen Sie schwer auszusprechende Zeichen durchgebräuchliche Homophone mit identischer Aussprache, um Ausspracheabweichungen zu vermeiden und die gewünschte Audioqualität wiederherzustellen. Beachten Sie, dass dies nur eine Optimierungsmaßnahme ist und nicht alle Ausspracheprobleme vollständig beheben kann.
Beispiel: Ersetzen Sie „螭龙山“ im Prompt durch das Homophon „吃龙山“.
Vor der Optimierung | Nach der Optimierung |
Die Aussprache von „螭“ in „螭龙山“ ist falsch. | Nach der Änderung zu „吃龙山“ ist die Aussprache korrekt. |
Ungenauigkeiten bei der Stimmreferenz
Typisches Phänomen
Bei Verwendung einer Referenz-Audio zur Stimmvorgabe weicht die endgültige Stimme im generierten Video deutlich von der Referenz ab.
Lösung
Vor der Optimierung | Nach der Optimierung |
Die Klangfarbe stimmt nicht mit dem eingegebenen Audio überein. Das eingegebene Audio | Nachdem die Beschreibung der Klangfarbe im Prompt hinzugefügt wurde, hat sich die Übereinstimmung der Klangfarbe deutlich verbessert. „Sage es mit der Stimme eines tiefen, warmen, mittelalten Mannes mit feiner Körnigkeit aus @Audio 1“ |
Anhang: Prompt-Beispiele
Zeigt Beispiele für Prompts mit Seedance 2.0-Modellen in verschiedenen Szenarien, um Ihnen zu helfen, multimodale Referenzsteuerung und Textgenerierung präziser umzusetzen.
Texterzeugung
Slogan
Prompt-Referenzvorlage:
„Textinhalt“ + „Erscheinungszeitpunkt“ + „Erscheinungsposition“ + „Erscheinungsweise“, „Texteigenschaften (Farbe, Stil)“
Mehrfachbild-Referenz > Logo-Referenz.
Referenzbeispiel:
[Endergebnis]
[Prompt]
Handgezeichneter Comic-Stil, drei Personen sitzen zusammen und essen das Brathähnchen ausBild1, freundliche und fröhliche Atmosphäre, dann wird das Bild allmählich unscharf, in der Mitte erscheint der Text „Freude liegt in Seedance“.
[Referenzmaterial]

▲ Bild 1
Untertitel
Prompt-Referenzvorlage:
Am unteren Bildrand erscheint ein Untertitel. Der Inhalt des Untertitels lautet „...“. Der Untertitel muss vollständig synchron mit dem Audio-Rhythmus sein.
Referenzbeispiel:
[Endergebnis]
[Referenzmaterial]

[Prompt]
Erstelle ein Video mit Voice-Over. Eine tiefe, ruhige Männerstimme sagt: „Im gewaltigen Universum ist unsere Welt nur ein flüchtiger Augenblick. Doch darin gedeiht das Leben ungeachtet aller Widrigkeiten.“ Die Szene sollte langsam von der Nacht in die Morgendämmerung übergehen, die Sterne allmählich verschwinden und die Sonne hinter den Bergen aufgehen. Am unteren Bildrand erscheint der Untertitel entsprechend dem gesprochenen Text.
[Endergebnis]
[Referenzmaterial]

[Prompt]
Die beiden Personen auf dem Bild unterhalten sich im Büro. Die Frau spricht zuerst und sagt: „Du schaffst es jedes Mal genau zur letzten Minute. Genießt du dieses Gefühl, genau richtig zu sein?“ Der Mann antwortet lächelnd: „Ich habe meinen eigenen Rhythmus.“ Während die Figuren sprechen, wirkt der Dialog lässig und natürlich. Am unteren Bildrand erscheint der entsprechende Dialog als Untertitel.
Sprechblasen
Prompt-Referenzvorlage:
„Charakter“ sagt: „…“, während der Charakter spricht, erscheint eine Sprechblase um ihn herum, in der der Dialog steht.
Referenzbeispiel:
[Endergebnis]
[Referenzmaterial]

[Prompt]
Bild1Die beiden Personen aus tragen Sportkleidung und laufen auf dem Schulhof. Das Mädchen sieht den Jungen an und sagt selbstbewusst lächelnd: „We can definitely do it!“ Die Kamera schneidet zur Nahaufnahme des Jungen, der zögernd antwortet: „Are you sure?“ Die Kamera schneidet zurück zur halbnahen Einstellung des Mädchens, das mit leichter Stimme sagt: „Yes!“ Die Stimmung ist hell und entschlossen. Um die sprechende Figur herum erscheinen Sprechblasen mit dem entsprechenden Dialog.
[Endergebnis]
[Referenzmaterial]

[Prompt]
ReferenziereBild1,Bild2 des Mädchens, das Mädchen ist auf einem Erdbeerfeld, pflückt eine, beißt hinein, lächelt und sagt: „This is the real deal!“ Um das Mädchen erscheint eine Sprechblase mit dem Dialog.
Bildreferenz
Die Seedance 2.0-Modellreihe unterstützt sowohl Multi-Perspektiv-Referenzen des Hauptmotivs als auch mehrere Bilder wie Szenenbilder und Storyboards.
Wenn eine bestimmte Reihenfolge der Bilder erforderlich ist, sollten Sie diesein der richtigen Reihenfolge hochladen. Im Prompt können SieBild1,Bild2…Bildnzur genauen Referenzierung verwenden.
Multi-Perspektiv-Referenz des Hauptmotivs
Geben Sie das Referenzobjekt klar an. Das Modell kann Anweisungen wie die folgenden Beispiele verarbeiten.
Produkt:
3C-Digitalprodukte
[Endergebnis]
[Referenzmaterial]

[Prompt]
Extrahiere die Kamera ausBild1,Bild2,Bild3, ersetze den Hintergrund durch Weiß, die Kamera steht auf einem weißen Tisch, die Kamera fokussiert die Kamera in Nahaufnahme, dann dreht sie sich langsam um die Kamera als Motiv, zeigt Vorder-, Seiten- und Rückseite deutlich.
Haushaltsgegenstände
[Endergebnis]
[Referenzmaterial]

[Prompt]
Hintergrund: warme Wohnszene, mittlere Einstellung zeigt die Thermoskanne aus dem Referenzbild, Kamera fährt ruhig auf die Nahaufnahme der Thermoskanne zu, eine Hand von außerhalb des Bildes greift natürlich nach der Kanne und hebt sie an, Kamera folgt der leichten Drehbewegung der Hand zur Präsentation.
Charakter:
[Endergebnis]
[Prompt]
ReferenziereBild1,Bild2,Bild3 der Frau, generiere eine Szene, in der sie in einem Café Kuchen isst.
[Referenzmaterial]

Mehrfachbild-Referenz
Logo-Referenz
[Endergebnis]
[Referenzmaterial]

[Prompt]
Hintergrund: futuristische, neonbeleuchtete Himmelskorridore, Fluggeräte und holografische Werbung vermischt, ReferenzBild2 des Mädchens, zuerst mittlere Einstellung des Mädchens, das eine silberne schwebende Laterne mit Hologramm freilässt, dann Kamera zoomt heraus, zeigt unzählige schwebende Laternen, Bild wird allmählich unscharf, dann erscheint das Logo vonBild1, Gesamtstil: 3D-Cyberpunk-Science-Fiction-Animation.
Multi-Motiv-Referenz
[Endergebnis]
[Referenzmaterial]

[Prompt]
Referenzbild der Katze und des Hundes, in einer gemütlichen Wohnung frisst der Hund sein Futter, die Katze kommt, berührt den Hund mit der Pfote, der Hund hört auf zu fressen, die Katze schmiegt sich an den Hund. Warme Farbtöne.
Multi-Element-Referenz
[Endergebnis]
[Referenzmaterial]

[Prompt]
Die Szene spielt inBild4dem Restaurant in . Im Restaurant herrscht reger Betrieb.
Bild1Das Mädchen aus trägtBild2die Kleidung aus und räumt gerade die Gegenstände auf der Theke auf.
Bild3Der Junge aus ist ein Kunde. Er tritt vor und möchte das Mädchen nach ihrer Kontaktmöglichkeit fragen.
Bild5Das Symbol aus wird stets in der unteren rechten Ecke des Bildes angezeigt.
Multi-Panel-Storyboard-Referenz
[Endergebnis]
[Referenzmaterial]

[Prompt]
Referenz des Storyboards im Bild, generiere eine intensive Kampfszene. Die einzelnen Panel-Kompositionen des Bildes sollen nacheinander erscheinen, dann folgt der heftige Kampf der beiden.
Storyboard-Referenz
[Endergebnis]
[Referenzmaterial]

[Prompt]
ReferenziereBild3Die Storyboard-Komposition in . Ein Mädchen wartet darauf, dass ihr Vater das Essen kocht. Sie sagt: „아빠, 배고파요! 밥 다 됐어요?“. Das Aussehen des Mädchens basiert aufBild1. Dann schwenkt die Kamera nach rechts und wechselt zuBild4Szene und Komposition. Das Aussehen des Vaters basiert aufBild2. Der Vater antwortet ihr: „거의 다 됐어, 조금만 기다려!“. Dann schneidet die Kamera zurück zu einer Nahaufnahme des leicht enttäuschten Gesichtsausdrucks der Tochter. Sie sagt: „아직 멀었어요? 맛있는 냄새 나는데...“. Dann wechselt es zu einer Nahaufnahme des Gesichts des Vaters. Er sagt: „이제 진짜 금방이야. ‚빨리빨리‘ 하지 말고 손부터 씻고 와!“.
Videoreferenz
Die Seedance 2.0-Modellreihe unterstützt Videoreferenzen. Geben Sie einfach den zu generierenden Inhalt und das Referenzobjekt klar an.
Wenn eine bestimmte Reihenfolge der Videos erforderlich ist, sollten Siein der richtigen Reihenfolge hochladen. Im Prompt können SieVideo 1,Video2…Videonzur genauen Referenzierung verwenden.
Bewegungsreferenz
Film/Fernsehen
[Endergebnis]
[Referenzmaterial]
▲ Video 1

[Prompt]
ReferenziereVideo 1Die Bewegungen der Figuren und die Kamerasprache von , generiereBild2undBild1eine Kampfszene zwischen und .Bild2ist die linke Figur,Bild1ist die rechte Figur. Mit intensiver Hintergrundmusik.
Marketing
[Endergebnis]
[Referenzmaterial]
▲ Video 1
[Prompt]
ReferenziereVideo 1 die Laufbewegung des Pferdes, generiere ein goldenes Pferd, das über die Prärie galoppiert, dann friere seine anmutige Laufhaltung ein, verwandle es in einen pferdeförmigen Goldanhänger.
Kameraführungs-Referenz
[Endergebnis]
[Prompt]
ReferenziereVideo 1Die Kameraführung von , erstelle ein Konzeptvideo für einen Technologiepark. MitBild1dem Hochhaus in als visuellem Zentrum, ebenfalls aus der Ich-Perspektive nach unten fliegend, um dieBild1technologische Atmosphäre des Parks in widerzuspiegeln.
[Referenzmaterial]
▲ Video 1

▲ Bild 1
Effektreferenz
Film/Fernsehen
[Endergebnis]
[Referenzmaterial]
▲ Video 1

▲ Bild 1
[Prompt]
ReferenziereVideo 1 den goldenen Partikeleffekt, lass die Person inBild2 beim Flötenspiel denselben Partikeleffekt um sich herum haben.
Gameplay-Effekte
[Endergebnis]
[Referenzmaterial]
▲ Video 1

▲ Bild 1
[Prompt]
ReferenziereVideo 1Der Effekt von , lässtBild1Das Mädchen in bekommt die gleichen Flügel. Die Entstehungsbahn der Flügel ist identisch.
Videobearbeitung
Die Seedance 2.0-Modellreihe unterstützt Videobearbeitung, einschließlich Hinzufügen, Löschen oder Ändern von Elementen, Verlängerung des Videos vorwärts oder rückwärts sowie Auffüllen von Lücken.
Wenn eine bestimmte Reihenfolge der Videos erforderlich ist, sollten Siein der richtigen Reihenfolge hochladen. Im Prompt können SieVideo 1,Video2…Videonzur genauen Referenzierung verwenden.
Elemente hinzufügen/löschen/ändern
Element hinzufügen
[Endergebnis]
[Referenzmaterial]
▲ Video 1
[Prompt]
Füge auf der Arbeitsfläche vonVideo 1 Snacks wie Brathähnchen und Pizza hinzu.
Element löschen
[Endergebnis]
[Referenzmaterial]
▲ Video 1
[Prompt]
EntferneVideo 1die anderen Teile und Werkzeuge auf dem Tisch. Halte die Tischplatte sauber und ordentlich. Auf dem Tisch befinden sich nur die Gegenstände in ihren Händen.
Element ändern
[Endergebnis]
[Referenzmaterial]
▲ Video 1

▲ Bild 1
[Prompt]
Ersetze das Parfüm inVideo 1 durch die Creme inBild1, Bewegung und Kameraführung bleiben unverändert.
Video verlängern
Rückwärts verlängern
[Endergebnis]
[Referenzmaterial]
▲ Video 1
[Prompt]
GeneriereVideo 1 den Inhalt danach, zwei verspätete Männer rennen zu ihnen, die fünf treffen sich endlich und unterhalten sich freundlich.
Vorwärts verlängern
[Endergebnis]
[Referenzmaterial]
▲ Video 1
[Prompt]
Vorwärts verlängernVideo 1, Über-die-Schulter-Aufnahme des Mannes in Weiß, er sagt: „It’s not that bad. You're just stressed. Everyone goes through this, you just need to keep going.“
Lücken auffüllen
Referenzbeispiel:
[Endergebnis]
[Prompt]
Video 1, im Moment des fallenden Blattes entsteht ein goldener Partikeleffekt, ein Windstoß weht, gefolgt vonVideo2.
[Referenzmaterial]
▲ Video 1
▲ Video 2