Guía de creación de Seedance 2.0

De una idea a un video controlable

Domina la referencia multimodal, definición del sujeto, secuencia de storyboard, movimiento de cámara, edición de video y técnicas de extensión. La página incluye casos completos y preguntas frecuentes. Mira y copia para generar al instante.

La serie Doubao Seedance 2.0 (en adelante, serie Seedance 2.0) admite de forma nativa la generación conjunta de audio y video, con una comprensión semántica excepcional y capacidades de interacción multimodal. Este artículo presenta el uso de indicaciones (prompts) y técnicas relacionadas para los modelos de la serie Seedance 2.0, ayudándole a generar videos de alta calidad que cumplan con sus requisitos de manera más eficiente.

Nota
Todos los materiales visuales (imágenes, videos) y de audio presentados en esta guía son generados de forma autónoma por los modelos de generación visual de las series Seedance/Seedream.

Fórmula básica

La serie Seedance 2.0 admite la referencia simultánea a materiales multimodales como video, imagen y audio, permitiendo fijar con precisión características como la apariencia de personas, efectos de acción, estilo visual y tono de voz, reduciendo significativamente la dificultad de escribir indicaciones. Basándose en esta ventaja, podemos guiar al modelo con una fórmula básica simple, aprovechando las características de los materiales multimodales para generar rápidamente videos que satisfagan necesidades específicas.

La generación de video con referencia se puede dividir en tres tipos de tareas: referencia multimodal, edición de video y extensión de video. Puede elegir la fórmula básica de indicaciones según el tipo de tarea.

Referencia multimodal

Extraer algunos elementos del material (como sujeto, estilo, escena, efecto de sonido) para generar un video completamente nuevo.

Escenarios aplicables: Transferencia de movimiento, reutilización de sujeto, inspiración de ambiente, etc.
Formato recomendado:
Referencia de imagen: Referencia a<ImagenN> en<SujetoN>, generar...
Referencia de video: Referencia a<VideoN> en<Movimiento/Encuadre/Estilo/Efecto de sonido>, generar...
Referencia de audio: Referencia a<AudioN> del tono de voz, generar...

Edición de video

Realizar modificaciones parciales o globales sobre el video original. Las partes no mencionadas permanecen sin cambios por defecto.

Escenarios aplicables: Reemplazo local, eliminación de sujeto, modificación de atributos, etc.
Formato recomendado:
Agregar elementos: Describir claramente<Característica del elemento> + <Momento de aparición> + <Ubicación de aparición>
Modificar elementos: Editar estrictamente<VideoN>, cambiando<Característica original> por<Nueva característica>
Eliminar elementos: Indicar claramente el elemento a eliminar; para los elementos que permanecen sin cambios, enfatizarlos en la indicación para obtener mejores resultados.

Extender video

Continuar el video original en la dimensión temporal, manteniendo la coherencia en estilo audiovisual, sujeto y narrativa.

Escenarios aplicables: Continuar la trama, extender la acción, completar fragmentos, etc.
Formato recomendado:
Extender video: Extender hacia adelante/atrás<VideoN>, generar...
Completar pista:<Video1> + <Descripción de transición> + seguido de <Video2> + <Descripción de transición> + seguido de <Video3>
Nota
Para tareas de edición/extensión de video, use directamente “<VideoN>” para referirse al video; no use “referencia<VideoN>” para evitar que se malinterprete como una tarea de referencia.

Tareas combinadas

Las tres tareas anteriores también se pueden combinar.

Escenarios aplicables: Referenciar un material y editar otro.
Formato recomendado:
Referencia<Imagen/VideoN> de[Dimensión de referencia], editar estrictamente<VideoX>,[Contenido de edición específico]

Fórmula avanzada

Seedance 2.0 es esencialmente un director de IA multimodal: lee simultáneamente sus indicaciones de texto, imágenes, videos y audio, y descompone internamente en dos dimensiones —“capa espacial” (qué hay en la escena) y “capa temporal” (cómo cambian las cosas con el tiempo)— para comprender y generar la imagen.

Por lo tanto, una buena indicación no es una simple “descripción textual”, sino una “instrucción de ingeniería”: quién, en qué escena, haciendo qué acción, cómo se mueve la cámara, en qué orden temporal ocurre, todo dirigido a la capa espacial y temporal respectivamente. La fórmula específica es la siguiente:

Fórmula avanzada de prompt: sujeto preciso + detalles de acción + entorno de escena + tono de luz y sombra + movimiento de cámara + estilo visual + calidad de imagen + condiciones restrictivas

En pocas palabras, primero fije “quién” está haciendo “qué”, luego especifique “dónde” y “qué ambiente”, luego indique al modelo “cómo filmar”, y finalmente ajuste el resultado con estilo, calidad y restricciones. A continuación, desglosamos cada elemento en detalle.

1 Definir el sujeto

En el material de referencia real, una imagen a menudo contiene múltiples sujetos. Para referirse con precisión a un objeto específico en el material, es necesario definir claramente el sujeto. El sujeto puede ser una persona, un objeto, una escena, etc.

Método de definición básico
Formato recomendado: Define <Imagen/VideoN> enes el de la derecha. Con música de fondo intensa.Dos personas con ropa deportiva corren en la pista de la escuela. La chica mira al chico y dice con una sonrisa segura: “We can definitely do it!” La cámara corta a un primer plano del chico, quien responde dudoso: “Are you sure?” La cámara vuelve a un plano medio de la chica, quien dice con tono alegre: “Yes!” La emoción es brillante y firme. Aparecen burbujas alrededor de los personajes que hablan, con el diálogo correspondiente dentro.<SujetoN>
[Características centrales del sujeto]definido como
Ejemplo:
Reemplaza el perfume en imagen1 Requisitos de características centralesUsa 2-3 características estáticas claras y estables (como vestimenta, peinado, apariencia, categoría) para describir, asegurando una identificación única.
Reemplaza el perfume en imagen1 Requisitos de características centralesLa mujer con vestido rojo y sombrero de paja en
Mismo sujeto en múltiples materiales

Cuando varios materiales apunten al mismo sujeto, se debe unificar el vínculo:

Formato recomendado: Define imagen1 en[...] ,imagen2 en[...] definido como ** <SujetoN>**
Escena de múltiples sujetos

Cuando haya múltiples sujetos en el video, es necesario definirlos por separado y usar etiquetas para distinguirlos. Las etiquetas deben ser únicas y estables, y deben usarse de manera consistente en las descripciones posteriores para evitar confusiones en las referencias.

Formato recomendado: Define [característica central del sujeto 1] en <imagen/video N> como <sujeto 1>, define [característica central del sujeto 2] en <imagen/video N> como <sujeto 2>...
Ejemplo: Define video1 comopolicía, y al otro hombre bajo comoladrón. La escena es un mercado diurno concurrido, con luz solar brillante, muchos puestos de frutas y peatones densos, lleno de ambiente de vida callejera. ladróncorre hacia adelante presa del pánico entre la multitud del mercado concurrido, policíalo persigue de cerca a toda velocidad detrás, los dos se mueven rápidamente entre los puestos. Cámara en mano sigue rápidamente hacia adelante, la imagen tiene una ligera vibración realista, creando una atmósfera tensa de persecución.
Nota
Cada vez que se mencione un sujeto, debe referirse explícitamente, evitando omisiones. Se admiten los siguientes dos usos:
Para escenas simples sin sujetos definidos previamente, cada vez que se mencione un sujeto, use<SujetoN>@<ImagenN> para enfatizar la vinculación entre el sujeto y el material. Por ejemplo: Zhang San@imagen1.
Para escenas con sujetos definidos previamente, cada vez que se mencione un sujeto, use la misma etiqueta. Por ejemplo: defina al hombre alto envideo1 comopolicía, y al otro hombre bajo comoladrón. En descripciones posteriores, use consistentemente “policía” para referirse al hombre alto y “ladrón” para el hombre bajo.
Al usar una biblioteca de activos (Asset ID), aún debe usar<Imagen/VideoN> para referirse al sujeto. Dado que el modelo no puede asociar directamente el Asset ID con el contenido de referencia, no debe reemplazar<Imagen/VideoN>.
Las descripciones deben ser lo más concisas posible, evitando redundancias y conflictos semánticos (como características contradictorias para el mismo sujeto).
Se recomienda expresar las relaciones espaciales preferentemente mediante imágenes de referencia, reduciendo descripciones textuales complejas.

2 Uso de la secuencia temporal de planos

El modelado interno del modelo desacopla el espacio y el tiempo. Por lo tanto, la forma ideal de una indicación para un video complejo es una secuencia temporal de planos: dividir el video en varios planos y describir dinámicamente cada plano según el orden de los eventos: quién + dónde + qué hace + cómo se mueve la cámara.

Recomendación práctica

Use el orden de los planos: escriba un simple “Plano 1 / Plano 2 / Plano 3” para cada segmento del video y luego combínelos en una indicación completa.

Caso negativo:“Un hombre corre nerviosamente por la calle, la escena tiene un aspecto cinematográfico.”
Caso positivo:
Plano 1: Toma lateral de la calle, el hombre comienza a correr lentamente, con una sensación de respiración agitada.
Plano 2: El hombre choca contra un puesto de frutas, la cámara se mueve rápidamente y da un primer plano de su rostro aterrorizado.
Plano 3: El hombre salta una pared baja y desaparece, la cámara se aleja lentamente y se detiene en la calle vacía.

Reglas específicas

UsePlano1,Plano2,Plano3 y otros identificadores, organizando el contenido según el orden de los eventos (primero lo principal, luego lo secundario). No es obligatorio limitar la duración de cada segmento; se prefiere que el modelo genere el ritmo de forma natural según la trama.
Explicación
El modelo no admite de manera estable tiempos precisos (como 0–3 segundos); forzar límites de tiempo puede provocar resultados anómalos.
Se recomienda organizar cada plano según la siguiente lógica:
Movimiento de cámara o método de transición: Como “acercamiento lento desde plano general”, “cámara fija”, “corte a…”, etc.
Acción y expresión del sujeto: Describir las acciones clave y cambios de expresión del personaje/objeto central.
Cambio de posición o espacio: Indicar la escena, posición o relación espacial del sujeto.
Información de audio: Describir los efectos de sonido, voces o música de fondo correspondientes al plano.

3 Requisitos para la descripción de acciones

Detalle de extremidades + Cuantificación del grado
Las acciones deben especificarse en términos de partes del cuerpo como manos, piernas, cabeza, hombros y espalda, complementando con descripciones deamplitud, velocidad e intensidad;
Ejemplo: levantar la mano lentamente, girar la cabeza rápidamente, pisar con fuerza, inclinar ligeramente la cabeza.
Priorizar movimientos pequeños, lentos y continuos
Priorizar movimientos sutiles, suaves y fluidos, evitando en lo posible acciones de alta intensidad y gran dinámica como correr a toda velocidad, saltos grandes o giros violentos.
Ejemplo: caminar lentamente, levantar la mano suavemente, inclinar ligeramente la cabeza, sentarse con naturalidad.
Agregar transiciones de acción
Especificar la inercia y la relación de continuidad entre acciones anteriores y posteriores para garantizar que la acción en la escena sea fluida y natural.
Ejemplo: aprovechar la inercia del giro para levantar la mano, pasar naturalmente de un estado de pausa a levantar la mano.
Expresión externa concreta de emociones
Use detalles físicos específicos para expresar emociones, en lugar de términos abstractos como “muy triste” o “muy enojado”.
Vea la tabla a continuación para ejemplos específicos:

Tristeza

Cabeza baja, hombros temblando ligeramente, ojos enrojecidos, dedos agarrando inconscientemente la ropa, lágrimas en los ojos sin caer.

Antes de la optimización

Audio de entrada

Suspirar profundamente, hombros tensos completamente relajados, una sonrisa leve y poco común aparece en el rostro, levantar la mirada hacia lo lejos.

<Se oyen ladridos de perro a lo lejos>

{}

Diálogo

La pronunciación de “螭” en “螭龙山” es incorrecta.

Convertir el producto del modelo en un video de modelo blanco antes de continuar escribiendo.

<>

Efecto de sonido

4 Escritura de movimientos de cámara

El modelo comprende muy bien los términos de movimiento de cámara; basta con usar términos estándar como «plano medio, primer plano, plano general, travelling lento, paneo horizontal suave, cámara fija».

Nota
En un solo plano, intente especificar solo 1 tipo de movimiento de cámara; no solicite simultáneamente acercamiento, desplazamiento y giro, ya que esto puede aumentar la inestabilidad de la imagen.

5 Calidad, estilo y palabras de restricción

La calidad, el estilo y las palabras de restricción son clave para controlar el efecto de generación de video, ya que delimitan los límites creativos del modelo, unifican la calidad y el tono artístico, y evitan defectos visuales y desviaciones aleatorias. Son una configuración necesaria para garantizar la estabilidad y conformidad del resultado final.

1 Calidad

Define la nitidez de la imagen, los detalles de textura y la calidad de luces y sombras, mejorando la calidad base del resultado.

Ejemplo: Alta definición, rico en detalles, calidad cinematográfica, colores naturales, luces y sombras suaves.

2 Estilo

Define el estilo artístico general y el tono visual, unificando la atmósfera artística de la imagen.

Ejemplo: Ciberpunk con tonos fríos azul-violeta, vintage de película, estilo japonés fresco.

3 Palabras de restricción

Las palabras de restricción son muy importantes para evitar eficazmente defectos visuales, deformaciones y elementos irracionales, delimitando los límites de generación y la estabilidad.

Plantilla común de palabras de restricción:

Evitar generar subtítulos:“Mantener sin subtítulos”, “Evitar generar cualquier texto o subtítulo”
Evitar generar logotipos:“No generar logotipos”
Evitar generar marcas de agua:“No generar marcas de agua”

6 Caso práctico

Muestra cómo usar la fórmula avanzada y los elementos presentados anteriormente para escribir indicaciones.

Agregar el efecto de video de desplazamiento numérico correcto, el resultado del efecto cumple con las expectativas.

Preparación de materiales :

@imagen 1: Foto de medio cuerpo de la protagonista femenina
@imagen 2: Imagen de referencia de escena de dormitorio
@video 1: Referencia de movimiento de cámara para diálogo interior (plano medio con paneo o ligero desplazamiento)
@audio 1: Sonido ambiental interior o música ligera

Prompt :

La chica de @imagen 1 como protagonista, @imagen 2 como referencia de estilo de escena de dormitorio, referencia al movimiento de cámara de @video 1.

Toma 1 : Al atardecer, la chica @imagen 1 camina con paso ligero hasta la puerta del dormitorio @imagen 2 , la cámara la sigue en plano medio de manera estable, la luz amarilla cálida del atardecer entra al pasillo desde la ventana, ella se detiene un momento en la puerta, respira hondo, con expresión ligeramente nerviosa.

Toma 2 :la chica @imagen 1 abre la puerta y entra al dormitorio, la cámara corta a un plano medio interior, los compañeros de cuarto levantan la cabeza para mirarla mientras ordenan los libros, uno de ellos pregunta sonriendo {¿Cómo te fue, aprobaste?}, la cámara alterna lentamente entre primeros planos de medio cuerpo de ellos.

Toma 3 :la chica @imagen 1 primero baja la cabeza con expresión abatida, la cámara le da un primer plano, luego levanta la cabeza sin poder contener la risa, se ríe a carcajadas y dice {Les estaba tomando el pelo}, los compañeros comienzan a perseguirla y jugar, la cámara se aleja lentamente, se detiene en un plano general de la habitación llena de risas y alegría.

Todo el video en estilo documental cinematográfico de alta definición, tonos cálidos, luz y sombra suaves; el rostro del personaje es estable sin deformaciones, los movimientos son naturales y fluidos, sin pausas ni parpadeos; los efectos de sonido ambiental se fusionan naturalmente con @audio 1.

Animación de efectos especiales

Preparación de materiales :

@imagen 1: Protagonista femenina de rojo
@imagen 2: Asesina de negro (oponente)
@imagen 3: Imagen de escena de acantilado con bosque de bambú
@video 1: Referencia de movimiento de cámara para combate de artes marciales
@audio 1: Ritmo de tambor intenso o efectos de sonido de lucha

Prompt :

La mujer de rojo de @imagen 1 como protagonista femenina, la mujer de negro de @imagen 2 como oponente, la escena referencia al entorno de acantilado con bosque de bambú de @imagen 3, el movimiento de cámara general y el ritmo de acción referencia a @video 1, los efectos de sonido de fondo sincronizados con @audio 1.

Toma 1 : Al atardecer, la cámara desde la mujer de rojo @imagen 1Plano medio lateral con cámara lenta hacia adelante. Ella está de pie al borde del acantilado, bebiendo vino de una jarra. Su ropa ondea suavemente con el viento de la montaña. La cámara la rodea medio círculo, desde el frente hasta la espalda. A lo lejos, se vislumbra una figura vestida de negro entre el bosque de bambú.

Toma 2 Transición con zoom gradual a un plano general. Vista de dron que abarca todo el acantilado y el bosque de bambú. Dos personas están en extremos opuestos del acantilado. El viento levanta sus ropas y el polvo. El ritmo se acelera ligeramente con el ritmo del tambor.

Toma 3 Corte a un primer plano desde el suelo. Ambos desenvainan lentamente sus espadas, enfrentándose.Mujer de rojo @imagen 1Su expresión pasa de despreocupada a gélida.Mujer de negro @imagen 2Mirada firme, la punta de la espada tiembla ligeramente. La cámara sigue suavemente a ambos mientras se mueven en círculo, y finalmente se congela en un primer plano justo antes de que las espadas se crucen.

Ambiente general de película de artes marciales con lluvia y niebla. Tonos fríos y baja saturación. Textura de película cinematográfica. Capas de luz y sombra ricas. Los rostros y proporciones corporales se mantienen estables sin deformaciones. Los movimientos son fluidos y naturales, sin rigidez, sin errores de modelo ni tirones.

Otros consejos

Generación de texto

La serie Seedance 2.0 admite la generación de texto común. El modelo puedeigualar automáticamenteel estilo y color adecuados según el contexto, y también admiteespecificarel color, estilo, forma de aparición, momento y ubicación del texto en la indicación. Al escribir, priorice el uso decaracteres comunes, eviteCaracteres poco comunesysímbolos especialespara garantizar la mejor presentación. Actualmente compatible con escenarios como anuncios, subtítulos, burbujas, etc. Para redacción y ejemplos específicos, consulteGeneración de texto.

Extensión de video vs. Edición por segmentos

Plano secuencia continuo (extensión de video): Adecuado para "escenas dialogadas" dentro de una sola escena, como conversaciones largas, progresión emocional, movimiento en una sola dirección, para lograr un efecto inmersivo y continuo de plano secuencia.
Transición de escena/acción (edición por segmentos): Adecuado para giros argumentales o "escenas de acción" complejas y rápidas, como persecuciones, peleas, montaje, etc. Se pueden generar segmentos independientes y luego editar y combinar para mantener el ritmo y el impacto visual.

En la producción real, normalmente se combinan ambos métodos, por ejemplo, primero se genera un diálogo continuo mediante extensión, y luego se empalman tomas vacías o segmentos de transición, equilibrando la inmersión y los cambios de ritmo.

Estrategia de configuración de materiales

Normalmente, los materiales se dividen en cuatro "roles funcionales":

Anclaje de personaje: fija la apariencia del personaje
Ambientación de escena: fija el entorno y el estilo
Referencia de cámara: fija el lenguaje de cámara y el ritmo de acción
Ambiente rítmico: usa audio para controlar la emoción y el timbre

Configuración recomendada(total de 4-5 materiales): 1-2 imágenes de personaje (primer plano/cuerpo completo) + 1 imagen de escena + 1 video de referencia de cámara + 1 pista de audio.

Explicación
No se recomienda usar el límite máximo de materiales. Demasiados materiales dificultan que el modelo juzgue la prioridad de las características, lo que puede provocar conflictos de estilo, identificación borrosa del sujeto, desviaciones del efecto esperado, etc.

Notas importantes

Normas de idioma

El idioma de los diálogos debe ser uniforme, evitando mezclar chino e inglés (excepto para nombres propios).

Normas de caracteres especiales

El uso razonable de símbolos en las indicaciones ayuda al modelo a comprender con precisión los diferentes tipos de información:

Nerviosismo / Ansiedad

【】

Ejemplo

Sujeto 1

Zhang Hong

Dos personas en la imagen charlan en la oficina. La mujer habla primero: “Siempre llegas justo a tiempo, ¿disfrutas esa sensación de llegar justo?” El hombre responde sonriendo: “Tengo mi propio ritmo.” Cuando los personajes hablan, la conversación es natural y casual. En la parte inferior de la pantalla aparecen subtítulos con el diálogo correspondiente.

Tipo de información

Símbolo

Ejemplo

El estilo de fantasía se desvía a un estilo realista.

El personaje en el video cambia de rostro a mitad de camino, pareciéndose a una celebridad.

El rostro se mantiene consistente con la imagen de referencia durante todo el video.

Subtítulos

{Hola, mundo}. Si el diálogo está en un idioma minoritario (no chino ni inglés), se debe indicar el idioma, por ejemplo: decir en japonés {こんにちは}.

Mirar el reloj con frecuencia, golpear la mesa con los dedos sin parar, respiración agitada, mirada evasiva, morderse las uñas inconscientemente.

Preguntas frecuentes

Deriva de ID de personaje

Fenómeno típico

La imagen del personaje generada no coincide con la imagen de referencia, o se produce un "cambio de rostro" (deriva de ID) a mitad del video, lo que provoca que el personaje se parezca a una celebridad y sea bloqueado por la revisión.

Análisis de causa raíz

Efectividad insuficiente de la imagen de referencia facial

Mezcla de imágenes de referencia: Combinar la imagen de referencia facial con imágenes de postura de cuerpo completo/medio cuerpo, imágenes de referencia de vestuario, imágenes de detalle, etc., en una misma imagen proporcionada al modelo.
Proporción facial demasiado pequeña: En las imágenes de referencia mezcladas, el área facial ocupa una proporción demasiado pequeña del total de la imagen. El modelo no tiene suficiente peso al extraer las características faciales y es fácilmente interferido por el fondo u otros elementos.

Soluciones

Fortalecer la independencia y el peso de la referencia facial:

Preparar una imagen de primer plano facial: Además de la foto de cuerpo completo original, prepare unaimagen de primer plano facial que solo contenga la cabeza del personaje(foto de primer plano, solo el rostro, sin expresión es mejor, minimice elementos de interferencia como hombros, cuello, fondo).
Definición clara del sujeto en la indicación: Las características faciales de <sujeto1> se refieren a la imagen 1 (primer plano), y el maquillaje y vestuario se refieren a la imagen 2 (cuerpo completo).
Priorizar materiales importantes: Cuanto más se necesite unareferencia precisa, coloque el material en una posiciónmás adelantadaen la indicación.
Nota
Para la referencia del personaje, basta con usar una foto de primer plano + una foto de cuerpo completo.No se recomienda usar vistas múltiples del personaje. Los materiales de vistas múltiples contienen diferentes ángulos del mismo personaje, y el modelo puede identificarlos fácilmente como múltiples sujetos diferentes, lo que agrava el problema de deriva de ID.

“Usa el timbre de voz masculino de mediana edad, grave, cálido y con una textura granulada sutil de @audio 1 para decir”

El timbre no coincide con el audio de entrada.

Generar 2 imágenes con los 8 personajes y luego usar imagen a video.

Mantener el estilo 3D de animación CG china de fantasía.

El video contiene subtítulos

Fenómeno típico

La indicación no solicita la generación de subtítulos, pero el video generado los contiene.

Soluciones

Explicación
Actualmente no es posible evitar al 100% la generación de subtítulos. Solo se puede reducir su probabilidad de aparición y mejorar la tasa de éxito mediante los siguientes métodos.
Agregue instrucciones de restricción claras en la indicación: "Mantener sin subtítulos", "Evitar generar cualquier texto o subtítulo".
Si el texto en las imágenes/videos de referencia no es información necesaria, se recomienda eliminar el texto primero con herramientas (por ejemplo, usando la capacidad de edición de imágenes/videos de los modelos Seedream/Seedance), y luego usar el material sin texto como entrada.
Si el negocio lo permite, priorice la generación de video en formato horizontal (la probabilidad de generar subtítulos en horizontal es significativamente menor que en vertical). Posteriormente, se puede recortar a vertical con software de edición.

El video tiene logotipo/marca de agua

Fenómeno típico

La indicación no menciona contenido de marcas de agua, pero el video generado contiene logotipos/marcas de agua de otras plataformas de video.

Soluciones

Agregue instrucciones de restricción claras en la indicación: "No generar marcas de agua", "No generar logotipos".

Deriva de estilo

Fenómeno típico

Se espera generar un estilo anime 2D o 3D, pero el estilo de las imágenes de referencia de entrada es realista y la indicación no enfatiza el estilo del video. El video generado puede derivar a un estilo realista.

Soluciones

Agregue palabras de restricción de estilo claras en la indicación, por ejemplo, "Estilo anime japonés 2D", "Cómic chino 3D". Si se necesita un control de estilo más preciso, se recomienda transformar la imagen de referencia al estilo deseado antes de generar el video.

“Usa el timbre de voz masculino de mediana edad, grave, cálido y con una textura granulada sutil de @audio 1 para decir”

El timbre no coincide con el audio de entrada.

Se ingresan 8 personajes de referencia, el video de salida tiene 9 personas.

Emoción abstracta

Salto en la unión de videos extendidos

Fenómeno típico

Después de usar la función de extensión de video para generar un nuevo video, al empalmar el nuevo video con el original, pueden aparecer saltos de imagen o retrocesos en la unión.

Soluciones

Actualmente se recomienda reparar mediante edición posterior, alineando los fotogramas clave. Las mejoras fundamentales se basarán en iteraciones del modelo en el futuro.

Importe los videos a empalmar en CapCut u otro software de edición de video profesional.
En la primera unión, elimine6 fotogramas del final del primer video.
y, al mismo tiempo, elimine1 fotograma del inicio del segundo video.
Repita la operación anterior para todos los puntos de unión.
Exporte y verifique la fluidez del video empalmado.
Explicación
Después de alinear los fotogramas, aún pueden existir pequeños saltos. Se recomienda que, al generar el video de continuación, termine en el momento de un corte de transición, y que el siguiente video comience con la nueva escena después del corte.

“Usa el timbre de voz masculino de mediana edad, grave, cálido y con una textura granulada sutil de @audio 1 para decir”

El timbre no coincide con el audio de entrada.

Sonrisa incontrolable, cejas y ojos relajados, paso ligero, tararear una canción inconscientemente, dar un giro en el lugar sin poder evitarlo.AlegríaLas transiciones son más suaves.En las transiciones (segundo 5, segundo 20) aparece

Alivio

Problema de gemelos

Fenómeno típico

En escenas con muchos personajes y cuando se usan vistas de tres cuartos del personaje como material de referencia, es fácil que aparezcan dos personajes idénticos en la misma imagen del video generado.

Análisis de causa raíz

La definición del sujeto del personaje en la indicación no es clara, y el modelo no puede distinguir con precisión entre diferentes personajes;
Al usar vistas de tres cuartos/vistas múltiples del personaje como material de referencia, es fácil que el modelo confunda la identificación del personaje, generando así personajes duplicados del mismo tipo.

Soluciones

Explicación
Actualmente no es posible evitar al 100% el problema de los gemelos. Solo se puede reducir su probabilidad de aparición y mejorar la tasa de éxito mediante los siguientes métodos.
Definir claramente la asociación del sujeto del personaje

Defina claramente cada personaje en la indicación, especificando la correspondencia entre el personaje y la imagen de referencia. Se recomienda etiquetar la imagen de referencia correspondiente después del nombre del personaje y mantener un formato uniforme.

Ejemplo: Zhang San (correspondiente a la imagen 1) lanza la libreta de ahorros verde hacia Li Si (correspondiente a la imagen 2) que está de pie.

2. Agregar instrucciones de restricción global

Agregue una restricción fija al final de la indicación: Está prohibido que aparezcan personajes con apariencia, vestimenta y accesorios completamente idénticos durante todo el video. Prohibido generar efectos de clones o gemelos del mismo tipo. En la misma escena, solo debe aparecer el personaje correspondiente individual, sin duplicación de personajes..

3. Optimizar materiales de referencia

Priorice el uso de fotos individuales independientes para las imágenes de referencia del personaje. No se recomienda usar vistas de tres cuartos o vistas múltiples.

4. Simplificar y optimizar la indicación

No use el guion completo directamente como indicación. El contenido excesivamente redundante puede causar confusión en la comprensión del modelo. Es necesario simplificar las declaraciones irrelevantes y garantizar que las instrucciones sean claras y enfocadas.

“Usa el timbre de voz masculino de mediana edad, grave, cálido y con una textura granulada sutil de @audio 1 para decir”

El timbre no coincide con el audio de entrada.

Después de la optimización

Degradación de calidad en la extensión de video

Fenómeno típico

Al usar un video generado por el modelo como material de entrada para la extensión, se produce una degradación de la calidad. Las extensiones múltiples acumulan el efecto de degradación, especialmente en el área facial del personaje, donde pueden aparecer manchas de color.

Soluciones

Actualmente, se puede mitigar la degradación de calidad mediante los siguientes métodos. Las mejoras fundamentales se basarán en iteraciones del modelo en el futuro:

Convierta el video original a un video de modelo blanco usando Seedance 2.0, y luego úselo como material de entrada para la extensión.
Indicación de referencia: Convierte el video a un modelo 3D blanco, unifica a los personajes como modelos 3D blancos puros, sin color, sin textura, sin sombras, fondo blanco puro, estructura estable, movimiento fluido.
Priorice el uso de imágenes de alta definición como material de referencia.
Controle razonablemente el número de extensiones de video, evitando extensiones múltiples acumulativas.

“Usa el timbre de voz masculino de mediana edad, grave, cálido y con una textura granulada sutil de @audio 1 para decir”

El timbre no coincide con el audio de entrada.

El contenido retrocede

Ruido al final

El efecto especial no cumple con lo esperado

Fenómeno típico

Al describir efectos especiales específicos mediante texto en la indicación, puede ocurrir que el efecto no coincida con lo esperado. Por ejemplo: la indicación especifica "El número '2999' aparece con una animación de cuenta regresiva", pero el efecto de desplazamiento numérico generado muestra saltos desordenados, sin seguir la lógica estándar de cuenta regresiva.

Soluciones

Se recomienda usar unvideo de referenciapara definir el efecto especial: Ingrese el video del efecto especial deseado como material de referencia en el modelo, permitiendo que el modelo comprenda con precisión la forma y la lógica de movimiento del efecto, generando un resultado más acorde a lo esperado. Por ejemplo: La forma de aparición del número '2999' se refiere al video 1.

“Usa el timbre de voz masculino de mediana edad, grave, cálido y con una textura granulada sutil de @audio 1 para decir”

El timbre no coincide con el audio de entrada.

Ira

Después de cambiarlo a “吃龙山”, la pronunciación es correcta.

Puños apretados, mandíbula tensa, pecho agitado, mirada afilada como un cuchillo, palabras dichas entre dientes.

Exceso de personajes de referencia

Fenómeno típico

Cuando el número de personajes de referencia supera los 4, la estabilidad de salida del modelo disminuye. El video generado puede tener un número incorrecto de personajes (menos o más) o personajes repetidos.

Soluciones

Actualmente, se puede mitigar mediante los siguientes métodos. Las mejoras fundamentales se basarán en iteraciones del modelo en el futuro:

Generar imágenes por pasos: Agrupe a los personajes, asegurándose de que cada grupo generado no supere los 4 personajes. Por ejemplo, 6 personas se pueden dividir en 2 grupos de 3, generando imágenes por separado.
Generar video a partir de imágenes: Use las múltiples imágenes de grupo generadas en el primer paso como material de referencia para generar el video final.

“Usa el timbre de voz masculino de mediana edad, grave, cálido y con una textura granulada sutil de @audio 1 para decir”

El timbre no coincide con el audio de entrada.

En el segundo 8 de la imagen aparece “gemelos”.

Externalizar en acciones y detalles

Ruido al final del video

Fenómeno típico

Cuando el video incluye narración, es fácil que aparezcan chasquidos abruptos o ruido de corte al final del video.

Soluciones

Vuelva a generar el video, o use herramientas de edición como CapCut para aplicar un fundido de salida de audio en la pista de audio del final usando unaenvolvente de volumen, eliminando el ruido de corte.

Pasos específicos (usando CapCut):

Importe el video generado a CapCut.
Seleccione la pista de video en la línea de tiempo, haga clic enAudio.
en la barra de herramientas, seleccioneenvolvente de volumenla función (en algunas versiones se encuentra en el menú Básico/Ajuste) y elija un punto clave. Aparecerá una línea que representa el volumen y puntos clave en la pista de audio.
Hacia el final del video, arrastra el punto clave de volumen final hacia abajo hasta que el volumen sea 0, formando una pendiente descendente.
Ejemplo de prompt de Seedance 2.0
Previsualiza y confirma que el audio de cierre se desvanece de forma natural, sin cortes abruptos ni ruidos.

“Usa el timbre de voz masculino de mediana edad, grave, cálido y con una textura granulada sutil de @audio 1 para decir”

El timbre no coincide con el audio de entrada.

La imagen salta instantáneamente

o

Pronunciación imprecisa en chino

Fenómeno típico

El modelo tiende a leer mal los caracteres polifónicos, poco comunes o de forma similar.

Soluciones

Se pueden reemplazar los caracteres propensos a errores por homófonos de uso común con la misma pronunciación para evitar desviaciones de pronunciación y restaurar el efecto de audio esperado. Ten en cuenta que esta solución es solo una medida de optimización y no puede evitar por completo todos los problemas de pronunciación.

Ejemplo: se puede reescribir "螭龙山" en el prompt como el homófono "吃龙山".

“Usa el timbre de voz masculino de mediana edad, grave, cálido y con una textura granulada sutil de @audio 1 para decir”

El timbre no coincide con el audio de entrada.

Sin ruido al final

Continuar escribiendo directamente sobre el producto del modelo.

Referencia de timbre imprecisa

Fenómeno típico

Al usar un audio de referencia para especificar un timbre, el timbre del audio del video final generado presenta una desviación notable respecto al de referencia.

Soluciones

Mantener el estilo de los diálogos del video similar al tono y la expresión del audio de referencia ayuda a mejorar la fidelidad y estabilidad del timbre.

“Usa el timbre de voz masculino de mediana edad, grave, cálido y con una textura granulada sutil de @audio 1 para decir”

El timbre no coincide con el audio de entrada.

(De fondo suena rock rápido)

Ejemplo de prompt de Seedance 2.0

Después de agregar la descripción del timbre en el prompt, la coincidencia del timbre mejora significativamente.

Música

()

Apéndice: Ejemplos de prompts

Muestra ejemplos de prompts para usar los modelos de la serie Seedance 2.0 en diferentes escenarios, ayudándole a lograr un control más preciso de referencias multimodales y funciones como la generación de texto.

Generación de texto

Eslogan

Plantilla de referencia de prompt:

«Contenido del texto» + «Momento de aparición» + «Posición de aparición» + «Forma de aparición», «Características del texto (color, estilo)»
Explicación
Seedance2.0 puede adaptar el estilo de texto adecuado según el contexto. Si los requisitos de efecto de texto son estrictos, consulta la sección Referencia de múltiples imágenes > Referencia de logotipo .

Ejemplo de referencia:

[Efecto final]

[Prompt]

Estilo de dibujo animado a mano, tres personas sentadas juntas comiendo imagen1 el pollo frito, ambiente amigable y alegre, luego la imagen se vuelve borrosa gradualmente, en el centro de la imagen aparece el texto “Feliz en Seedance”.

[Material de referencia]

Ejemplo de prompt de Seedance 2.0

▲ Imagen 1

Subtítulos

Plantilla de referencia de prompt:

El logotipo de la imagen 5 aparece siempre en la esquina inferior derecha de la pantalla.

Ejemplo de referencia:

[Efecto final]

[Material de referencia]

Ejemplo de prompt de Seedance 2.0

[Prompt]

Aparecen subtítulos en la parte inferior de la pantalla. El contenido de los subtítulos es “...”. Los subtítulos deben sincronizarse perfectamente con el ritmo del audio.

[Efecto final]

[Material de referencia]

Ejemplo de prompt de Seedance 2.0

[Prompt]

se define como

Globos de diálogo

Plantilla de referencia de prompt:

«Personaje» dice: “...”, al hablar, aparece un globo a su alrededor con el diálogo escrito.

Ejemplo de referencia:

[Efecto final]

[Material de referencia]

Ejemplo de prompt de Seedance 2.0

[Prompt]

imagen1 es el personaje de la izquierda y

[Efecto final]

[Material de referencia]

Ejemplo de prompt de Seedance 2.0

[Prompt]

Referenciaimagen1 ,imagen2 la imagen de la chica, la chica está en un campo de fresas, recoge una, da un mordisco, sonríe y dice: “This is the real deal!” Alrededor de la chica aparece un globo con el diálogo escrito.

Referencia de imagen

Los modelos de la serie Seedance 2.0 admiten tanto referencias de múltiples vistas del sujeto como referencias de múltiples imágenes, como imágenes de escena o storyboards.

Durante el uso, si hay requisitos sobre el orden de las imágenes, se deben subir en orden , y en el prompt se pueden usar imagen1 ,imagen2 ... imagenN para una referencia precisa.

Referencia de múltiples vistas del sujeto

Basta con indicar claramente el objeto de referencia; el modelo puede responder a instrucciones que incluyen, entre otros, los siguientes ejemplos.

Producto:

Electrónica 3C


[Efecto final]

[Material de referencia]

Ejemplo de prompt de Seedance 2.0

[Prompt]

Extrae imagen1 ,imagen2 ,imagen3 la cámara, cambia el fondo a blanco, la cámara está sobre una mesa blanca, la cámara se enfoca en la cámara en primer plano, luego gira lentamente tomando la cámara como sujeto, mostrando claramente el frente, los lados y la parte posterior de la cámara.

Artículos del hogar


[Efecto final]

[Material de referencia]

Ejemplo de prompt de Seedance 2.0

[Prompt]

El fondo es una escena hogareña de tonos cálidos, en plano medio se muestra el termo de la imagen de referencia, la cámara se acerca suavemente a un primer plano del termo, una mano fuera de cuadro entra naturalmente en escena, agarra suavemente el cuerpo del termo y lo levanta, la cámara sigue el ligero movimiento de rotación de la mano para mostrar.


Personaje:

[Efecto final]

[Prompt]

Referenciaimagen1 ,imagen2 ,imagen3 la imagen de la mujer, genera una escena de ella comiendo pastel en una cafetería.

[Material de referencia]

Ejemplo de prompt de Seedance 2.0

Referencia de múltiples imágenes

Referencia de logotipo


[Efecto final]

[Material de referencia]

Ejemplo de prompt de Seedance 2.0

[Prompt]

El fondo es un pasillo aéreo futurista de una ciudad con luces de neón, entrelazado con aeronaves y anuncios holográficos, referencia a imagen2 la chica, primero se muestra en plano medio a la chica soltando una lámpara flotante plateada con proyección holográfica, luego la cámara se aleja para mostrar innumerables lámparas flotantes, la imagen se vuelve borrosa gradualmente, luego aparece imagen1 el logotipo, el estilo general es animación 3D de ciencia ficción cyberpunk.

Referencia de múltiples sujetos


[Efecto final]

[Material de referencia]

Ejemplo de prompt de Seedance 2.0

[Prompt]

Referencia al gato y al perro de la imagen, en un apartamento acogedor, el perro está comiendo croquetas, el gato se acerca, extiende la pata y toca al perro, el perro deja de comer al ver al gato, el gato se acurruca junto al perro. La escena usa tonos cálidos.

Referencia de múltiples elementos


[Efecto final]

[Material de referencia]

Ejemplo de prompt de Seedance 2.0

[Prompt]

La escena se sitúa enimagen 4el restaurante de la imagen, con clientes yendo y viniendo.imagen1 La chica deimagen2 viste la ropa deimagen3 y está organizando los artículos en el mostrador.El chico dees un cliente que se acerca para pedirle el número de contacto a la chica.

Referencia de storyboard de múltiples viñetas


[Efecto final]

[Material de referencia]

Ejemplo de prompt de Seedance 2.0

[Prompt]

Referencia al storyboard de la imagen, genera una escena de lucha intensa. Las composiciones de cada viñeta del storyboard deben aparecer en orden, luego los dos luchan ferozmente.

Referencia de storyboard


[Efecto final]

[Material de referencia]

Ejemplo de prompt de Seedance 2.0

[Prompt]

Referenciaimagen3 Composición del storyboard en: una niña espera a que su papá termine de cocinar. Ella dice: “아빠, 배고파요! 밥 다 됐어요?” La apariencia de la niña se referencia deimagen1 Luego, la cámara hace un paneo horizontal a la derecha, cambiando aimagen 4Composición y encuadre de la imagen. La apariencia del papá se referencia deimagen2 El papá responde: “거의 다 됐어, 조금만 기다려!” Luego, la cámara cambia a un primer plano del rostro de la hija, que muestra una leve decepción. Ella dice: “아직 멀었어요? 맛있는 냄새 나는데...” Luego cambia a un primer plano del rostro del papá, quien dice: “이제 진짜 금방이야. ‘빨리빨리’ 하지 말고 손부터 씻고 와!”

Referencia de video

Los modelos de la serie Seedance 2.0 admiten referencia de video; durante el uso, basta con indicar claramente el contenido a generar y el objeto de referencia.

Durante el uso, si hay requisitos sobre el orden de los videos, se debe subir en orden , y en el prompt se pueden usar video1,video2 ... videoN para una referencia precisa.

Referencia de movimiento

Cine y televisión


[Efecto final]

[Material de referencia]

▲ Video 1

Ejemplo de prompt de Seedance 2.0

[Prompt]

Referenciavideo1como centro visual, con una vista en picado en primera persona, que refleje la sensación tecnológica del parque enimagen2 Movimiento de personajes y lenguaje de cámara deimagen1 genera una escena de pelea entreimagen2 yimagen1 donde

Marketing


[Efecto final]

[Material de referencia]

▲ Video 1

[Prompt]

Referenciavideo1la forma de correr del caballo, genera un caballo dorado y majestuoso corriendo por la pradera, luego congela su elegante postura de carrera, convirtiéndose en un colgante de oro con forma de caballo.

Referencia de movimiento de cámara

[Efecto final]

[Prompt]

Referenciavideo1Genera un video con voz en off. Una voz masculina profunda y tranquila dice: “En el vasto universo, nuestro mundo es solo un instante fugaz. Sin embargo, en él, la vida prospera sin importar nada.” La escena debe pasar lentamente de la noche al amanecer, las estrellas desaparecen gradualmente y el sol sale detrás de la montaña. En la parte inferior de la pantalla aparecen subtítulos que siguen el diálogo.imagen1 Con el movimiento de cámara deimagen1 haz un video conceptual de un parque tecnológico, tomando el edificio alto de

[Material de referencia]

▲ Video 1

Ejemplo de prompt de Seedance 2.0

▲ Imagen 1

Referencia de efectos especiales

Cine y televisión


[Efecto final]

[Material de referencia]

▲ Video 1

Ejemplo de prompt de Seedance 2.0

▲ Imagen 1

[Prompt]

Referenciavideo1el efecto de partículas doradas, deja que imagen2 el personaje toque la flauta mientras tiene el mismo efecto de partículas a su alrededor.

Efecto de juego


[Efecto final]

[Material de referencia]

▲ Video 1

Ejemplo de prompt de Seedance 2.0

▲ Imagen 1

[Prompt]

Referenciavideo1El efecto deimagen1 hace que la chica en la imagen desarrolle las mismas alas, con una trayectoria de generación de alas consistente.

Edición de video

Los modelos de la serie Seedance 2.0 admiten edición de video, incluyendo añadir, eliminar o modificar elementos, extender el video hacia adelante o hacia atrás, y completar pistas.

Durante el uso, si hay requisitos sobre el orden de los videos, se debe subir en orden , y en el prompt se pueden usar video1,video2 ... videoN para una referencia precisa.

Añadir, eliminar o modificar elementos

Agregar elementos


[Efecto final]

[Material de referencia]

▲ Video 1

[Prompt]

En video1la superficie de la mesa, añade aperitivos como pollo frito y pizza.

Eliminar elementos


[Efecto final]

[Material de referencia]

▲ Video 1

[Prompt]

El efecto de desplazamiento numérico tiene una sensación de salto desordenado evidente.video1Ejemplo 1: Drama emocional en dormitorio (más diálogo / escenas de conversación)

Modificar elementos


[Efecto final]

[Material de referencia]

▲ Video 1

Ejemplo de prompt de Seedance 2.0

▲ Imagen 1

[Prompt]

Reemplaza el perfume en video1por la crema facial en imagen1 , manteniendo la acción y el movimiento de cámara sin cambios.

Extensión de video

Nota
El modelo recortará automáticamente la parte de transición para la síntesis; los segmentos originales del video de entrada no se regenerarán.

Extender hacia atrás


[Efecto final]

[Material de referencia]

▲ Video 1

[Prompt]

genera video1el contenido posterior, dos hombres que llegaron tarde corren hacia ellos, los cinco finalmente se encuentran y charlan amigablemente.

Extender hacia adelante


[Efecto final]

[Material de referencia]

▲ Video 1

[Prompt]

Extender hacia adelante video1, toma un plano over-the-shoulder del hombre de blanco, el hombre de blanco dice: “It’s not that bad. You're just stressed. Everyone goes through this, you just need to keep going.”

Completar pistas

Explicación
Los modelos de la serie Seedance 2.0 admiten hasta 3 segmentos de video de entrada, con una duración total que no exceda los 15 segundos.
Durante la generación, se recortarán automáticamente las partes de transición del primer y último video, conservando solo los segmentos necesarios para la síntesis.

Ejemplo de referencia:

[Efecto final]

[Prompt]

video1, en el momento en que la hoja cae al suelo, provoca un efecto de partículas doradas, una ráfaga de viento sopla, luego video2 .

[Material de referencia]

▲ Video 1

▲ Video 2

Guía de Seedance 2.0: Fórmulas, ejemplos y preguntas frecuentes