Doubao Seedance 2.0 系列(下文简称 Seedance 2.0 系列)模型原生支持音频与视频联合生成,拥有卓越的语义理解与多模态交互能力。本文介绍 Seedance 2.0 系列模型的提示词(Prompt)使用方法和相关技巧,帮助您更高效地利用该模型生成符合需求的优质视频作品。
基础公式
Seedance 2.0 系列模型支持同时参考视频、图片、音频等多模态素材,能精准锁定人物样貌、动作特效、视觉风格、配音音色等特征,大幅降低提示词编写门槛。基于这一优势,我们可以通过简单的基础公式来引导模型,利用多模态素材的特点,快速生成满足特定需求的视频。
参考生视频可细分为三类任务:多模态参考、编辑视频和延长视频。您可根据任务类型选择提示词基础公式。
多模态参考
从素材中提取部分元素(如主体、风格、场景、音效),生成一个全新视频。
<Image N>'s <Subject N>,生成...<Video N>'s 's <Action/Camera Movement/Style/Sound Effect>,生成...<Audio N>中的音色,生成...编辑视频
在原视频基础上进行局部或全局修改。未提及的部分,默认保持不变。
<Element Features> + <Timing of Appearance> + <Location of Appearance><Video N>, changing its <Original Feature> to <New Feature>Extending Video
在时间维度上延续原视频,要求音视频风格、主体与叙事保持一致。
<Video N>,生成...<Video 1> + <Transition Description> + then <Video 2> + <Transition Description> + then <Video 3><Video N>" to refer to the video. Do not use "reference<Video N>”,以免被误判为参考任务。组合任务
上述3种任务也支持组合使用。
<Image/Video N>'s [Reference Dimension], strictly edit <Video X>, [Specific Editing Content]进阶公式
Seedance 2.0 本质上是一个多模态 AI 导演:同时读取你的文字提示词、图片、视频、音频,并在内部拆成 “空间层”(画面里有什么)和 “时间层”(事情如何随时间变化)两个维度来理解和生成画面。
因此,好的提示词不是单纯的 “文案型形容”,而是 “工程型指令”:谁、在什么场景、做什么动作、镜头如何运动、按怎样的时间顺序发生,分别投递给空间层和时间层。具体公式如下:
提示词进阶公式:精准主体 + 动作细节 + 场景环境 + 光影色调 + 镜头运镜 + 视觉风格 + 画质 + 约束条件
简单说就是,先锁定“谁”在“干什么”,再交代“在哪”,“什么氛围”,然后告诉模型“怎么拍”,最后用风格、画质和约束条件把结果收紧。下面详细拆解各要素。
1 定义主体
实际参考的素材,一张图片中往往存在多个主体,为了精准引用素材中的特定对象,必须进行明确的主体定义。主体可以是人物、道具、场景等。
<Image/Video N>'s [Core Subject Features]
Define
<Subject N>当多个素材中的对象指向同一主体时,应统一绑定:
[...], Image 2's [...] defined as **<Subject N>**当视频中存在多个主体时,需要分别定义,并使用标签区分。标签应具备唯一性与稳定性,后续描述中需持续使用对应标签,避免指代混乱。
<Subject N>@<Image N>,强调主体和素材的绑定关系。例如:张三@图片1。<Image/Video N> to refer to the subject. Since the model cannot directly associate the Asset ID with the reference content, do not directly replace <Image/Video N>.
2 使用分镜时序
模型的内部建模是空间和时间解耦的。因此,一个复杂视频的提示词,最理想的形态是时间轴化分镜:把视频拆成几个分镜,按事件发生顺序动态描述每个分镜: 谁 + 在哪 + 做什么 + 镜头怎么动。
Practical Advice
使用镜头顺序,对每一段视频都写一个简单的 “镜头 1 / 镜头 2 / 镜头 3” 分镜,再合并成完整的提示词。
Specific Rules
Shot 1, Shot 2, Shot 3等标识,按事件发生顺序(先主后次)组织内容。不强制限制每段时长,优先让模型根据剧情自然生成节奏。3 Action Description Requirements
抽象情绪 | 外化为动作与细节 |
悲伤 | 低头、肩膀微微颤抖、眼眶泛红、手指无意识地攥紧衣角、泪水在眼眶里打转但没有落下 |
喜悦 | 嘴角抑制不住地上扬、眉眼舒展、脚步变得轻快、下意识地哼起小曲、忍不住原地转个圈 |
紧张 / 焦虑 | 频繁地看手表、手指不停敲击桌面、呼吸急促、眼神闪躲、无意识地啃咬指甲 |
愤怒 | 双拳紧握、下颌线紧绷、胸口剧烈起伏、眼神如刀般锐利、从牙缝里挤出话语 |
释然 | 长长地舒了一口气、紧绷的肩膀完全放松下来、脸上露出久违的、淡淡的微笑、抬头望向远方 |
4 运镜写法
模型对运镜词理解力很强,直接使用标准运镜术语即可,例如 “中景、特写、全景、缓慢推镜、平稳横移、固定镜头” 。
5 画质、风格与约束词
画质、风格与约束词是把控视频生成效果的关键,能够为模型划定创作边界、统一画质与美术调性,同时规避画面瑕疵与随机偏差,是保障成片效果稳定合规的必要配置。
1 Quality
定义画面清晰度、细节纹理与光影质感,提升成片基础画质。
Example:高清,细节丰富,电影质感,色彩自然,光影柔和
2 Style
设定整体美术画风与视觉调性,统一画面艺术氛围。
Example:赛博朋克冷蓝紫色调、复古胶片、日系清新
3 Constraint Words
约束词十分重要,可有效规避画面瑕疵、畸形崩坏及不合理元素,约束生成边界与稳定性。
Common Constraint Word Templates:
6 实战案例
展示如何使用上文介绍的进阶公式和各要素来编写提示词。
Material Preparation :
Prompt :
@图片 1 中的女孩作为主角,@图片 2 作为宿舍场景风格参考,参考 @视频 1 的运镜方式。
Shot 1: At dusk, the girl @Image 1 walks briskly to the dormitory door @Image 2,镜头中景平稳跟拍,暖黄色日光从窗外洒进走廊,她在门口停顿一下,深呼吸,表情略带紧张。
Shot 2: the girl @Image 1 推开门走进宿舍,镜头切到室内中景,舍友们一边整理书本一边抬头看向她,其中一人笑着问 {考得怎么样呀,过了吗},镜头在几人之间缓慢切换半身特写。
Shot 3: the girl @Image 1 先低头露出落寞表情,镜头给到她的近景,随后她抬头憋不住笑意,哈哈大笑说 {骗你们的},舍友们追着打闹起来,镜头缓慢拉远,定格在宿舍内一片欢声笑语的全景画面。
全程画面高清电影纪实风,色调温暖,光影柔和;人物面部稳定不变形,动作自然流畅,无卡顿无闪烁;环境音效与 @音频 1 自然融合。
Material Preparation :
Prompt :
@图片 1 的红衣女子作为女主,@图片 2 的黑衣女子作为对手,场景参考 @图片 3 的悬崖竹林环境,整体运镜和动作节奏参考 @视频 1,背景音效与 @音频 1 同步。
Shot 1: At dusk, the camera starts from the woman in red @Image 1 侧面中景缓慢推进,她站在悬崖边拿起酒壶喝酒,衣袂在山风中轻轻摆动,镜头环绕她半圈,从正面推到背影,远处隐约可见竹林中的黑衣人影。
Shot 2:镜头变焦渐隐到远景,无人机视角俯瞰整片悬崖和竹林,两人分立山崖两端,山风卷起衣摆和尘土,节奏随鼓点略微加快。
Shot 3The camera cuts back to a ground-level close-up. The two slowly draw their swords and face off. The woman in red @image 1 her expression shifts from nonchalant to cold and sharp. The woman in black @image 2 目光坚毅,剑尖微微颤动,镜头平稳跟随两人绕圈移动,最后定格在两剑相交前一瞬间的特写。
整体画面烟雨江湖电影感,冷调低饱和,电影胶片质感,光影层次丰富;人物面部和身体比例稳定不变形,动作连贯自然,不僵硬,无穿模无卡顿。
其他技巧
Text Generation
The Seedance 2.0 series models support generating common text. The model can automatically match the appropriate style and color based on the context, and also supports specifying the text's color, style, appearance method, timing, and position in the prompt. When writing, prioritize using common characters, and avoidUncommon CharactersandSpecial Symbolsto ensure optimal presentation. Currently supported in scenarios such as ad copy, subtitles, and speech bubbles. For specific writing methods and examples, seeText Generation.
视频延长 vs 分段拼接
实际制作中通常结合两种方式,例如先用延长生成连贯对话,再拼接空镜或转场片段,兼顾沉浸感与节奏变化。
素材配置策略
通常把素材分成四种 “功能角色”:
Recommended Configuration(总计 4-5 个素材):角色图 1-2 张(面部特写 / 全身)+ 场景图 1 张 + 运镜视频 1 段 + 音频 1 段。
注意事项
语言规范
台词语言需统一,避免中英文混用(专有名词除外)。
特殊字符规范
提示词中合理使用符号有助于模型准确理解不同信息类型:
信息类型 | 符号 | Example |
音乐 | () | (背景中播放着快节奏的摇滚乐) |
音效 | <> | <远处传来狗叫声> |
台词 | {} | {你好,世界}。如果台词为小语种(非中英文),需标注语种,如:用日语说道{こんにちは}。 |
字幕 | 【】 | 【第一章:启程】 |
常见问题
人物 ID 漂移
Typical Phenomenon
生成的角色形象与参考图不一致,或在视频中途发生“换脸”(ID 漂移),导致视频中人物撞脸明星被审核拦截。
Root Cause Analysis
人脸参考图的有效性不足
Solution
强化人脸参考的独立性和权重:
优化前 | 优化后 |
视频中人物中途“换脸”,撞脸明星 | 人脸与参考图全程保持一致 |
视频中包含字幕
Typical Phenomenon
提示词中未要求生成字幕,生成的视频中包含字幕。
Solution
视频中有 Logo / 水印
Typical Phenomenon
提示词中未提及水印相关内容,生成的视频包含其他视频平台的 Logo / 水印。
Solution
在提示词中加入明确的约束指令:“不要生成水印”、“不要生成Logo” 。
风格漂移
Typical Phenomenon
期望生成 2D 或者 3D 动漫风格,但输入的参考图片的风格比较写实,并且提示词中未强调视频风格,生成的视频有概率漂移成真人写实风格。
Solution
在提示词中加入明确的风格约束词,例如“2D日漫风格”、“3D国风漫画”。如果需要更精准的风格控制,建议将参考图先变为目标风格再进行生视频。
优化前 | 优化后 |
仙侠风格漂移成真人风格 | 保持 3D 国漫 CG 仙侠风格 |
延长视频衔接处跳变
Typical Phenomenon
使用视频延长功能生成新视频后,将新视频与原视频进行拼接,在衔接处可能出现画面跳变、回退的问题。
Solution
当前建议通过后期剪辑修补,对齐关键帧,后续将依托模型迭代进行根本性优化。
优化前 | 优化后 |
At the transitions (5th second, 20th second), there is a Sudden frame jump or Content regression | 衔接处更加平滑 |
双胞胎问题
Typical Phenomenon
在画面人物较多且传入人物三视图作为参考素材的场景下,生成视频同一画面中易出现两个完全相同的人物。
Root Cause Analysis
Solution
在提示词中清晰定义每个人物角色,明确角色与参考图的对应关系。建议在人物名称后标注对应参考图,并保持格式统一。
示例:张三(对应图片 1)将绿色存折扔向站立的李四(对应图片 2)。
2. Add Global Constraint Instructions
Add a fixed constraint at the end of the prompt:Throughout the video, characters with identical appearance, clothing, and accessories are strictly prohibited. Do not generate duplicate clones or twin effects. Only keep the corresponding single character in the same frame; no character duplication or replication..
3. Optimize Reference Assets
人物参考图优先使用单人独立照片,不建议使用三视图、多视图素材。
4. Simplify and Optimize Prompts
请勿直接将完整剧本作为提示词使用,文案内容过度冗余易造成模型理解混乱,需精简无关表述、保证指令清晰聚焦。
优化前 | 优化后 |
画面第8秒出现“双胞胎” |
视频延长画质劣化
Typical Phenomenon
将模型生成的视频作为输入素材进行延长续写时,会出现画质劣化。多次续写会叠加劣化效果,尤其人物人脸区域易出现斑驳色块。
Solution
当前可通过以下方式缓解画质劣化,后续将依托模型迭代进行根本性优化:
优化前 | 优化后 |
直接对模型产物进行续写 | 将模型产物转化为白模视频后再进行续写 |
特效效果不符合预期
Typical Phenomenon
通过提示词文字描述特定特效时,可能会出现特效效果与预期不符的情况,例如:提示词指定「数字“2999”以倒计时动画出场」,实际生成的数字滚动特效出现无序跳变,不符合标准倒计时逻辑。
Solution
It is recommended to usereference videos定义特效:将目标特效视频作为参考素材输入模型,让模型精准理解特效形态与运动逻辑,生成效果更贴合预期。例如:数字“2999”出场方式参考视频1。
优化前 | 优化后 |
数字滚动特效有明显的无序跳变感 | 增加正确的数字滚动特效视频后,特效结果符合预期 特效动画 |
参考人物过多
Typical Phenomenon
当参考人物数量超过 4 人时,模型输出稳定性下降,生成的视频可能出现人物数量不符(如少人、多人)或人物重复等问题。
Solution
当前可通过以下方式缓解,后续将依托模型迭代进行根本性优化:
优化前 | 优化后 |
输入 8 个参考角色,输出视频有 9 人 | 将 8 个角色生成 2 张图后,再使用图生视频 |
视频结尾有噪音
Typical Phenomenon
视频中包含旁白时,视频片尾容易出现突兀咔哒声、截断杂音。
Solution
Regenerate the video, or use editing tools like CapCut to applyvolume envelope做音频淡出处理,消除截断噪音。
具体步骤 (使用剪映):

优化前 | 优化后 |
结尾有噪音 | 结尾无噪音 |
中文发音不准
Typical Phenomenon
模型对多音字、生僻字、形近字容易读错。
Solution
Replace easily mispronounced text with commonly used homophones with the same pronunciation,规避发音偏差,还原预期音频效果。注意该方案仅为优化手段,无法完全规避所有发音问题。
示例:可将提示词中“螭龙山”改写为同音字“吃龙山”。
优化前 | 优化后 |
"螭龙山"的“螭”发音不对 | 改成“吃龙山”后发音正确 |
音色参考不准
Typical Phenomenon
使用参考音频指定音色时,最终生成视频的音频音色与参考音色存在明显偏差。
Solution
优化前 | 优化后 |
音色与输入音频不匹配 输入的音频 | 提示词中增加音色特征描述后,音色匹配度明显提升 “使用@音频1低厚温润带细碎颗粒感中年男声的音色说” |
附录:提示词案例
展示在不同场景下使用 Seedance 2.0 系列模型的提示词示例,帮助您更精准地实现多模态参考的指代控制及文字生成等功能。
Text Generation
广告语(Slogan)
提示词参考模板:
「文字内容」+「出现时机」+「出现位置」+「出现方式」,「文字特征(颜色、风格)」
Multi-image Reference > Logo Reference.
参考案例:
[Final Result]
[Prompt]
Hand-drawn comic style. Three people sit together eating the fried chicken from Image 1中的炸鸡,气氛友好愉悦,后画面逐渐模糊,画面中部显示文字“快乐尽在 Seedance”。
[Reference Material]

▲ 图片 1
字幕
提示词参考模板:
画面底部出现字幕,字幕内容为“……”,字幕需与音频节奏完全同步。
参考案例:
[Final Result]
[Reference Material]

[Prompt]
生成带有画外音的视频。一个深沉、平静的男声说:“在宏大的宇宙中,我们的世界不过是一个短暂的瞬间。然而,在其中,生命不顾一切地繁荣。”场景应从夜晚缓慢过渡到黎明,星星逐渐消失,太阳从山后升起。画面底部按照台词出现字幕。
[Final Result]
[Reference Material]

[Prompt]
图片中的两人在办公室聊天,女性先说话,她说道:“你每次卡点到,是不是很享受这种刚刚好的感觉?”男性笑着回应:“我有我的节奏”角色说话时,对话随意自然,画面底部出现对应台词字幕。
气泡台词
提示词参考模板:
「角色」说:“……”,角色话说时周围出现气泡,气泡里写着台词。
参考案例:
[Final Result]
[Reference Material]

[Prompt]
Image 1中的两人穿着运动服在学校的操场跑步,女孩看向男孩,自信地笑着说:“We can definitely do it! ”镜头切到男孩的近景,他犹豫地回答:“Are you sure? ”镜头切回女孩的中近景,她语气轻快地说:“Yes! ”情绪明亮而坚定。说话的角色周边出现气泡,气泡里是对应台词。
[Final Result]
[Reference Material]

[Prompt]
Reference Image 1, Image 2中的女孩形象,女孩在一个草莓园里,摘下一颗,吃了一口,笑着说:“This is the real deal! ”女孩周围出现一个气泡,气泡里面写着台词。
Image Reference
Seedance 2.0 系列模型既支持主体多视角参考,也支持场景图、分镜图等多图参考。
If there are requirements for image order during use, upload in order. In the prompt, use Image 1, Image 2…Image n进行准确指代。
主体多视角图参考
指代清楚参考对象即可,模型能够响应的指令包括但不限于以下示例。
商品:
3C Digital Products
[Final Result]
[Reference Material]

[Prompt]
Extract the camera from Image 1, Image 2, Image 3的相机,把背景换成白色,相机在一个白色桌子上,镜头以特写的形式聚焦相机,然后以相机为主体缓慢旋转,清晰展示相机的正面侧面以及背面。
Household Items
[Final Result]
[Reference Material]

[Prompt]
背景为暖调居家场景,中景呈现参考图中的保温杯,镜头平稳推近至保温杯近景,镜头外一只手自然入镜轻握杯身拿起保温杯,镜头跟拍手部微微旋转动作展示。
角色:
[Final Result]
[Prompt]
Reference Image 1, Image 2, Image 3中的女子形象,生成她在一家咖啡店吃蛋糕的画面。
[Reference Material]

多图参考
Logo Reference
[Final Result]
[Reference Material]

[Prompt]
The background is a neon-lit futuristic city sky corridor, interwoven with flying vehicles and holographic advertisements. Reference the girl in Image 2. First, use a mid-shot to show the girl releasing a silver floating lamp with a holographic projection. Then, the camera pulls back to reveal countless floating lamps. The image gradually blurs, and the Logo from Image 1的 Logo,整体风格为 3D 赛博朋克科幻动画风格。
Multi-subject Reference
[Final Result]
[Reference Material]

[Prompt]
参考图片中的猫猫和狗狗,在一个温馨的公寓里,狗狗在趴着吃狗粮,猫猫走过来,伸出爪子碰了碰狗狗,狗狗看到猫猫后停下吃饭,猫猫依偎在狗狗身边。画面采用暖色调。
Multi-element Reference
[Final Result]
[Reference Material]

[Prompt]
The scene is set in
Image 4
the restaurant from, bustling with customers.
Image 1The girl from is wearing
Image 2the outfit from, organizing items on the counter.
Image 3The boy from is a customer who steps forward, intending to ask the girl for her contact information.
Image 5
中的标识始终显示在画面的右下角。
Multi-panel Storyboard Reference
[Final Result]
[Reference Material]

[Prompt]
参考图片中的分镜图,生成打斗激烈的打斗场面。图片中的各个分镜构图要按照顺序出现,之后二人激烈打斗。
Reference storyboard
[Final Result]
[Reference Material]

[Prompt]
Reference Image 3The storyboard composition from the reference: a girl is waiting for her dad to finish cooking. She says: "아빠, 배고파요! 밥 다 됐어요?" The girl's appearance references
Image 1. Then the camera pans right, switching to
Image 4
's scene and composition. The dad's appearance references
Image 2,爸爸回答她:“거의 다 됐어, 조금만 기다려!“,接着镜头切换回女儿略显失落的面部表情特写,她说:“아직 멀었어요? 맛있는 냄새 나는데。。。”,接着切换成爸爸的面部特写,他说:“이제 진짜 금방이야。 "빨리빨리" 하지 말고 손부터 씻고 와!”。
Video Reference
Seedance 2.0 系列模型支持视频参考,使用时指代清楚生成内容和参考对象即可。
If there are requirements for video order during use, upload in order. In the prompt, use Video 1, Video 2…Video n进行准确指代。
动作参考
Film and Television
[Final Result]
[Reference Material]
▲ 视频 1

[Prompt]
Reference Video 1Using the character actions and camera language from, generate
Image 2and
Image 1a fight scene between, with
Image 2as the left character and
Image 1是右边人物。有激烈的背景音乐。
Marketing
[Final Result]
[Reference Material]
▲ 视频 1
[Prompt]
Reference Video 1中马的奔跑形态,生成一匹金色的骏马在草原上奔跑,随即定格其奔跑的华丽姿态,变成一个马形的金吊坠。
运镜参考
[Final Result]
[Prompt]
Reference Video 1Using the camera movement from, create a concept video of a tech park. Take
Image 1the high-rise building in as the visual center, using a first-person dive perspective to convey
Image 1中园区的科技感。
[Reference Material]
▲ 视频 1

▲ 图片 1
特效参考
Film and Television
[Final Result]
[Reference Material]
▲ 视频 1

▲ 图片 1
[Prompt]
Reference Video 1 the golden particle effect from, let the character in Image 2中的人物吹笛子的同时,身边环绕一样的粒子特效。
Gameplay effects
[Final Result]
[Reference Material]
▲ 视频 1

▲ 图片 1
[Prompt]
Reference Video 1Using the effects from, make
Image 1中的女生长出相同的翅膀,翅膀生成轨迹一致。
视频编辑
Seedance 2.0 系列模型支持视频编辑,支持增加、删除或修改元素,视频的向前或向后延长,以及轨道补齐。
If there are requirements for video order during use, upload in order. In the prompt, use Video 1, Video 2…Video n进行准确指代。
元素增删改
Adding Elements
[Final Result]
[Reference Material]
▲ 视频 1
[Prompt]
Add snacks like fried chicken and pizza to the countertop in Video 1的台面上添加炸鸡、披萨等小吃。
Deleting Elements
[Final Result]
[Reference Material]
▲ 视频 1
[Prompt]
Clear
Video 1桌面上的其他零件和工具,保持桌面整洁干净,桌面上只有他俩手里的。
Modifying Elements
[Final Result]
[Reference Material]
▲ 视频 1

▲ 图片 1
[Prompt]
Replace the perfume in Video 1 with the face cream in Image 1中的面霜,动作和运镜不变。
视频延长
Extend Backward
[Final Result]
[Reference Material]
▲ 视频 1
[Prompt]
Generate the content after Video 1之后的内容,迟到的两个男士跑向他们,五个人终于见面,友好聊天。
Extend Forward
[Final Result]
[Reference Material]
▲ 视频 1
[Prompt]
Extend Forward
Video 1,给白衣男子过肩镜头,白衣男子说:“It’s not that bad. You're just stressed. Everyone goes through this, you just need to keep going.”
轨道补齐
参考案例:
[Final Result]
[Prompt]
Video 1, the moment a leaf falls to the ground, it triggers a golden particle effect. A gust of wind blows, then Video 2.
[Reference Material]
▲ 视频 1
▲ 视频 2