博客 · 2026-08-04
字节跳动给 Seedance 2.5 配了一份官方提示词指南 —— 这在视频模型里少见。它覆盖纯文本生成、以图片/视频/音频为参考的生成,以及对已有视频的编辑,而且每一类任务都给了可以直接抄用的模板。
这是那份指南的完整梳理,按原文章节逐节展开,模板一条不落。上限、特殊字符、自动锁定规则、检查清单与能力边界这些技术事实来自官方;示例是我们自己重写的,不照抄原文文案。原文没讲清楚的地方,我们直说没讲清楚,不替它猜。
状态更新(2026 年 8 月 8 日): Seedance 2.5 在我们平台上已经可以调了,模型名 `seedance-2.5` —— 480p $0.134/秒、720p $0.300/秒,仅成功扣费。这一段在今天之前写的是相反的结论:8 月 4 日探生产用的火山方舟账户时,doubao-seedance-2-5-260128 以及 -2-5、-pro-、-lite- 变体全部返回 InvalidEndpointOrModel.NotFound。真正能用的 id 是 doubao-seedance-2-5-260628。读指南时先记住一件事:已上线的 API 只有 480p 和 720p 两档——「原生 4K」出自 FORCE 发布会,不是你能请求到的东西。
提示词由六个成分组合而成。只有前两个是必须的,其余按需取用。
公式
主体 + 动作或事件
+ 场景与环境 (可选)
+ 视觉风格 (可选)
+ 运镜或切镜 (可选)
+ 声音 (可选)五个成分各自负责什么:
主体 + 动作或事件 —— 说明「谁或什么」正在「做什么」,这是视频内容的地基。动作优先概括主要过程,只为关键动作写具体细节,避免重复描述同一个动作。
场景与环境 —— 地点、时间、天气、空间关系和背景状态。
视觉风格 —— 光线、色彩、材质、画面质感或整体氛围。
运镜或切镜 —— 景别、机位、镜头运动、对焦对象和镜头衔接。
声音 —— 对白、音色、环境声、音效和音乐。
基础模板
<主体>在<场景与环境>中<主要动作或事件>。
画面呈现<视觉风格>。
镜头采用<景别、机位、运镜或切镜>。
声音包括<对白、环境声、音效或音乐>。示例
一名制琴师在狭长的工作间里完成一把小提琴,把琴身从台钳上取下,
立着放进阴干架中央。
午后斜光穿过悬浮的木屑,新上的清漆呈深琥珀色;工作台整洁,
工具收在一卷磨旧的皮套里。
镜头先以中景记录松开台钳的双手,再缓慢推近面板木纹,
最后切到阴干架的正面。
保留刨子的刮擦声、台钳的卡扣声和安静的室内环境声。生成参数不需要写进提示词。分辨率、时长、画幅由生成页面或接口设置。
一次最多可以组合 50 份参考素材。每一类都有硬性输入范围和一个更窄的推荐范围;推荐范围是为了提高生成稳定性,不代表能力上限。
四类素材的输入范围与推荐范围
图片 输入范围 最多 30 张,单张不超过 4K
推荐范围 主体图片以 1 至 8 个主体为宜
视频 输入范围 最多 10 段,全部视频总时长不超过 30 秒
推荐范围 主体音视频以 1 至 5 个主体、单段 5 至 10 秒为宜
音频 输入范围 最多 10 段,全部音频总时长不超过 30 秒
推荐范围 只保留与任务直接相关的台词、音色、环境声或音乐
视频编辑 输入范围 可使用视频与参考图共同完成编辑
推荐范围 原视频以 20 秒以内、参考图以 1 至 5 张为宜超过推荐范围仍可尝试:主体图可扩展至 9 至 12 个主体,主体音视频可扩展至 6 至 10 个主体,视频编辑参考图可扩展至 6 至 8 张。官方把代价写得很直白 —— 素材越多,稳定性越容易下降。
主体图超过 5 个主体且仍需要多视角时,建议把不同视角拆成多张图片。多张独立视角图通常比把多个视角拼在一张图中更稳定。
给每一份素材指派职责。 上传之后要说明每份素材具体提供什么。当素材里的人物、背景或构图容易被误带入成片时,再写明不采用什么。
素材映射关系必须写进提示词。 不要只依赖图片里的文字标注,也不要让模型自行判断多份素材分别对应哪个人物、道具或场景。
素材职责模板
@图片1用于<主体>的<外貌、服装、结构或材质>。
@视频1用于<动作、运镜或节奏>。
@音频1用于<角色或声音类型>的<音色、台词、环境声或音乐>。
<主体>在<场景>中完成<主要动作或事件>。
画面呈现<视觉风格>,镜头采用<镜头表达>。示例
@图片1用于<面包师>的五官、发型和沾着面粉的灰色围裙,不采用图片背景。
@图片2用于<面包房>的操作台布局、瓷砖墙面和窗户位置,不采用图中人物。
@视频1用于整形面团、托起面团和送入烤箱的动作节奏,
不采用视频中的人物身份、服装和场景。
<面包师>在<面包房>整形一只酸种面包,并把它送进平炉。
镜头以中景记录整形动作,再缓慢推近面包表皮;
保留木铲的摩擦声、炉门声和室内环境声。如果多张图片是同一个人物或商品的不同视角,要明确写出来,并说明成片中该物体应当只有几个。
多视角示例
@图片1定义同一盏折叠台灯的正面外观。
@图片2定义同一盏折叠台灯的左侧结构。
@图片3定义同一盏折叠台灯的右侧结构。
@图片4定义同一盏折叠台灯的背面结构。
四张图片共同定义同一盏折叠台灯,成片中始终只有一盏折叠台灯。当参考视频已经准确给出动作、运镜和顺序时,提示词只需说明继承哪些内容,不必逐动作复述。重复描述可能与素材本身冲突,而冲突时通常是素材输。
白模视频主要提供运动和空间骨架,仍然需要写清希望生成的主体、场景、动作和风格。
提示词可以直接使用自然语言。当一个镜头里同时有多层声音、需要进一步区分音乐、音效、台词和字幕时,用下面四种符号。
四种符号
音乐 ( ) (背景播放舒缓节奏的钢琴乐)
音效 < > <远处传来钟声>
台词 { } {你好,欢迎回来}
字幕 【 】 【第一章:启程】需要控制字幕或声音时,直接写明保留和不采用的声音类别。画面内容仍然优先使用正向描述 —— 只有素材职责、编辑范围和容易误带入的内容才需要明确限制。
示例
无背景音乐,只保留人物对白、环境声和动作音效。
不要字幕。
不要任何声音。台词语言强化。 台词不是中文时,建议在台词前明确语言:
女孩用日语轻声说:{もう大丈夫です}当台词文本是英语但模型说成了中文,或者需要控制地区语言习惯时,可以进一步明确。推荐公式:
公式
台词语言 + 地区变体或口音 + 表达方式 + 说话人 + {台词内容}示例
台词语言:美式英语。女孩用自然、口语化的美式英语说:
{I thought you weren't coming.}
台词语言:地道的洛杉矶美式英语。年轻男子用自然的洛杉矶口语说:
{No way, you actually made it.}图片、视频和音频可以组合使用。素材一多,提示词的重点不是把全部素材塞进同一句话,而是把人物、道具、场景、动作和声音之间的对应关系写清楚。按下面的顺序组织:
组织顺序
逐份素材职责 → 主体映射 → 按类型分组 → 主体设定 → 分场景调用第一步 —— 为不同主体逐一命名。 不同人物、商品和道具需要分别绑定素材。
<人物A>对应@图片1,只采用外貌、发型和服装。
<人物B>对应@图片2,只采用外貌、发型和服装。
<道具A>对应@图片3,只采用结构、材质和颜色。
<场景A>参考@图片4,只采用空间布局、建筑和光线,不采用图中人物。不要写成「@图片1至@图片4分别定义四名角色」。这种写法从来没说清哪张图对应哪个角色。
第二步 —— 按类型整理素材。
【人物】
<修复师>对应@图片1,只采用外貌、发型和服装。
<记录员>对应@图片2,只采用外貌、发型和服装。
<布展员>对应@图片3,只采用外貌、发型和服装。
<讲解员>对应@图片4,只采用外貌、发型和服装。
四人的外貌、服装、动作、站位和台词不互相交换。
【道具】
<样本盒>对应@图片5,只属于<修复师>。
<记录板>对应@图片6,只属于<记录员>。
【场景】
<修复室>参考@图片7,只采用空间、材质和光线。
<展厅>参考@图片8,只采用空间、材质和光线。
【动作与声音】
@视频1用于<修复师>打开样本盒的动作,不采用视频中的人物和场景。
@音频1用于<讲解员>的音色和指定台词。第三步 —— 集中描述重要主体。 当同一人物需要跨场景使用多份素材时,把他的定义收在一个块里。
【主体设定:修复师】
外貌与服装:@图片1。
固定道具:@图片5中的<样本盒>。
出现地点:<修复室>和<展厅>。
动作参考:@视频1的开盒动作、@视频2的放置样本动作。
不采用:其他人物的服装;不持有<记录板>或讲解设备。第四步 —— 按场景调用素材。 写清这个场景用什么、发生什么、结束时是什么状态。
场景一|修复室检查
使用:<修复师>、<样本盒>、<修复室>和@视频1的开盒动作。
事件:<修复师>在工作台前打开样本盒并检查内部样本。
结束时:<修复师>停在工作台内侧;样本盒始终位于<修复师>自身右手旁,
也就是位于画面左侧。
场景二|展厅登记
使用:<记录员>、<记录板>和<展厅>。
事件:<记录员>在展柜旁核对记录板上的编号。
结束时:记录板仍由<记录员>双手持有,其他人物不进入展柜区域。多素材创作的目标是让模型在当前场景中选择正确的素材,并不要求所有素材同时出现在画面中。
事件一多,单一描述撑不住半分钟。办法是把故事拆成连续阶段,每个阶段只安排一个主要状态变化,并且 —— 这一条最关键 —— 写清该阶段结束时画面上能直接看到的状态。
长视频模板
【生成目标】
生成一段<视频类型>。核心主体是<主体>,主要事件是<故事概要>。
【阶段一】
开始时:<人物、道具和场景的初始状态>。
主要事件:<一个主要动作或事件>。
结束时:<人物位置、道具归属或画面状态>。
【阶段二】
承接上一阶段:<需要保持的状态>。
主要事件:<一个主要动作或事件>。
结束时:<可观察状态>。
【阶段三】
主要事件:<收束事件>。
结束时:<最终画面状态>。
【保持一致】
保持<人物身份、数量、服装、道具归属、空间方向和声音关系>稳定。示例 —— 花店订单包装流程
【生成目标】
生成一段花店订单包装流程说明视频。<花艺师>和<店员>共同完成
花束整理、包装和交付。
【阶段一】
开始时:<花艺师>站在工作台后,桌面放有散开的花枝、剪刀和包装纸。
主要事件:<花艺师>整理花枝并修剪长度。
结束时:花束握在<花艺师>左手,剪刀放回工作台右侧。
【阶段二】
承接上一阶段:两人保持相同身份和服装,花束仍由<花艺师>持有。
主要事件:<店员>展开包装纸,<花艺师>放入花束并系上绿色丝带。
结束时:包装完成的花束平放在工作台中央,丝带结朝向镜头。
【阶段三】
主要事件:<店员>拿起花束并放到取货架上。
结束时:花束只在取货架中央,两人站在工作台后方检查成品。
【保持一致】
保持<花艺师>和<店员>的身份、服装、工作台方向、剪刀位置和
花束归属稳定。时间戳与节奏控制。 普通叙事优先使用「阶段」。只有关键交接、进出场、转场或明确节拍需要控制时,再使用以 1 秒为单位的时间表达。时间区间适合分配剧情节奏,时间点适合指定一次关键事件,相对时间适合描述事件之间的等待关系。
示例
0-5秒:展示空置的木质展示台;一只手放下白色陶盘;
结束时手已离开,展示台中央只有白色陶盘。
5-10秒:移走白色陶盘,再放下透明玻璃杯;
结束时展示台中央只有透明玻璃杯。
10-15秒:移走透明玻璃杯,再放下绿色陶瓶;
结束时展示台中央只有绿色陶瓶。时间区间 0-3秒 …… 3-7秒 …… 7-12秒 ……
明确时间点 第5秒,镜头快速向左横移并完成转场。
相对时间 人物按下按钮 3 秒后,房间灯光逐渐熄灭。时间段应当连续、不重叠。时间段表示的是事件的时间预算,不是精准剪辑点 —— 动作可能在边界附近提前或延后。一个时间段里内容过少会放大模型的发挥空间,过多则可能造成过度切镜或剧情遗漏。不要用时间戳去控制「一秒完成三次动作」这类频率。
视频编辑、首帧或首尾帧生视频、视频延长这三类任务,会根据输入素材自动锁定部分生成参数。这一点容易踩坑,因为被锁的参数是静默忽略,不会报错。
三类任务的比例与时长规则
视频编辑
画幅比例 自动保持输入视频的比例,不支持另行设置
时长 自动基本保持输入视频的时长,不支持另行设置;
受输入帧处理影响,可能存在最大约 0.3 秒的差异
首帧 / 首尾帧生视频
画幅比例 自动使用首帧图片的比例;首帧与尾帧应使用相同画幅,
否则尾帧可能被拉伸
时长 支持设置
视频延长
画幅比例 自动保持输入视频的比例,不支持另行设置
时长 支持设置被自动锁定的参数不能在生成页面或接口中另行指定,其余参数以当前可用选项为准。
编辑已有视频时,先把原视频定义为唯一母版,再说明编辑对象、作用范围、目标素材和保持内容。
通用编辑模板
【编辑目标】
编辑@视频1,在<全片或明确时间段>对<画面对象、区域或声音类别>
进行<增加、移除、替换或调整>。
【原视频职责】
@视频1是唯一编辑母版,负责<人物、场景、动作、构图、镜头、
遮挡关系、声音和事件顺序>。
【目标素材职责】
@图片1或@音频1用于<目标对象或声音的指定属性>。
【编辑范围】
只处理<对象、区域、时间段或声音类别>。
【保持内容】
保持@视频1中的<不应变化的画面、动作、声音和时间关系>。示例
【编辑目标】
编辑@视频1,只在 4-7 秒把画面右侧墙面的冷蓝色灯光调整为暖橙色灯光。
【原视频职责】
@视频1是唯一编辑母版,负责人物、房间布局、动作、构图、镜头运动、
声音和事件顺序。
【编辑范围】
只调整右侧墙面及其照亮区域的光线颜色;人物肤色随环境光自然变化。
【保持内容】
人物身份、服装、表情、位置、动作、房间结构、镜头运动、对白和
环境声保持@视频1。案例 A —— 主体替换。
模板
【编辑目标】
编辑@视频1,只把<原对象>修改为<目标对象>。
【原视频职责】
@视频1是唯一编辑母版,负责原始场景、机位、镜头运动、动作轨迹、
遮挡关系和事件顺序。
【目标素材职责】
@图片1用于<目标对象>的<外观、结构或材质>,
不采用<无关背景、人物或构图>。
【编辑对象与范围】
只修改<明确对象和区域>。全片目标对象数量为<数量>。
不修改<需要保持的内容>。
【时间线继承】
<目标对象>继承<原对象>每次出现、运动、遮挡和离开的时点、
持续时长、路径与速度变化。
除以上明确修改的对象或区域外,@视频1中的其他人物、道具、场景内容、
镜头运动、镜头切换和事件顺序保持原样。示例
【编辑目标】
编辑@视频1,只把视频中的黄色折叠台灯替换为@图片1中的白色折叠台灯。
【原视频职责】
@视频1是唯一编辑母版,负责书桌、书本、手部动作、机位、镜头运动、
遮挡关系和事件顺序。
【目标素材职责】
@图片1只用于白色折叠台灯的外观、结构和材质,
不采用图片中的背景、构图或其他物体。
【编辑对象与范围】
全片始终只有一盏白色折叠台灯。只替换原黄色折叠台灯,
不修改书本、书桌、手部和背景。
【时间线继承】
白色折叠台灯继承原黄色折叠台灯每次出现、转动灯臂、被手遮挡和
离开画面的时点、路径与速度变化。
除以上明确修改的对象外,@视频1中的其他人物、道具、场景内容、
镜头运动、镜头切换和事件顺序保持原样。这段「时间线继承」是整份指南里最有用的一句 —— 替换对象后数量乱、时机乱,基本都是因为没写它。
案例 B —— 背景替换。
模板
【编辑目标】
编辑@视频1,只把<原背景区域>替换为@图片1中的<目标环境>。
【原视频职责】
@视频1是唯一编辑母版,负责人物、前景物体、动作、构图、
镜头运动和事件顺序。
【目标素材职责】
@图片1只用于<目标环境>的空间布局、材质、景深、环境色和光线方向,
不采用图片中的人物或前景物体。
【编辑对象与范围】
只修改<主体轮廓之外的背景区域>。不修改<主体身份、五官、发型、
服装、表情、位置、大小和动作>。
【时间线继承】
人物动作与遮挡关系保持@视频1。除以上明确修改的对象或区域外,
@视频1中的其他人物、道具、场景内容、镜头运动、镜头切换和
事件顺序保持原样。示例
@视频1是唯一编辑母版,负责人物、动作、构图、镜头和事件顺序。
@图片1只提供日间玻璃温室的空间布局、景深、环境色和光线方向,
不采用图片中的人物。
只把@视频1中人物轮廓之外的浅灰色背景替换为@图片1中的日间玻璃温室。
人物身份、五官、发型、服装、表情、位置、大小和抬手动作保持@视频1。
除以上明确修改的区域外,@视频1中的其他人物、道具、场景内容、
镜头运动、镜头切换和事件顺序保持原样。声音编辑。 对白、语言、音色、背景音乐和音效可以分别处理。提示词需要写清说话人或声音类别、目标变化,以及其他声音是否保持。
示例
编辑@视频1,只移除原有背景音乐,保留人物对白、口型、环境声和
动作音效;画面内容、镜头和剪辑节奏保持@视频1。
编辑@视频1,把<讲解员>的台词语言调整为自然的美式英语,
台词内容和说话时点保持不变;其他人物声音、背景音乐、环境声和
画面保持@视频1。视频延长是在原视频边界之外继续创作。输出比例自动保持输入视频比例,延长时长由你设置。
两个方向的边界画面
向前延长 ← [ 原视频 ] → 向后延长
首帧 尾帧边界画面必须连续。 向后延长时,延长片段的第一个画面需要承接原视频尾帧;向前延长时,延长片段的最后一个画面需要衔接原视频首帧。除了边界画面,还要保持人物、道具、背景、运动趋势和声音连续。
向后延长。 先描述原视频尾帧的连续状态,再描述尾帧之后发生的内容。
基础模板 —— 向后延长
@视频1是需要向后延长的原视频。
向后延长@视频1。延长片段的第一个画面直接承接@视频1的尾帧:
保持<主体姿态与朝向>、<道具位置>、<背景与空间关系>、
<机位与构图>、<光线>、<声音状态>和<运动趋势>连续。
随后,<描述需要延长的新动作、事件、镜头或声音>。
延长过程中保持<人物身份与服装>、<关键道具>、<背景布局>、
<摄影轴线>和<原有声音环境>连续。
同一主体始终保持为同一个连续对象,不重复、不分裂;
人物外形或物体部件数量保持稳定。示例
@视频1是需要向后延长的原视频。
向后延长@视频1。延长片段的第一个画面直接承接@视频1的尾帧:
保持同一固定中景、橙色纸飞机的位置与朝向、教室窗边背景、
午后光线和向画面右侧飞行的趋势连续。
随后让橙色纸飞机继续向画面右侧滑行并飞出画面,
窗边白色纱帘轻微摆动。镜头和教室背景保持原视频尾帧状态。模板 —— 向后延长,有其他参考素材时
@图片1定义<人物A>的面部特征。
@图片2定义<人物A>的服装。
@图片3定义<关键道具>的结构与材质。
@视频1是需要向后延长的原视频。
向后延长@视频1。延长片段的第一个画面直接承接@视频1尾帧:
保持<边界画面与声音状态>连续。
随后,<人物A使用关键道具完成的新动作或事件>。
延长过程中保持<人物身份与服装>、<关键道具>、<背景布局>、
<摄影轴线>和<原有声音环境>连续。
同一主体始终保持为同一个连续对象,不重复、不分裂;
人物外形或物体部件数量保持稳定。示例
@图片1定义<园艺师>的面部特征。
@图片2定义<园艺师>的浅绿色工作围裙。
@图片3定义<藤编花篮>的结构与材质。
@视频1是需要向后延长的原视频。
向后延长@视频1。延长片段的第一个画面直接承接@视频1尾帧:
保持温室工作台、<园艺师>的站位和<藤编花篮>的位置连续。
随后,<园艺师>双手提起<藤编花篮>并把它放到身后的木架中层。
延长过程中保持<园艺师>的面部、围裙、温室布局和镜头方向连续。其他素材可以提供人物、道具或声音,但不能替代原视频尾帧对起始画面的控制。
向前延长。 先描述原视频开始之前发生的内容,再把原视频首帧写成延长片段的明确结束状态。只写「随后承接原视频」,往往会让模型提前引入后续人物或特效,或者到达目标状态之后又继续改画面。
基础模板 —— 向前延长
@视频1是需要向前延长的原视频。
向前延长@视频1。在原视频开始之前,<描述前置动作、事件、镜头或声音>。
延长片段的最后一个画面自然衔接@视频1首帧:<主体姿态与朝向>,
<道具位置>,<背景与空间关系>;保持<机位与构图>、<光线>、
<声音状态>和<运动趋势>与@视频1首帧一致。
延长过程中保持<人物身份与服装>、<关键道具>、<背景布局>、
<摄影轴线>和<原有声音环境>连续。
同一主体始终保持为同一个连续对象,不重复、不分裂;
人物外形或物体部件数量保持稳定。示例
@视频1是需要向前延长的原视频。
向前延长@视频1。在原视频开始之前,呈现同一座玻璃温室的空镜:
晨雾贴近地面缓慢散开,顶部遮阳帘逐渐升起,画面中暂时没有人物。
延长片段的最后一个画面自然衔接@视频1首帧:保持温室中央通道、
两侧种植台、玻璃框架、柔和晨光和固定广角构图与@视频1首帧一致;
结束时遮阳帘已经完全升起,通道中没有人物,叶片仍在轻微摆动。模板 —— 向前延长,有其他参考素材时
@图片1定义<人物A>的面部特征。
@图片2定义<人物A>的服装。
@图片3定义<关键道具>的结构与材质。
@视频1是需要向前延长的原视频。
向前延长@视频1。在原视频开始之前,<人物A完成前置动作或事件>。
延长片段的最后一个画面自然衔接@视频1首帧:<人物A的姿态与朝向>,
<关键道具的位置与状态>,<其他人物的站位>;保持<背景与空间关系>、
<机位与构图>、<光线>、<声音状态>和<运动趋势>与@视频1首帧一致。
延长过程中保持<人物身份与服装>、<关键道具>、<背景布局>、
<摄影轴线>和<原有声音环境>连续。
同一主体始终保持为同一个连续对象,不重复、不分裂;
人物外形或物体部件数量保持稳定。
<只在原视频开始后出现的素材>不在向前延长片段中提前出现。示例
@图片1定义<策展员>的面部特征。
@图片2定义<策展员>的深蓝色工作外套。
@图片3定义<木质展示盒>的结构与材质。
@图片4定义两名<布展助理>的灰色工作服。
@图片5定义<展陈准备室>的空间和光线。
@视频1是需要向前延长的原视频。
向前延长@视频1。在原视频开始之前,<策展员>走到工作台前,
拿起闭合的<木质展示盒>并打开盒盖。
延长片段的最后一个画面自然衔接@视频1首帧:<策展员>站在画面中央,
双手托住打开的<木质展示盒>;两名<布展助理>分别站在其身后左右两侧。
保持竖屏正面中景、工作台位置、准备室背景和左侧晨光与@视频1首帧一致。边界画面应追求视觉上的自然衔接,不应理解为逐像素完全相同。延长结果的音量可能与原视频存在轻微变化;使用同代模型生成的视频继续延长时,画面与声音通常更容易自然衔接。验收时需要同时检查边界前后的画面、声音和完整延长片段。
首尾帧与参考素材。 在多模态参考模式中,可以直接在提示词首句写明 @图片1 作为首帧、@图片2 作为尾帧,不必切换到单独的首尾帧模式。系统会以首帧画幅锁定输出比例,时长由生成页面或接口设置;首帧与尾帧应使用相同画幅,比例不一致时尾帧可能出现拉伸。其余参考图仍可分别定义人物、道具、场景和材质。
基础模板
@图片1作为首帧,定义视频开始时的构图、主体位置、姿态、道具状态、
场景和镜头方向。
@图片2作为尾帧,定义视频结束时的构图、主体位置、姿态、道具状态、
场景和镜头方向。
@图片3用于<主体A>的<外貌、服装、结构或材质>,
不改变@图片1定义的首帧构图,不改变@图片2定义的尾帧构图。
@图片4用于<主体B、道具或场景>的<指定属性>,
不改变@图片1定义的首帧构图,不改变@图片2定义的尾帧构图。
<描述一个连续动作或事件>。
画面从@图片1定义的首帧自然开始,经过连续动作后到达@图片2定义的尾帧。
首尾之间保持<人物身份、道具结构与归属、场景布局和镜头方向>连续。示例
@图片1作为首帧,定义视频开始时香水工坊的构图、人物位置、姿态、
桌面道具状态和镜头方向。
@图片2作为尾帧,定义视频结束时的同样内容。
@图片3用于<调香师>的面部、发型和深绿色围裙,
不改变@图片1定义的首帧构图,不改变@图片2定义的尾帧构图。
@图片4用于<玻璃香水瓶>的造型、材质和标签位置,
不改变@图片1定义的首帧构图,不改变@图片2定义的尾帧构图。
<调香师>从首帧姿态开始,拿起滴管和<玻璃香水瓶>,把琥珀色香精滴入瓶中,
轻轻摇匀并盖好瓶塞,再把成品放到桌面中央,
最后自然到达@图片2定义的尾帧。
首尾之间保持<调香师>的身份与服装、香水瓶数量与结构、木桌布局、
暖色侧光和镜头方向连续。每张锚点图需要单独说明,不要合并成「图片1和图片2作为首尾帧」。首帧和尾帧应使用相同画幅。其他参考图只提供指定属性,不替代首尾帧的构图。
多关键帧顺序控制。 当多张独立图片分别定义过程中的不同阶段时,提示词第一句先写顺序声明,再逐张说明每张图对应的关键状态。
基础模板
以@图片1至@图片N的顺序作为关键帧。
@图片1作为首帧,定义<开始时的构图、主体位置、姿态、道具状态和
镜头方向>。
@图片2定义第二个关键帧:<第一阶段结束时的可见状态>。
@图片3定义第三个关键帧:<第二阶段结束时的可见状态>。
@图片N作为尾帧,定义<结束时的构图、主体位置、姿态、道具状态和
镜头方向>。
画面依次经过@图片1、@图片2、@图片3至@图片N定义的状态,
各阶段之间使用连续动作自然过渡。
全过程保持<主体身份、道具结构与归属、场景布局、光线和摄影轴线>连续。示例
以@图片1至@图片4的顺序作为关键帧。
@图片1作为首帧,定义橙色纸飞机静置在教室木桌左侧,
机头朝向画面右侧,固定中景。
@图片2定义第二个关键帧:同一架橙色纸飞机被一只手从桌面托起,
机头方向不变。
@图片3定义第三个关键帧:同一架橙色纸飞机从窗边掠过,
窗帘向右轻微摆动。
@图片4作为尾帧,定义同一架橙色纸飞机落在右侧书架中层,
机头仍朝向画面右侧。
画面依次经过@图片1至@图片4定义的状态,
各阶段之间保持飞行方向和速度连续。
全过程保持纸飞机的橙色材质、大小与折痕,教室布局、午后侧光和
镜头轴线连续。独立关键帧通常比把多个画面拼在一张宫格图中更容易对齐。但要理解它控制的是阶段顺序和关键状态,不等于逐帧复刻。
宫格分镜与故事板。 宫格分镜用于给出整体故事、镜头顺序和大致构图,不适合要求每格细节严格复刻。建议控制在 15 格以内,使用简洁线稿或干净示意图并减少文字标注。提示词应明确读取顺序,再写出每格的主体动作、景别或运镜、最终画风和声音。
基础模板
@图片1提供<N格宫格分镜>的镜头顺序和大致构图,
按照<从左到右、从上到下>的顺序读取;
不采用图中的<线稿画风、文字标注或占位人物>。
@图片2定义<主体A>的<外貌与服装>。
@图片3定义<关键道具或场景>的<结构、材质或光线>。
镜头1:<景别、主体动作、场景状态>。
镜头2:<景别、主体动作、运镜或切换方式>。
……
镜头N:<结束动作和结束画面状态>。
最终画面采用<视觉风格>,声音包括<对白、环境声、动作音效或音乐>。示例
@图片1提供四格陶艺制作分镜的镜头顺序和大致构图,
按照从左到右、从上到下的顺序读取;不采用图中的线稿画风和文字标注。
@图片2定义<陶艺师>的面部、短发和深灰色围裙。
@图片3定义<蓝釉杯>的杯身比例、釉面颜色和弧形杯把。
镜头1:广角呈现安静的陶艺工作室,<陶艺师>坐在拉坯机前。
镜头2:中景侧拍<陶艺师>双手扶住旋转的湿陶坯,杯身逐渐成形。
镜头3:特写手指修整杯口与杯把连接处,泥浆沿指尖缓慢滑落。
镜头4:中近景呈现烧制完成的<蓝釉杯>被放上木架,<陶艺师>收回双手。
最终画面采用写实纪录片质感,保留拉坯机转动声、湿泥摩擦声和
工作室环境声。白模参考。 白模分为粗粒度和细粒度两类,选错类型等于浪费素材。
两类白模的分工
粗粒度白模
适合情况 用简单几何体预演动作、动线、站位、运镜或切镜
素材要求 几何体关系清楚,动作序列完整;
可叠加人物、道具和场景图片
提示词重点 逐一映射白模主体,并说明继承哪些时序与空间信息
细粒度白模
适合情况 已有完整建模,需要更换人物、材质、色彩、场景或风格
素材要求 模型结构完整且画面干净,
避免轨迹线、坐标线和相机锥体
提示词重点 保持结构、动作和镜头,明确需要重渲染的属性粗粒度白模适合锁定动作轨迹、运动方向、人物站位、进出场、机位路径、切镜位置、光影变化和声音节奏。白模中的每个几何体都应单独映射到最终主体或道具;外观由其他参考图片定义。
白模信息 → 需要说明的内容
动线 动作轨迹、运动方向、人物站位和进出场顺序
运镜 机位、镜头路径、运动方向和速度变化
光照 光线方向、明暗变化和变化发生的时机
切镜 切镜位置,以及切镜前后的主体与构图
声音 是否继承对白、音乐、环境声或动作音效优先使用关系清楚的简单几何体。手臂、翅膀等附属结构只有在动作序列完整时才适合作为白模信息,否则容易造成动作僵硬或结构误判。
基础模板 —— 粗粒度白模
@视频1是粗粒度白模参考,仅提供<动作路径、人物站位、机位、运镜、
切镜、光影变化、声音节奏或空间关系>,
不采用其中的白模外观、材质和场景。
@视频1中的<白模主体A>对应<主体A>。
@视频1中的<白模主体B或几何道具>对应<主体B或关键道具>。
@图片1定义<主体A>的<外貌、服装或结构>。
@图片2定义<主体B、关键道具或场景>的<指定属性>。
<主体>在<场景>中完成<主要动作或事件>。
保持@视频1中的<动作路径、站位、运镜、切镜、光影或声音节奏>。
最终画面采用<人物、场景、材质和视觉风格>,
声音包括<对白、环境声或动作音效>。示例
@视频1是粗粒度白模参考,仅提供人物行走路径、展车移动方向、固定机位、
一次推镜和两次切镜,不采用其中的灰色几何体外观与空白场景。
@视频1中的高圆柱体对应<讲解员>。
@视频1中的长方体对应<移动展车>。
@图片1定义<讲解员>的面部、蓝色制服和胸牌。
@图片2定义<移动展车>的白色金属框架和透明展罩。
@图片3定义科技展厅的弧形墙面、灰色地面和顶部条形灯。
<讲解员>推着<移动展车>沿弧形墙面前进,在中央展台前停下并
打开透明展罩。
保持@视频1中的行走路径、主体站位、推镜方向和切镜位置。
画面采用明亮写实的展馆纪录片风格,保留脚步声、车轮声和展厅环境声。细粒度白模已经具备完整人物、道具或场景结构,适合更换材质、色彩、人物形象、场景和整体视觉风格。白模画面应尽量干净,不要保留轨迹线、坐标轴、控制器或相机锥体等制作标记。
基础模板 —— 细粒度白模
@视频1是细粒度白模参考,保持<主体结构、动作、空间布局、机位、
运镜和切镜>,不采用原有灰模材质和空白背景。
@图片1定义<主体>的<人物形象、材质、颜色或表面细节>。
@图片2定义<场景>的<空间、材质、光线或视觉风格>。
将@视频1中的<主体>重渲染为<最终主体>,场景重渲染为<最终场景>。
保持@视频1中的<结构、动作、镜头和空间关系>,
画面呈现<材质、色彩和风格>,声音包括<环境声、音效或音乐>。示例
@视频1是细粒度白模参考,保持环形装置的完整结构、三层圆环转动关系、
展台位置、环绕运镜和切镜,不采用原有灰模材质与空白背景。
@图片1定义装置外环的拉丝黄铜材质。
@图片2定义内层叶片的半透明蓝色玻璃材质。
@图片3定义当代艺术展厅的白色曲面墙、深灰地面和顶部柔光。
将@视频1中的环形装置重渲染为黄铜与蓝色玻璃组成的动态雕塑,
场景重渲染为当代艺术展厅。
保持@视频1中的结构、转动节奏、环绕运镜和切镜,
保留装置低沉转动声与安静的室内环境声。一键成片适合把多张图片,或图片与风格参考视频,组织成具有统一节奏和包装风格的完整视频。提示词需要说明每份素材的职责、图片顺序、画面动态、剪辑节奏、视觉包装和声音;不要只写「把这些素材做成视频」。
组织顺序
素材职责 → 图片顺序 → 动态幅度 → 剪辑风格 → 视觉包装 → 声音基础模板
【素材职责】
@图片1用于<人物、商品、场景或开场画面>。
@图片2用于<人物、商品、场景或过程画面>。
@图片3用于<人物、商品、场景或结尾画面>。
@视频1仅用于<剪辑节奏、转场、字幕包装或音乐风格>,
不采用其中的人物身份和场景。(可选)
【编排方式】
图片按照<上传顺序、指定顺序或主题自由编排>出现。
<说明需要保持的人物、商品、地点和事件关系>。
【画面动态】
每张图片采用<轻微Live动效、视差、推拉、横移或局部动作>。
保持<主体外观、商品结构、文字或背景关系>稳定。
【成片风格】
采用<剪辑节奏、转场方式、字幕或图形包装、色彩风格>。
【声音】
包括<对白、环境声、音效或音乐>。示例 —— 夜市旅行短片
【素材职责】
@图片1用于夜市入口和开场环境。
@图片2用于<旅行者>沿街行走的画面。
@图片3用于灯笼摊位和手工艺细节。
@图片4用于三位朋友围桌用餐。
@图片5用于河边夜景和倒影。
@图片6用于三人在桥边合影的结尾画面。
@视频1仅用于轻快剪辑节奏、手绘贴纸和转场方式,
不采用其中的人物身份与地点。
【编排方式】
画面按照@图片1至@图片6的顺序出现,
形成「到达夜市、沿街游览、用餐、散步、合影」的完整过程。
保持三位朋友的外貌与服装稳定,不互相混合。
【画面动态】
环境图片采用缓慢推近和轻微视差;
人物图片只增加自然眨眼、转头、举杯和衣物随风摆动。
保持摊位结构、餐桌位置和桥边栏杆稳定。
【成片风格】
采用明快的旅行短片节奏,场景之间使用自然遮挡和相近色彩衔接,
手绘贴纸只出现在画面边缘。
【声音】
保留夜市人声、餐具轻响和河边风声,配合轻快但不过分抢眼的器乐音乐。图片顺序重要时,应逐张写明出现顺序;允许模型自由编排时,也要明确写出「可按主题自由编排」。涉及多个人物或多个商品时,仍需逐一命名并绑定素材。
视频无缝转场是在两段视频之间生成连续的过渡内容。提示词需要先说明哪一段是转场前视频、哪一段是转场后视频,再写清触发动作、镜头运动、画面如何变化、最终到达的状态和声音衔接。
组织顺序
转场前视频 → 转场后视频 → 触发动作 → 镜头运动 → 画面变形
→ 到达状态 → 声音五种转场方式的写法重点
俯冲或折返 镜头方向、速度变化,以及何时进入下一场景
人物旋转 人物姿态、旋转方向,以及服装或背景如何连续变化
前景遮挡 遮挡物何时覆盖全屏,以及遮挡后出现的构图
物体变形 前后物体对应的形状、材质和变形过程
推拉或焦点 镜头运动、焦点对象,以及前后空间的连续关系基础模板
@视频1是转场前片段,采用其<尾部主体、动作、构图、镜头方向和声音>。
@视频2是转场后片段,采用其<开头主体、构图、镜头方向和声音>。
保持@视频1和@视频2原有片段中的<人物身份、商品结构、场景和
主要动作>稳定。
在@视频1尾部,<主体或前景物>通过<动作>触发转场。
镜头<运动方向和速度变化>,画面中的<形状、材质、光线或空间>
逐渐变化为@视频2开头的<对应元素>。
转场结束时自然到达@视频2的开头构图,
并保持<主体位置、镜头方向和运动趋势>连续。
声音从<前段声音>平滑过渡到<后段声音>。示例
@视频1是转场前片段,采用雨夜街道、红色雨伞、缓慢向前推近的镜头和雨声。
@视频2是转场后片段,采用展厅圆形天窗、向上抬升的镜头和安静室内混响。
保持两段原视频中的人物、街道、展厅结构和主要动作稳定。
在@视频1尾部,红色雨伞靠近镜头并逐渐覆盖整个画面,触发转场。
镜头继续向前推进,雨伞的圆形边缘逐渐变成展厅天窗的金属圆环,
红色伞面逐渐过渡为天窗透入的白色天光。
转场结束时自然到达@视频2开头的仰拍构图,
镜头由向前推进平滑转为向上抬升。
雨声逐渐减弱,并平滑过渡为展厅内的脚步回声。无缝转场的目标是让画面与声音自然衔接。提示词可以要求保持两段原视频的主要内容,但不能把生成式过渡理解为逐像素不变的剪辑拼接。
只写「紧张、温馨、压抑」这类情绪词,模型能理解整体方向,但具体表演方式会有很大发挥空间。想稳定控制人物演技,就写明能够直接看到或听到的表现:眼神、眉头、嘴角、呼吸、视线和手部动作。不必罗列所有面部细节 —— 单次情绪转折通常选 2 至 4 个最明确的表现即可;只有当情绪包含多次转折时,才需要按触发事件分阶段描述。
默认写法 —— 单次情绪转折
整体情绪从<起始情绪>转为<结束情绪>。
发生<触发事件>后,<主体>先出现<即时可观察反应>。
随后,<眼神、眉头、嘴角、呼吸、视线或手部动作>逐渐发生<变化>。
最终,<主体>以<克制或明确的外在表现>表达<目标情绪>。多阶段情绪 —— 按触发事件递进
听到或看到<第一个触发事件>时,<主体的第一个可观察反应>。
当<第二个触发事件>出现后,<主体的表情、视线或呼吸发生的变化>。
确认<关键信息>后,<主体试图克制或掩饰的情绪>通过<可观察表现>
逐渐显现。
最终,<主体的最终动作、表情或说话方式>。示例
舞台后方传来演出结束的掌声。年轻演员握住节目单的手指突然停住,
视线缓慢转向幕布方向,肩膀仍然紧绷。
确认谢幕后,她先轻轻呼出一口气,肩膀逐渐放松,嘴角浮现克制的微笑,
眼眶慢慢湿润,但始终没有转身离开。基础镜头语言和热门运镜方式可以直接写进提示词。当术语较少见、可能存在多种理解,或者需要精确控制画面变化时,应同时说明术语作用于谁、画面如何变化,以及希望看到的结果。
基础镜头语言
景别 大全景、全景、中景、近景、特写
运镜 推、拉、摇、移、跟、环绕、俯冲、后拉、上摇、手持晃动
机位视角 低角度、俯视、第一人称七种热门运镜的建议写法
一镜到底 说明镜头连续经过的主体、空间和事件顺序
希区柯克变焦 说明主体保持的大小,以及背景空间被拉近或推远的效果
航拍视角 说明俯视高度、移动方向和需要展示的环境范围
FPV 说明第一人称飞行或穿行路径、速度和转向
子弹时间 说明被冻结或放慢的动作,以及镜头环绕方向
手持镜头 说明跟拍对象和晃动程度,
避免只有「手持感」而没有镜头目标
回弹变速 说明动作在哪个节点加速、减速或回弹,以及最终停留状态这些可以直接使用;但若画面中有多个主体,仍需说明运镜围绕谁、从哪里开始、到哪里结束。
过于小众、行业含义不统一或模型可能不熟悉的术语,应保留术语名称,同时把它翻译成可以直接观察的画面变化。
公式
专业术语 + 作用主体 + 画面变化 + 前景/背景关系 + 方向或速度移焦:焦点从前景树叶平滑转移到背景人物。
树叶逐渐虚化,背景人物的面部由模糊变得清晰。涉及精确转场时,还要写清触发时刻、遮挡物、镜头运动方向、切换方式,以及切换后需要保持的构图或运动趋势。
五个摄影表达示例
1 · 浅景深人像
<糕点师>的眼睛和面部保持清晰,
身后的玻璃罐和灯光虚化成柔和圆形散景。
2 · 追随摄影
镜头与<滑板者>同速水平移动,人物保持清晰,
街边墙面形成从右向左的水平拖影。
3 · 黄金时刻
暖色低角度阳光从<登山者>左后方照入,山脊地面形成较长阴影。
4 · 自然暗角
画面四角逐渐变暗,中心<钢琴演奏者>的亮度和肤色保持正常,
不出现黑色边框。
5 · 甩镜转场
第 5 秒镜头快速向左横移;前景书架完成整屏遮挡时切换到下一场景,
切换后镜头继续保持向左运动和相近速度。光圈、焦距和快门数值可以写入提示词,但最终画面的可见结果通常比单独写一个数值更明确。
官方给了 14 条自查问题。生成之前过一遍,能省掉大部分返工:
1 是否说清楚了主体和主要动作或事件?
2 每份参考素材是否明确说明采用什么、不采用什么?
3 不同人物、商品和道具是否逐一命名并绑定素材?
4 多素材是否按场景选择,而不是要求全部同时出现?
5 长视频的每个阶段是否只有一个主要变化,并写清结束状态?
6 人物数量、服装、道具归属和空间关系是否稳定?
7 视频编辑是否明确唯一母版、修改范围、目标数量和保持内容?
8 抽象情绪和摄影术语是否对应了可以直接看到或听到的表现?
9 首尾帧和多关键帧是否逐张说明职责,首帧与尾帧是否使用相同画幅?
10 宫格分镜是否写清继承的结构?
11 白模是否先判断粗粒度或细粒度,并写清需要继承的时序、结构、
材质和风格?
12 视频编辑、首尾帧生成和视频延长是否遵循自动锁定的比例与时长规则?
13 视频延长是否同时检查边界画面、运动趋势和声音连续性?
14 一键成片是否说明素材职责、图片顺序、动态幅度、剪辑风格和声音?
无缝转场是否写清两段视频的职责、触发动作、过渡过程和到达状态?官方明确写出的九条做不到的事。这些正是最容易带来失望的需求:
1 时间戳只能用于分配事件节奏,不是帧级剪辑点。
2 视频编辑提示词可以提高关键事件与原视频对齐的概率,
但不能保证逐帧完全重合。
3 多素材创作的重点是正确选择和组合素材,不是让所有素材同时出现。
4 必须完全准确的字幕、公式、标牌、产品参数和帧级时间点,
建议通过前期合成好的素材 + 视频生成 + 后期制作完成。
5 视频编辑会锁定输入视频比例和基本时长;这两项不支持另行设置,
输出时长与输入视频可能有最大约 0.3 秒的差异。
6 首帧或首尾帧生成会以首帧画幅锁定比例,时长可以设置;
首尾图比例不同可能使尾帧出现拉伸。
7 视频延长会锁定输入视频比例,延长时长可以设置;
延长片段的音量可能与原视频存在轻微差异。
8 一键成片中,如果图片顺序或人物对应关系重要,
需要在提示词中明确指定。
9 视频无缝转场追求视觉与声音连续,
不代表两段原视频能够逐像素保持不变。Seedance 2.5 已于 2026 年 8 月 8 日在我们这里上线,模型名 `seedance-2.5` —— 480p $0.134/秒、720p $0.300/秒,时长 4 到 30 秒,单次最多 50 份参考素材,仅成功扣费。上面这一整套写法可以直接用上。有两点要从指南带到 API:一是任务类型约束是在创建时强制的,视频编辑、视频延长以及首帧 / 首尾帧生成都会以 aspect_ratio "adaptive" 运行,视频编辑还会以 duration -1 运行——强行覆盖会当场拿到 400,而不是等任务排队之后再异步返回 InvalidParameter.TaskTypeConstraint。二是 2.5 没有 1080p、也没有 4K:需要 1080p 就继续用 Seedance 2.0,$0.092/秒起,时长 4—15 秒,上面这套语法它也大部分通用。
来源:字节跳动官方 Seedance 2.5 提示词指南。上限、语法、自动锁定规则、检查清单与能力边界为官方内容;示例与行文为我们撰写。可用性与价格于 2026-08-08 对着我们自己的方舟账户更新,会持续复查。
可以了,2026 年 8 月 8 日起。向 /api/v1/video/generations 传 model "seedance-2.5" 即可:480p $0.134/秒、720p $0.300/秒,时长 4—30 秒(也可以传 duration -1 让模型自己定),分辨率只有 480p 和 720p。在此之前确实调不到——8 月 4 日我们在方舟账户上探的所有 Seedance 2.5 model id 都返回 InvalidEndpointOrModel.NotFound。真正能用的 id 是 doubao-seedance-2-5-260628。
一次最多 50 份:图片最多 30 张(单张 ≤4K),视频最多 10 段且总长 ≤30 秒,音频最多 10 段且总长 ≤30 秒。官方另给了更窄的「推荐范围」——主体图 1–8 个、音视频主体 1–5 个且单段 5–10 秒——并明说素材越多越不稳。同一主体的多个视角,拆成多张独立图片比拼成一张宫格更稳。
因为提示词没有把它们钉住。两句话能解决大半:写明成片中的确切数量(「全片始终只有一盏台灯」),以及写一句继承声明——新对象继承原对象每次出现、运动、遮挡和离开的时点、持续时长、路径与速度变化。另外把原视频声明为唯一母版,让场景、镜头和事件顺序没有商量余地。
不是。官方明确说时间戳只用于分配事件节奏,不是帧级剪辑点,动作可能在边界附近提前或延后。时间段应连续、不重叠。真正必须精确的东西——字幕、产品参数、卡点剪辑——应当前期合成或后期制作,不要指望提示词。