- git mv V1.0/{SKILL.md,references,references-add,参考skills} 上移至 project/短视频提示词生成/
- 删除空 V1.0 目录,git 零残留
- 目录内无 V1.0 路径引用(路径配置用环境两步判定),可安全移动
- MEMORY.md 同步更新路径描述
29 KiB
分镜提示词制作流程
来源:ShotDesign 5步工作流 + seedance2.0-prompt-skill 路径分流/极简优先铁律 + seedance-specs 官方公式 + seedance25-timed-prompter 精准时间测算体系 适用:F3(生成图片)、F4(生成分镜)单镜头提示词的标准制作路径
一、总流程(6步)
①剧本分析 → ②需求分析 → ③路径分流 → ④提示词构建 → ⑤强制校验 → ⑥交付
Step 1 剧本分析(生成提示词前必做)
产出仅在上下文中驱动下游,不单独落盘。未完成此步骤不得进入提示词构建。
1a 剧本类型判定(先做):
| 类型 | 特征 | 典型场景 |
|---|---|---|
| A 叙事剧情 | 有角色+对白+情节弧线 | 短剧/情景喜剧/故事短片 |
| B 单人出镜 | 单人+口播/Vlog | 探店/美食/旅行/亲子Vlog |
| C 旁白知识 | 画外音驱动+无角色对白 | 科普/教程/纪录片/解说 |
| D 产品展示 | 产品为主体+人物为辅或无 | 产品广告/开箱/展示 |
| E 纯氛围 | 无人物无对白+纯视觉流 | 风景空镜/概念片/MV |
1b 维度拆解(①全类型必做,②-⑤按类型选做):
| 维度 | 拆解项 | 适用类型 | 产出 → 驱动下游 |
|---|---|---|---|
| ① 节奏·叙事逻辑 | 故事线/视觉节奏一句话概括 / 叙事结构(线性·倒叙·插叙·环形)/ 节奏图(铺陈→蓄力→爆发→余韵,标注时间区间)/ 叙事驱动类型(事件·对白·旁白·混合·视觉流)/ 台词风格(方言·口语·书面·旁白语气——剧本未写但角色身份暗示的方言语气需在此提取) | 全类型 | → 路径分流 + 段落时长 + 台词语气修饰 |
| ② 爆点·情绪痛点 | 爆点定位(时间戳+触发事件+预期反应)/ 情绪痛点(观众共情触发点,非角色情绪)/ 视觉高潮点(非叙事类的画面冲击峰) | A/B/C | → 景别递进策略 + 运镜设计 |
| ③ 反转情节 | 反转类型(身份·认知·关系·命运)/ 反转锚点(铺垫在哪→引爆在哪)/ 前后对比(情绪·认知·关系变化) | A | → 镜头逻辑(一镜到底vs多段切换)+ 首末帧设计 |
| ④ 人物关系 | 关系图谱(主要角色+关系类型)/ 权力结构(谁主导·被动·被揭示)/ 关系变化弧线(反转前后) | A(多角色必做)/B(单人省略) | → 场景调度(站位·朝向·视线焦点)+ 景别选择 |
| ⑤ 情绪弱点 | 角色情绪弱点(内心最脆弱点=驱动力来源)/ 观众情绪弱点(什么击中观众=共鸣触发器)/ 弱点→爆点对应关系 | A/B | → 微表情弧线设计 + 动作时间常数选取 |
D/E类:②-⑤均不适用,只做①(节奏+视觉流),驱动④层格式的镜头层(产品展示流程/氛围流变描述)
分析 → 下游驱动关系:
剧本分析
├─ 类型判定 → 4层格式适配(哪些层省略/变形,见3.2.2类型适配表)
├─①节奏+台词风格 → 路径分流 + 段落时长 + 台词语气修饰
├─②爆点/视觉高潮 → 景别递进 + 运镜设计(A/B/C类)
├─③反转 → 镜头逻辑 + 首末帧(A类)
├─④关系 → 场景调度 + 站位(A类多角色)
└─⑤弱点 → 微表情弧线 + 动作设计(A/B类)
↓
Step 4 提示词构建(按类型+场景选层)
示例A(叙事剧情类)——"母亲接到失踪儿子电话":
- 类型=A → 5维度全做
- ①叙事逻辑=一镜到底(POV母亲眼睛)/ 线性 / 麻木→电话→紧张→不敢信→震惊→行动 → 路径C + 单段30秒
- ②爆点=电话铃声打破平静(第4-5秒)/ 痛点=长期消耗后的疲惫被一瞬间击碎 → 景别Z8→Z2递进 + 缓推→急推
- ③反转=认知反转(以为是日常→不是)/ 锚点=开头麻木日常铺垫→电话引爆 → 首帧=麻木日常 / 末帧=猛然行动
- ④关系=母子(但全程不露脸,只看苍老的手)/ 母亲被动·被揭示 → 调度=手部特写+环境 / 禁止面部镜头
- ⑤弱点=角色弱点=长期消耗后的疲惫 / 观众弱点=亲情本能触发 → 微表情降级L1 + 动作=从静止到猛然
示例D(产品展示类)——"护肤品质地展示":
- 类型=D → 只做①,②-⑤跳过
- ①节奏=视觉流:产品亮相→质地特写→涂抹过程→效果呈现 / 线性 / 铺陈(亮相)→蓄力(特写)→爆发(涂抹)→余韵(效果) → 路径A + 单段8秒
- 台词风格=N/A(无对白,可选旁白)
- 驱动4层格式:①主体=护肤品(列道具行) ②设定-人物省略 ③镜头=产品展示流程(非角色动作)
Step 2 需求分析
- 明确:时长、画幅(9:16 竖屏 / 16:9 横屏)、单镜头还是多镜头、有无参考素材
- 判断时长是否 >15 秒:超过则必须走《长视频分段制作流程》
- 判断叙事形态:瞬间反应 / 单一动作 / 情绪弧线 / 小剧情 / 完整叙事
- 结合 Step 1 剧本分析结论:叙事结构决定镜头逻辑、节奏图决定段落时长、情绪弱点决定微表情弧线
Step 3 路径分流(按输入素材类型)
| 路径 | 输入 | 方法 | 详见 |
|---|---|---|---|
| A 纯文本生成 | 无参考素材 | 官方公式直写 | 本文件第三节 |
| B 参考图/视频 | 图片或视频素材 | @引用锚定 + 补充描述 | 《图生视频与分镜板制作流程》 |
| C 图生视频(单图驱动) | 1 张图片 | 双范式:反应模式 / 凝视模式 | 《图生视频与分镜板制作流程》 |
| D 分镜板驱动 | 分镜脚本/多格规划 | 格间关系三分类 | 《图生视频与分镜板制作流程》 |
Step 4 提示词构建
按第三节输出格式组装:按Step 1类型判定结果选择4层结构的适用层(见3.2.2类型适配表);构建时用11字段思考清单(3.2.1)内部过目确保不遗漏。词表从 知识库/15维度 各取所需。
剧本分析(Step 1)产出是提示词组装的内容来源:景别/运镜由爆点驱动、场景调度由人物关系驱动、微表情弧线由情绪弱点驱动、人物设定由角色定位驱动、表演指令由情绪弱点驱动、负面词由场景类型勾选。
Step 5 强制校验(8项)
- 字符数:Python
len()实测,禁止估算;品质基准 ≤500 字符,硬性上限 ≤2000 字符(实测) - 结构完整性:输出必须包含核心层(①主体 + ②设定 + ③镜头叙事 + ④负面词),②设定层按类型适配(A全用/B全用/C人物可选/D人物省略/E人物省略);顺序固定主体→设定→镜头→负面词
- 版权扫描:品牌词/风格借喻/涉灰场景词/夜场BGM词 四类扫描(详见《图生视频与分镜板制作流程》版权审查)
- 导演去名化:提示词中不得出现导演名/工作室名/IP名,只用参数化描述
- 动作物理合理性:三层动作分级检查(大动作禁止)
- 多模态引用核对:素材多时逐一检查 @对象指向正确;素材编号一致性闸门——同一角色/场景/道具在所有镜头必须用同一 @图片N,禁止编号混用(如镜头1用 @图片2 指男主、镜头2却用 @图片3 指男主)
- 负面提示词:标准化禁止清单(3.3)是否附上,通用项必须全带
- 时长与内容匹配:见"时长服从内容"速查
Step 6 交付
- 镜头部分上方标注视频总时长(如"视频总时长:8秒",放设定层之后、镜头段之前,属投喂信息不混入画面描述)
- 单镜头:代码块输出完整提示词
- 多镜头:逐镜头编号 + 代码块,附过渡策略(>15秒时);每段末尾写段末状态(可见姿态/视线/道具/光线/镜头方向),供下一段继承
二、极简优先铁律(跨路径通用)
- 默认 300-500 字符,不是越多越好。实战数据:3102 字符违规 → 271 字符过审
- 文字只补 4 件事,其余交给参考图:
- 图里没有的(新增元素)
- 需强化的(图里弱但要突出的)
- 需规避的(图里有但不要的)
- 硬约束(画幅/时长/禁止项)
- 二分法定位问题:砍到极限版 30-50 字符 → 每次加 1 个元素 → 对比差异
三、结构化提示词模板(路径A)
3.1 基础六要素(构建思考参考,单镜头简单场景)
主体/角色 + 所在场景 + 核心动作/时序 + 镜头语言 + 画面风格/光影材质 + 音频要求
六要素词表对应:
| 要素 | 词库位置 |
|---|---|
| 主体(外貌+微表情) | 知识库/01_主体描述 |
| 动作(物理阻尼+时间常数) | 知识库/02_动作行为 |
| 场景(环境+空间锚定) | 知识库/03_场景描述 |
| 镜头语言(景别Z+高度Y+方位X+焦段F) | 知识库/04~06 |
| 光影/风格/色彩 | 知识库/07~09、15 |
| 音效(原生音效优先) | 知识库/13_音效音频 |
3.2 输出格式(4层结构)
实战验证(2026-08-20):编导手写提示词(~350字,叙事驱动)生成效果优于结构化11字段模板(~700字,技术参数驱动)。模型吃故事,不吃参数表。 改造原则:11字段降为构建时内部思考清单(确保不遗漏),最终输出只写4层结构——主体置顶按类别分行、设定按类型分项、镜头叙事流畅、负面词放最后。技术参数溶解进设定各分项,表演靠动作暗示而非禁令。按Step 1类型判定结果选择4层的适用层。
3.2.1 构建思考清单(内部,不落盘)
构建提示词时逐项过目,确保不遗漏。但最终提示词中不出现字段标签——信息溶解进叙事段落。
| 思考项 | 构建时想什么 | 输出时去哪 |
|---|---|---|
| ①一致性锚定 | 角色服装/道具是否需文字锁定? | ①主体列表@图片引用锁定;无图才在②设定-人物补1句 |
| ②类型质感 | 画质/风格/光影基调? | ②设定-视觉风格(1句) |
| ③人物设定 | 逐角色外貌/着装/气质? | ①主体列表@图片锁定;无图在②设定-人物补1句(主体中每个人物必写,不可遗漏) |
| ④场景 | 空间布局/道具? | ②设定-场景(1句空间描述) |
| ⑤景深对焦 | 是否需非默认景深? | 默认不写;特写需浅景深时加进②设定-构图 |
| ⑥摄影质感 | 机型/镜头/光圈/快门/ISO/色彩/光影/质感/动态范围? | 按维度自动生成英文摄影参数(从知识库/10_后期细节·摄影质感维度表取值,判断适用维度组合),排除画幅/帧率 |
| ⑦表演幅度 | 需禁某种表演? | 默认不写;用动作暗示替代("鬼鬼祟祟地说"比"禁夸张表情"有效) |
| ⑧背景动态 | 需环境微动? | 默认不写;仅在画面可能静止时加进③镜头动作描述 |
| ⑨镜头空间 | 机位/景别/朝向? | 溶进③镜头叙事("中景跟拍男主正面") |
| ⑩表演指令 | 逐beat微动作? | 溶进③镜头叙事的动作描述 |
| ⑪负面词 | 场景适配禁止项? | ④负面提示词(3.3标准模板) |
原则:能用@图片引用解决的,绝不写文字;能用动作暗示的,绝不写技术参数。
3.2.2 输出格式(4层结构)
①主体列表(置顶,按类别分行)
人物:[角色名] @[图片N] [角色名] @[图片N]
场景:[场景名] @[图片N]
道具:[物品名] @[图片N] [物品名] @[图片N]
> 所有出场人物、关键场景、道具分三类分行列,@图片引用优先,无图用1句简述
> 有哪类列哪类,无道具/无场景则省略该行;D类主体=产品(列道具行),E类主体=场景(列场景行)
> **人物锚定句(仅多角色+跨镜头复用时启用)**:`将 @图片N 中的[身份/外观/服装]定义为 <角色名>`,后续镜头用 `<角色名>` 指代、不再重复写外貌;**识别不到角色名时用角色代称锚定**(`<男主>` `<兄弟>` `<角色A>` 等代称);单人单段保持现状(`人物:男主 @图片2`),不写锚定句
②设定(分项,每项1句,按类型取舍)
人物:[角色]——[气质/状态1句];[角色]——[气质/状态1句]
> **主体中出现的每个人物,此处必须有对应设定,不可遗漏**——逐人写,用分号分隔
> @图片已锁定的不重复写外貌,只补气质/状态;无图时按知识库/01_主体描述外貌原则写(宁少写不错写);D/E类省略此行
场景:[空间布局+前中后景层次1句]
光线:[光源来源+主光方向+亮暗区+色温1句]
构图:[景别+前中后景层次+构图法则+视觉重心/留白1句]
视觉风格:[画质+风格+质感1句]
摄影质感:模型按维度自动生成英文摄影参数(机型/镜头/光圈/快门/ISO/色彩/光影/质感/动态范围),**用[]框起**,根据剧情场景判断适用维度,从知识库/10_后期细节·摄影质感维度表取值组合(不照搬固定示例);排除画幅/帧率(属平台参数放代码框外)
> 场景见知识库/03_场景描述(空间锚定三层);光线见知识库/07_光线时间(光影三层);构图见知识库/14_构图布局(五法则+构图几何+雷区规避);风格见知识库/15_视觉风格(去名化);朝向见知识库/06_焦距视角X轴
③镜头(每镜头1段流畅叙事)
镜头N:[机位/景别/朝向] + [动作/变化流程] + [运镜变化嵌在动作里] + [有台词时:(人物,语气):内容]
- 每镜头1段,按动作流自然叙述,不分beat罗列
- **朝向必须写明**:正面/背后/固定/侧面——用"正面拍摄""从背后拍摄""固定视角"等明确朝向(词库见知识库/06_焦距视角X轴+知识库/03_场景描述面部朝向/过肩);**主体位置用画面坐标**——写"男主位于画面右侧、四分之三侧朝镜头",不写"从男主右侧拍摄"(画面坐标优于主体坐标,生视频模型更易定位,词库见知识库/03_场景描述演员调度);**避开构图雷区**——默认不用"正面居中",改用 X2 四分之三侧/三分法偏移(雷区见知识库/14_构图布局)
- **机位高度默认平视**:视点与人物视线齐平(Y4 平视,词库见知识库/06_焦距视角Y轴);仅剧情需要压迫(俯视 Y6)或英雄感(仰视 Y2)时才偏离
- **空间方向一致性(多人/多镜头/有明确方位时写)**:锁定空间坐标("A在左、B在右、门在A背后")+ 移动方向一致("物体始终从右向左移动");禁止镜像翻转、禁止跨越180度轴线(词库见知识库/03_场景描述·空间锚定)
- **连续动作不拆**:同一空间内连续发生的动作链保持在一个镜头段内,不拆成多个镜头
- **衔接可见化**:镜头间/段间衔接必须写成可见动作转接或画面状态("镜头停在门框上的手""视线下移到腰侧血迹"),禁止写"接下一段/接分镜2/承接下一段"这类模型无法执行的衔接语
- 运镜写在动作流程中("镜头从正面绕到背后"),不独立成字段;固定/跟拍镜头可补"轻微手持呼吸感"增加活体感,避免死板的机械固定
- **有台词时**:台词带语气/方言/神态修饰,不用禁令式约束;台词格式+方言+情绪标签见知识库/13_音效音频·台词与情绪标签
- 时间戳可选标注在段首("0-3s:"),简单场景可不标
- 动作/变化要具体可视化(写"手指蘸取乳液在手腕推开"而非"涂抹"),不要泛泛
- **视听转译四步法**(内部思考,不落盘):遇到抽象情绪描述时依次问——①"演员用身体哪部分演?"(眼神/嘴角/手指/呼吸/步伐)②"摄影机用什么镜头能拍到?"(景别/焦段/角度/运镜)③"要不要靠声音/光线/物件辅助?"(环境音/道具状态变化/光线突变)。确保每句描述拍得到、录得到,不把心理活动当画面写
- **情绪铺垫分级(强情绪镜头)**:悲伤/愤怒/崩溃等强情绪不能第一帧满格爆发,按"克制→微表情泄露→情绪压上来→爆发"逐步递进(写"先愣住半秒、眼神失焦、嘴唇抿住、眼眶蓄泪、第一滴泪滑下",而非"突然崩溃大哭")。用动作暗示情绪递进,不写"禁止夸张表演"类禁令
- 有音效时:音效嵌在动作描述中自然出现("门铃声响起"、"啪的一声"),不独立成段
- **小道具朝向锁定**:手机/照片/证件/信封/戒指等有正反面的道具,必须写清朝向——屏幕或信息面朝镜头还是朝手心/桌面。写"手机背面朝镜头、屏幕朝向手心",不写"拿着手机"(模型默认会把信息面怼向镜头造成穿帮)
- **段末状态(仅多段连续输出时写,单段不写)**:每段末尾写一句"下一段可继承的可见状态"——角色姿态/视线方向/道具位置/光线方向/镜头方向,如"段末男主缩在门框边,薯片袋已被兄弟抢走,镜头停在两人对峙的正面"。用于跨段连续性的锚点
> D/E类镜头层写产品展示流程或氛围流变,不写角色动作
④负面提示词
负面提示词:[通用项] + [场景勾选项](见3.3)
> 负面词放最后——镜头叙事写完后整体排除
> BGM禁止由负面词覆盖(通用项已含"背景音乐,BGM,配乐"),不需要单独音频段
4层×5类型适配表(按Step 1类型判定结果选层):
| 类型 | ①主体 | ②设定-人物 | ②设定-其余4项 | ③镜头-台词 | ③镜头-动作 |
|---|---|---|---|---|---|
| A 叙事剧情 | 人物 | 全用 | 全用 | 对白格式 | 角色动作 |
| B 单人Vlog | 人物 | 全用 | 全用 | 口播(非对白) | 人物动作 |
| C 旁白知识 | 场景/道具 | 可选 | 全用 | 旁白格式 | 画面变化 |
| D 产品展示 | 产品 | 省略 | 全用 | 无(可选旁白) | 产品展示流程 |
| E 纯氛围 | 场景 | 省略 | 全用 | 无 | 氛围流变 |
编导式 vs 旧11字段版对比:
对比项 编导式(新) 11字段版(旧) 字段标签 无,信息溶解进叙事 【一致性锚定】【景深对焦】等11个标签 技术参数 溶进②设定层各分项 独立字段罗列(机型/f值/快门等) 表演控制 动作暗示("鬼鬼祟祟地说") 禁令约束("禁夸张喜剧化表情") 镜头组织 每镜头1段流畅叙事 时间戳逐beat分段罗列 字符量 ~350字 ~700字 生成效果 实战验证更优 token浪费在参数上
3.3 标准负面词模板
每次生成提示词时从以下分类中按场景选取,汇总为一条【负面词】段。通用项必须带,可选项按场景勾选。
通用禁止项(每次必带):
文字, 字幕, 水印, logo, 签名, 变形, 多手指, 少手指, 断肢, 肢体融合, 错误手部, 错误嘴型, 面部扭曲, 换脸, 穿模, 塑料人物质感, 过度磨皮, 蜡像感, CG感, 3D渲染感, 镜头焦点来回拉风箱游移, 不符合人类骨骼生理的关节弯曲
按场景勾选:
| 分类 | 禁止词 | 适用场景 |
|---|---|---|
| 表演类 | 夸张表演, 油腻表演, 过度煽情, 人物表情木讷僵硬, 画面静止如照片 | 喜剧/生活流/剧情 |
| 运镜类 | 慢动作(非指定), 人物瞬移, 镜头漂浮, 机械云台感, 画面静止 | 动态场景 |
| 质感类 | 廉价电视剧质感, 网红短视频风格, 广告片质感, 平光, 过曝, 死黑, HDR, 劣质滤镜 | 通用 |
| 畸变类 | 鱼眼畸变, 桶形畸变, 枕形畸变, 超广角拉伸, 人脸边缘拉伸, 微缩景观感, 玩具模型感, 移轴效果 | 写实/建筑/室内/人物近景 |
| 风格类 | 与目标风格矛盾的词(如写实场景禁"卡通/二次元",古装禁"现代电器") | 按需 |
写法:
负面词:[通用项] + [勾选项],逗号分隔,不加解释。
四、时长服从内容(速查)
| 内容类型 | 建议时长 | 理由 |
|---|---|---|
| 一瞬间反应(一个眼神/一个动作) | 3-5 秒 | 短镜不拖 |
| 单一动作 + 一句台词 | 5-7 秒 | 刚好说完做完 |
| 两句台词交替 + 反应 | 7-10 秒 | 对话节奏 |
| 三句台词 + 走位 + 动作 | 10-12 秒 | 编排紧凑 |
| 追逐/打斗/复杂连招 | 12-15 秒(2.0)/ 12-30 秒(2.5) | 动作密度高不必硬切 |
| 古风台词(慢速)+ 情绪 | 比现代语速 +2-3 秒 | 古风语速 2-3 字/秒 |
| 完整叙事 | 12-15 秒(2.0)/ ≤30 秒(2.5) | 2.5 单次可达 30 秒 |
| 已有成片想继续演 | 延长段 ≤30 秒/次(2.5),总长 ≤60 秒 | 套娃延长 |
| 完整短片/MV/预告 | 超长视频模式 ≤180 秒(2.5) | 一次性直出,长时序一致性好 |
单次生成上限:2.0 = 15 秒;2.5 = 30 秒。更长的走分段流程或 2.5 超长/延长模式。
五、精准时间测算体系
来源:seedance25-timed-prompter。2.5 原生支持秒级/帧级时间戳控制——测算的每一秒模型都能精准执行。
公式去向铁律:测算公式(字数÷语速、步数×常数等)只出现在时间预算表等内部测算环节;提示词正文只写时长结论(如"(1.2s)"、"(3步,约1.5s)")。禁止把"4字÷3.5=1.2s"这类算式写进提示词正文——模型不做算术,算式是噪音且浪费字符额度。
5.1 台词语速公式表
| 台词类型 | 语速标准 | 测算公式 |
|---|---|---|
| 普通中文对白 | 3-4 字/秒 | 字数 ÷ 3.5 = 秒数(取中值) |
| 情绪台词(哭腔/怒斥/颤抖/压抑) | 2-3 字/秒 | 字数 ÷ 2.5 = 秒数 |
| 古风台词/文言/诗词 | 2-3 字/秒 | 字数 ÷ 2.5 = 秒数 |
| 气声/耳语/低语 | 1.5-2 字/秒 | 字数 ÷ 1.8 = 秒数 |
| 外语对白(英/日/韩等) | 约 2.5-3 词/秒 | 词数 ÷ 2.8 = 秒数 |
| 停顿/迟疑/换气 | — | 每次 0.5-1 秒 |
| 表演补偿(开口前反应/说完后反应/视线变化) | — | 每次 0.5-1.5 秒 |
一句台词如果 >8 秒说不完 → 按自然停顿拆到多个时间戳区间,但原文不改。
5.2 动作时间常数表(14类)
| 动作类型 | 最短可看清时间 |
|---|---|
| 简单表情反应(抬眉/抿嘴/眨眼) | 0.5-1 秒 |
| 关键眼神/对视 | 1-2 秒 |
| 转头/回身 | 1-2 秒 |
| 起身/坐下/蹲下 | 1.5-3 秒 |
| 走位(一步) | 0.5 秒/步 |
| 走位(从A点到B点,3-5步) | 2-4 秒 |
| 拔剑/推门/掀帘/摔杯 | 1-2 秒 |
| 单手交手一击 | 1-2 秒 |
| 连续交手(2-3个回合) | 3-5 秒 |
| 复杂长尾动作(后空翻+拔剑+落地连招) | 4-8 秒 |
| 物品拿起/递交/特写 | 1-2 秒 |
| 身体倒地/坠落 | 1.5-3 秒 |
| 害羞脸红 | ≥2.5 秒(视线躲闪→脸颊泛红→低头/抿嘴) |
| 落泪 | ≥3 秒(眼眶湿润→泪珠溢出→滑落) |
违反时间常数的动作会被 AI 压缩成"表情包式跳变",失去真实感。
5.3 运镜与衔接时间常数表
| 运镜类型 | 时间 |
|---|---|
| 定场/环境建立 | 1-2 秒 |
| 推/拉镜头 | 1-3 秒 |
| 摇/移镜头 | 1-2 秒 |
| 跟拍 | 与主体动作同步 |
| 硬切 | 0-0.5 秒 |
| 淡入/淡出/叠化 | 1-2 秒 |
| 首帧承接(建立空间方位) | 1-2 秒 |
| 末帧钩子停留 | 1-2 秒 |
5.4 帧级时间戳换算(2.5 专用)
2.5 支持帧级时间戳。需要卡音乐点/精确到帧时使用:
帧号 = 秒 × 24(24fps)
- 3 秒 = 第 72 帧
- 10 秒 = 第 240 帧
- 提示词中可写
第 0-90 帧 (0s-3s)双标注 - 时间戳前缀格式:
0-3s:或[00.0-03.0s],按时间顺序排列
5.5 时间预算表(必须输出)
节奏档位判定(时间测算前置,先定档再定镜头数):
| 节奏档位 | 适用 | 4-6秒 | 7-9秒 | 10-12秒 | 13-15秒 |
|---|---|---|---|---|---|
| 电影感中速 | 剧情/文戏/生活流 | 1-2镜 | 2-3镜 | 3-5镜 | 4-6镜 |
| 短视频中高密度 | 抖音/竖屏默认 | 2镜 | 3-4镜 | 4-6镜 | 6-8镜 |
| 高密度动作或强钩子 | 打斗/追逐/强钩子 | 2-3镜 | 4-5镜 | 5-7镜 | 7-10镜 |
| 慢节奏但高信息 | 强情绪/仪式/悬疑凝视 | 按功能保留 | 按功能保留 | 可1-2镜(须说明慢镜头功能) | 可1-2镜(须说明慢镜头功能) |
按剧情功能+平台自动判档 → 定镜头数 → 逐项测算时长。10秒以上只有1-2镜时必须命中慢节奏档并写清慢镜头功能。
┌─────────────────────────────────────┐
│ 本段演出时长测算 │
├────────────────┬────────┬───────────┤
│ 项目 │ 详情 │ 测算时间 │
├────────────────┼────────┼───────────┤
│ 节奏档位 │ ... │ — │
│ 镜头数 │ ... │ N 镜 │
│ 台词口播 │ ... │ X.X 秒 │
│ 表情与表演 │ ... │ X.X 秒 │
│ 身体动作/走位 │ ... │ X.X 秒 │
│ 道具交互 │ ... │ X.X 秒 │
│ 运镜与转场 │ ... │ X.X 秒 │
│ 首帧承接 │ ... │ X.X 秒 │
│ 末帧钩子停留 │ ... │ X.X 秒 │
├────────────────┼────────┼───────────┤
│ 测算总时长 │ │ XX.X 秒 │
│ 规划时长 │ │ XX 秒 │
│ 结论 │ 通过/需调整 │
└────────────────┴────────┴───────────┘
5.6 超调处理优先级(测算总时长 > 规划时长)
- 先延长到平台上限(2.0 = 15 秒 / 2.5 = 30 秒)
- 仍不够 → 建议拆成"首段 + 延长段"(2.5 套娃延长,总长 ≤60 秒)或超长视频模式(≤180 秒)
- 减少次要动作/反应镜头
- 删减原创建议台词(非用户原文)
- 用户原文台词按自然停顿拆分到下一时间戳区间/下一段
- 用户原文台词绝不删改
5.7 不足处理(测算总时长 < 规划时长)
- 不硬凑满额时长。4-30 秒内任何值都可以。
- 空余时间留给画面自然节奏,不是塞废话。
六、平台硬约束
Seedance 2.0
- 提示词容量:中文 ≤500 字符(品质基准)/ 实测 ≤2000 字符(硬上限)
- 单次生成:4-15 秒;480p / 720p / 1080p;16:9 / 9:16 / 21:9 / 1:1 / 2.35:1
- 多模态:图片 9 张(<30MB)/ 视频 3 段(2-15s,<50MB)/ 音频 3 段(≤15s,<15MB)/ 合计 ≤12 个
- 不支持写实真人脸部素材(自动拦截);动漫角色卡需走真人化前缀或真人参考图
- @引用官方命名:
@图片N/@视频N/@音频N(中文命名,不用英文)
Seedance 2.5(相对 2.0 的关键变化)
| 能力 | 2.5 规格 | 对提示词的影响 |
|---|---|---|
| 单次生成时长 | 最长 30 秒 | 单段规划区间从 4-15 秒扩大到 4-30 秒 |
| 视频延长 | 单次延长 ≤30 秒,可多次套娃,总长 ≤60 秒 | 可输出"接续上一段"的延长专用提示词 |
| 超长视频模式 | 一次性直出最长 180 秒 | 用"镜头N(0:00-0:08)"分镜脚本格式 |
| 时间戳文本控制 | 原生支持秒级 + 帧级(24fps) | 测算结果直接写成时间戳,模型按秒执行 |
| 多模态参考 | @图片/@视频/@音频/@音效,支持迁移运镜/光影/节奏 | @引用必须声明用途(参考什么、不参考什么) |
| 纯净素材 | 有效响应"无字幕、无背景音乐" | 需要干净底片时显式声明 |
| 去 AI 感 | 皮肤/毛发/长尾动作/切镜一致性大幅优化 | 可写复杂动作链;用"原生皮肤质感"等词 |
| 多语种 | 中/英/西/印尼/马来/泰/阿/葡/越/日/韩 | 台词可直接写目标语言,可声明口型同步 |
| 负向约束 | "禁止出现XX"响应可靠 | 禁止字幕/水印/BGM/IP 元素可放心写 |
2.5 @素材引用规则:必须声明用途,例:"@视频1仅参考运镜轨迹与动作节奏,不保留原画面质感" 2.5 纯净素材声明:"纯净视频,全程无字幕、无背景音乐";去除参考素材BGM:"去除@视频1中的背景音乐,仅保留人声" 2.5 多语种口型同步:声明"嘴型与台词发音严格同步"
七、双版本输出(2.5)
每个生成段输出两个版本:
- 多模态版(有 @素材时):包含全局约束声明 + @引用声明用途 + 时间戳分镜 + 负向约束
- 纯文字版(无素材可直接用):结构同上,@引用替换为完整文字描述
全局约束声明模板:视觉风格锁定 + 字幕与音频策略 + 参考素材用途声明 + 本段时长 负向约束模板:禁止出现[字幕/水印/无关BGM/IP元素等,按需声明]