Files
mcn-short-video/project/短视频提示词生成/references/制作流程/分镜提示词制作流程.md
T
maogeigei ad4646bb12 chore: 短视频提示词生成 去除 V1.0 层级(单版本直挂技能根)
- git mv V1.0/{SKILL.md,references,references-add,参考skills} 上移至 project/短视频提示词生成/
- 删除空 V1.0 目录,git 零残留
- 目录内无 V1.0 路径引用(路径配置用环境两步判定),可安全移动
- MEMORY.md 同步更新路径描述
2026-08-27 20:47:06 +08:00

409 lines
29 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 分镜提示词制作流程
> 来源:ShotDesign 5步工作流 + seedance2.0-prompt-skill 路径分流/极简优先铁律 + seedance-specs 官方公式 + seedance25-timed-prompter 精准时间测算体系
> 适用:F3(生成图片)、F4(生成分镜)单镜头提示词的标准制作路径
## 一、总流程(6步)
```
①剧本分析 → ②需求分析 → ③路径分流 → ④提示词构建 → ⑤强制校验 → ⑥交付
```
### Step 1 剧本分析(生成提示词前必做)
> 产出仅在上下文中驱动下游,不单独落盘。**未完成此步骤不得进入提示词构建。**
**1a 剧本类型判定(先做):**
| 类型 | 特征 | 典型场景 |
|------|------|---------|
| A 叙事剧情 | 有角色+对白+情节弧线 | 短剧/情景喜剧/故事短片 |
| B 单人出镜 | 单人+口播/Vlog | 探店/美食/旅行/亲子Vlog |
| C 旁白知识 | 画外音驱动+无角色对白 | 科普/教程/纪录片/解说 |
| D 产品展示 | 产品为主体+人物为辅或无 | 产品广告/开箱/展示 |
| E 纯氛围 | 无人物无对白+纯视觉流 | 风景空镜/概念片/MV |
**1b 维度拆解(①全类型必做,②-⑤按类型选做):**
| 维度 | 拆解项 | 适用类型 | 产出 → 驱动下游 |
|------|--------|---------|----------------|
| ① 节奏·叙事逻辑 | 故事线/视觉节奏一句话概括 / 叙事结构(线性·倒叙·插叙·环形)/ 节奏图(铺陈→蓄力→爆发→余韵,标注时间区间)/ 叙事驱动类型(事件·对白·旁白·混合·视觉流)/ **台词风格**(方言·口语·书面·旁白语气——剧本未写但角色身份暗示的方言语气需在此提取) | 全类型 | → 路径分流 + 段落时长 + 台词语气修饰 |
| ② 爆点·情绪痛点 | 爆点定位(时间戳+触发事件+预期反应)/ 情绪痛点(观众共情触发点,非角色情绪)/ 视觉高潮点(非叙事类的画面冲击峰) | A/B/C | → 景别递进策略 + 运镜设计 |
| ③ 反转情节 | 反转类型(身份·认知·关系·命运)/ 反转锚点(铺垫在哪→引爆在哪)/ 前后对比(情绪·认知·关系变化) | A | → 镜头逻辑(一镜到底vs多段切换)+ 首末帧设计 |
| ④ 人物关系 | 关系图谱(主要角色+关系类型)/ 权力结构(谁主导·被动·被揭示)/ 关系变化弧线(反转前后) | A(多角色必做)/B(单人省略) | → 场景调度(站位·朝向·视线焦点)+ 景别选择 |
| ⑤ 情绪弱点 | 角色情绪弱点(内心最脆弱点=驱动力来源)/ 观众情绪弱点(什么击中观众=共鸣触发器)/ 弱点→爆点对应关系 | A/B | → 微表情弧线设计 + 动作时间常数选取 |
> D/E类:②-⑤均不适用,只做①(节奏+视觉流),驱动④层格式的镜头层(产品展示流程/氛围流变描述)
**分析 → 下游驱动关系:**
```
剧本分析
├─ 类型判定 → 4层格式适配(哪些层省略/变形,见3.2.2类型适配表)
├─①节奏+台词风格 → 路径分流 + 段落时长 + 台词语气修饰
├─②爆点/视觉高潮 → 景别递进 + 运镜设计(A/B/C类)
├─③反转 → 镜头逻辑 + 首末帧(A类)
├─④关系 → 场景调度 + 站位(A类多角色)
└─⑤弱点 → 微表情弧线 + 动作设计(A/B类)
↓
Step 4 提示词构建(按类型+场景选层)
```
> **示例A(叙事剧情类)——"母亲接到失踪儿子电话":**
> - 类型=A → 5维度全做
> - ①叙事逻辑=一镜到底(POV母亲眼睛)/ 线性 / 麻木→电话→紧张→不敢信→震惊→行动 → **路径C + 单段30秒**
> - ②爆点=电话铃声打破平静(第4-5秒)/ 痛点=长期消耗后的疲惫被一瞬间击碎 → **景别Z8→Z2递进 + 缓推→急推**
> - ③反转=认知反转(以为是日常→不是)/ 锚点=开头麻木日常铺垫→电话引爆 → **首帧=麻木日常 / 末帧=猛然行动**
> - ④关系=母子(但全程不露脸,只看苍老的手)/ 母亲被动·被揭示 → **调度=手部特写+环境 / 禁止面部镜头**
> - ⑤弱点=角色弱点=长期消耗后的疲惫 / 观众弱点=亲情本能触发 → **微表情降级L1 + 动作=从静止到猛然**
> **示例D(产品展示类)——"护肤品质地展示":**
> - 类型=D → 只做①,②-⑤跳过
> - ①节奏=视觉流:产品亮相→质地特写→涂抹过程→效果呈现 / 线性 / 铺陈(亮相)→蓄力(特写)→爆发(涂抹)→余韵(效果) → **路径A + 单段8秒**
> - 台词风格=N/A(无对白,可选旁白)
> - 驱动4层格式:①主体=护肤品(列道具行) ②设定-人物省略 ③镜头=产品展示流程(非角色动作)
### Step 2 需求分析
- 明确:时长、画幅(9:16 竖屏 / 16:9 横屏)、单镜头还是多镜头、有无参考素材
- 判断时长是否 >15 秒:超过则必须走《长视频分段制作流程》
- 判断叙事形态:瞬间反应 / 单一动作 / 情绪弧线 / 小剧情 / 完整叙事
- **结合 Step 1 剧本分析结论**:叙事结构决定镜头逻辑、节奏图决定段落时长、情绪弱点决定微表情弧线
### Step 3 路径分流(按输入素材类型)
| 路径 | 输入 | 方法 | 详见 |
|------|------|------|------|
| A 纯文本生成 | 无参考素材 | 官方公式直写 | 本文件第三节 |
| B 参考图/视频 | 图片或视频素材 | @引用锚定 + 补充描述 | 《图生视频与分镜板制作流程》 |
| C 图生视频(单图驱动) | 1 张图片 | 双范式:反应模式 / 凝视模式 | 《图生视频与分镜板制作流程》 |
| D 分镜板驱动 | 分镜脚本/多格规划 | 格间关系三分类 | 《图生视频与分镜板制作流程》 |
### Step 4 提示词构建
按第三节输出格式组装:按Step 1类型判定结果选择4层结构的适用层(见3.2.2类型适配表);构建时用11字段思考清单(3.2.1)内部过目确保不遗漏。词表从 `知识库/15维度` 各取所需。
**剧本分析(Step 1)产出是提示词组装的内容来源**:景别/运镜由爆点驱动、场景调度由人物关系驱动、微表情弧线由情绪弱点驱动、人物设定由角色定位驱动、表演指令由情绪弱点驱动、负面词由场景类型勾选。
### Step 5 强制校验(8项)
1. **字符数**:Python `len()` 实测,禁止估算;品质基准 ≤500 字符,硬性上限 ≤2000 字符(实测)
2. **结构完整性**:输出必须包含核心层(①主体 + ②设定 + ③镜头叙事 + ④负面词),②设定层按类型适配(A全用/B全用/C人物可选/D人物省略/E人物省略);顺序固定主体→设定→镜头→负面词
3. **版权扫描**:品牌词/风格借喻/涉灰场景词/夜场BGM词 四类扫描(详见《图生视频与分镜板制作流程》版权审查)
4. **导演去名化**:提示词中不得出现导演名/工作室名/IP名,只用参数化描述
5. **动作物理合理性**:三层动作分级检查(大动作禁止)
6. **多模态引用核对**:素材多时逐一检查 @对象指向正确;**素材编号一致性闸门**——同一角色/场景/道具在所有镜头必须用同一 @图片N,禁止编号混用(如镜头1用 @图片2 指男主、镜头2却用 @图片3 指男主)
7. **负面提示词**:标准化禁止清单(3.3)是否附上,通用项必须全带
8. **时长与内容匹配**:见"时长服从内容"速查
### Step 6 交付
- **镜头部分上方标注视频总时长**(如"视频总时长:8秒",放设定层之后、镜头段之前,属投喂信息不混入画面描述)
- 单镜头:代码块输出完整提示词
- 多镜头:逐镜头编号 + 代码块,附过渡策略(>15秒时);每段末尾写段末状态(可见姿态/视线/道具/光线/镜头方向),供下一段继承
## 二、极简优先铁律(跨路径通用)
- **默认 300-500 字符**,不是越多越好。实战数据:3102 字符违规 → 271 字符过审
- 文字只补 4 件事,其余交给参考图:
1. 图里没有的(新增元素)
2. 需强化的(图里弱但要突出的)
3. 需规避的(图里有但不要的)
4. 硬约束(画幅/时长/禁止项)
- 二分法定位问题:砍到极限版 30-50 字符 → 每次加 1 个元素 → 对比差异
## 三、结构化提示词模板(路径A)
### 3.1 基础六要素(构建思考参考,单镜头简单场景)
```
主体/角色 + 所在场景 + 核心动作/时序 + 镜头语言 + 画面风格/光影材质 + 音频要求
```
六要素词表对应:
| 要素 | 词库位置 |
|------|---------|
| 主体(外貌+微表情) | 知识库/01_主体描述 |
| 动作(物理阻尼+时间常数) | 知识库/02_动作行为 |
| 场景(环境+空间锚定) | 知识库/03_场景描述 |
| 镜头语言(景别Z+高度Y+方位X+焦段F) | 知识库/04~06 |
| 光影/风格/色彩 | 知识库/07~09、15 |
| 音效(原生音效优先) | 知识库/13_音效音频 |
### 3.2 输出格式(4层结构)
> **实战验证**(2026-08-20):编导手写提示词(~350字,叙事驱动)生成效果优于结构化11字段模板(~700字,技术参数驱动)。**模型吃故事,不吃参数表。**
> **改造原则**:11字段降为构建时**内部思考清单**(确保不遗漏),最终输出只写**4层结构**——主体置顶按类别分行、设定按类型分项、镜头叙事流畅、负面词放最后。技术参数溶解进设定各分项,表演靠动作暗示而非禁令。按Step 1类型判定结果选择4层的适用层。
#### 3.2.1 构建思考清单(内部,不落盘)
构建提示词时逐项过目,确保不遗漏。但**最终提示词中不出现字段标签**——信息溶解进叙事段落。
| 思考项 | 构建时想什么 | 输出时去哪 |
|--------|-------------|-----------|
| ①一致性锚定 | 角色服装/道具是否需文字锁定? | ①主体列表@图片引用锁定;无图才在②设定-人物补1句 |
| ②类型质感 | 画质/风格/光影基调? | ②设定-视觉风格(1句) |
| ③人物设定 | 逐角色外貌/着装/气质? | ①主体列表@图片锁定;无图在②设定-人物补1句(**主体中每个人物必写,不可遗漏**) |
| ④场景 | 空间布局/道具? | ②设定-场景(1句空间描述) |
| ⑤景深对焦 | 是否需非默认景深? | **默认不写**;特写需浅景深时加进②设定-构图 |
| ⑥摄影质感 | 机型/镜头/光圈/快门/ISO/色彩/光影/质感/动态范围? | 按维度自动生成英文摄影参数(从知识库/10_后期细节·摄影质感维度表取值,判断适用维度组合),排除画幅/帧率 |
| ⑦表演幅度 | 需禁某种表演? | **默认不写**;用动作暗示替代("鬼鬼祟祟地说"比"禁夸张表情"有效) |
| ⑧背景动态 | 需环境微动? | **默认不写**;仅在画面可能静止时加进③镜头动作描述 |
| ⑨镜头空间 | 机位/景别/朝向? | 溶进③镜头叙事("中景跟拍男主正面") |
| ⑩表演指令 | 逐beat微动作? | 溶进③镜头叙事的动作描述 |
| ⑪负面词 | 场景适配禁止项? | ④负面提示词(3.3标准模板) |
> **原则:能用@图片引用解决的,绝不写文字;能用动作暗示的,绝不写技术参数。**
#### 3.2.2 输出格式(4层结构)
```
①主体列表(置顶,按类别分行)
人物:[角色名] @[图片N] [角色名] @[图片N]
场景:[场景名] @[图片N]
道具:[物品名] @[图片N] [物品名] @[图片N]
> 所有出场人物、关键场景、道具分三类分行列,@图片引用优先,无图用1句简述
> 有哪类列哪类,无道具/无场景则省略该行;D类主体=产品(列道具行),E类主体=场景(列场景行)
> **人物锚定句(仅多角色+跨镜头复用时启用)**:`将 @图片N 中的[身份/外观/服装]定义为 <角色名>`,后续镜头用 `<角色名>` 指代、不再重复写外貌;**识别不到角色名时用角色代称锚定**(`<男主>` `<兄弟>` `<角色A>` 等代称);单人单段保持现状(`人物:男主 @图片2`),不写锚定句
②设定(分项,每项1句,按类型取舍)
人物:[角色]——[气质/状态1句];[角色]——[气质/状态1句]
> **主体中出现的每个人物,此处必须有对应设定,不可遗漏**——逐人写,用分号分隔
> @图片已锁定的不重复写外貌,只补气质/状态;无图时按知识库/01_主体描述外貌原则写(宁少写不错写);D/E类省略此行
场景:[空间布局+前中后景层次1句]
光线:[光源来源+主光方向+亮暗区+色温1句]
构图:[景别+前中后景层次+构图法则+视觉重心/留白1句]
视觉风格:[画质+风格+质感1句]
摄影质感:模型按维度自动生成英文摄影参数(机型/镜头/光圈/快门/ISO/色彩/光影/质感/动态范围),**用[]框起**,根据剧情场景判断适用维度,从知识库/10_后期细节·摄影质感维度表取值组合(不照搬固定示例);排除画幅/帧率(属平台参数放代码框外)
> 场景见知识库/03_场景描述(空间锚定三层);光线见知识库/07_光线时间(光影三层);构图见知识库/14_构图布局(五法则+构图几何+雷区规避);风格见知识库/15_视觉风格(去名化);朝向见知识库/06_焦距视角X轴
③镜头(每镜头1段流畅叙事)
镜头N:[机位/景别/朝向] + [动作/变化流程] + [运镜变化嵌在动作里] + [有台词时:(人物,语气):内容]
- 每镜头1段,按动作流自然叙述,不分beat罗列
- **朝向必须写明**:正面/背后/固定/侧面——用"正面拍摄""从背后拍摄""固定视角"等明确朝向(词库见知识库/06_焦距视角X轴+知识库/03_场景描述面部朝向/过肩);**主体位置用画面坐标**——写"男主位于画面右侧、四分之三侧朝镜头",不写"从男主右侧拍摄"(画面坐标优于主体坐标,生视频模型更易定位,词库见知识库/03_场景描述演员调度);**避开构图雷区**——默认不用"正面居中",改用 X2 四分之三侧/三分法偏移(雷区见知识库/14_构图布局)
- **机位高度默认平视**:视点与人物视线齐平(Y4 平视,词库见知识库/06_焦距视角Y轴);仅剧情需要压迫(俯视 Y6)或英雄感(仰视 Y2)时才偏离
- **空间方向一致性(多人/多镜头/有明确方位时写)**:锁定空间坐标("A在左、B在右、门在A背后")+ 移动方向一致("物体始终从右向左移动");禁止镜像翻转、禁止跨越180度轴线(词库见知识库/03_场景描述·空间锚定)
- **连续动作不拆**:同一空间内连续发生的动作链保持在一个镜头段内,不拆成多个镜头
- **衔接可见化**:镜头间/段间衔接必须写成可见动作转接或画面状态("镜头停在门框上的手""视线下移到腰侧血迹"),禁止写"接下一段/接分镜2/承接下一段"这类模型无法执行的衔接语
- 运镜写在动作流程中("镜头从正面绕到背后"),不独立成字段;固定/跟拍镜头可补"轻微手持呼吸感"增加活体感,避免死板的机械固定
- **有台词时**:台词带语气/方言/神态修饰,不用禁令式约束;台词格式+方言+情绪标签见知识库/13_音效音频·台词与情绪标签
- 时间戳可选标注在段首("0-3s:"),简单场景可不标
- 动作/变化要具体可视化(写"手指蘸取乳液在手腕推开"而非"涂抹"),不要泛泛
- **视听转译四步法**(内部思考,不落盘):遇到抽象情绪描述时依次问——①"演员用身体哪部分演?"(眼神/嘴角/手指/呼吸/步伐)②"摄影机用什么镜头能拍到?"(景别/焦段/角度/运镜)③"要不要靠声音/光线/物件辅助?"(环境音/道具状态变化/光线突变)。确保每句描述拍得到、录得到,不把心理活动当画面写
- **情绪铺垫分级(强情绪镜头)**:悲伤/愤怒/崩溃等强情绪不能第一帧满格爆发,按"克制→微表情泄露→情绪压上来→爆发"逐步递进(写"先愣住半秒、眼神失焦、嘴唇抿住、眼眶蓄泪、第一滴泪滑下",而非"突然崩溃大哭")。用动作暗示情绪递进,不写"禁止夸张表演"类禁令
- 有音效时:音效嵌在动作描述中自然出现("门铃声响起"、"啪的一声"),不独立成段
- **小道具朝向锁定**:手机/照片/证件/信封/戒指等有正反面的道具,必须写清朝向——屏幕或信息面朝镜头还是朝手心/桌面。写"手机背面朝镜头、屏幕朝向手心",不写"拿着手机"(模型默认会把信息面怼向镜头造成穿帮)
- **段末状态(仅多段连续输出时写,单段不写)**:每段末尾写一句"下一段可继承的可见状态"——角色姿态/视线方向/道具位置/光线方向/镜头方向,如"段末男主缩在门框边,薯片袋已被兄弟抢走,镜头停在两人对峙的正面"。用于跨段连续性的锚点
> D/E类镜头层写产品展示流程或氛围流变,不写角色动作
④负面提示词
负面提示词:[通用项] + [场景勾选项](见3.3)
> 负面词放最后——镜头叙事写完后整体排除
> BGM禁止由负面词覆盖(通用项已含"背景音乐,BGM,配乐"),不需要单独音频段
```
> **4层×5类型适配表(按Step 1类型判定结果选层):**
| 类型 | ①主体 | ②设定-人物 | ②设定-其余4项 | ③镜头-台词 | ③镜头-动作 |
|------|-------|-----------|-------------|-----------|-----------|
| A 叙事剧情 | 人物 | 全用 | 全用 | 对白格式 | 角色动作 |
| B 单人Vlog | 人物 | 全用 | 全用 | 口播(非对白) | 人物动作 |
| C 旁白知识 | 场景/道具 | 可选 | 全用 | 旁白格式 | 画面变化 |
| D 产品展示 | 产品 | 省略 | 全用 | 无(可选旁白) | 产品展示流程 |
| E 纯氛围 | 场景 | 省略 | 全用 | 无 | 氛围流变 |
> **编导式 vs 旧11字段版对比:**
>
> | 对比项 | 编导式(新) | 11字段版(旧) |
> |--------|-------------|---------------|
> | 字段标签 | 无,信息溶解进叙事 | 【一致性锚定】【景深对焦】等11个标签 |
> | 技术参数 | 溶进②设定层各分项 | 独立字段罗列(机型/f值/快门等) |
> | 表演控制 | 动作暗示("鬼鬼祟祟地说") | 禁令约束("禁夸张喜剧化表情") |
> | 镜头组织 | 每镜头1段流畅叙事 | 时间戳逐beat分段罗列 |
> | 字符量 | ~350字 | ~700字 |
> | 生成效果 | 实战验证更优 | token浪费在参数上 |
### 3.3 标准负面词模板
> 每次生成提示词时从以下分类中按场景选取,汇总为一条【负面词】段。通用项必须带,可选项按场景勾选。
**通用禁止项(每次必带):**
```
文字, 字幕, 水印, logo, 签名, 变形, 多手指, 少手指, 断肢, 肢体融合, 错误手部, 错误嘴型, 面部扭曲, 换脸, 穿模, 塑料人物质感, 过度磨皮, 蜡像感, CG感, 3D渲染感, 镜头焦点来回拉风箱游移, 不符合人类骨骼生理的关节弯曲
```
**按场景勾选:**
| 分类 | 禁止词 | 适用场景 |
|:---|:---|:---|
| 表演类 | 夸张表演, 油腻表演, 过度煽情, 人物表情木讷僵硬, 画面静止如照片 | 喜剧/生活流/剧情 |
| 运镜类 | 慢动作(非指定), 人物瞬移, 镜头漂浮, 机械云台感, 画面静止 | 动态场景 |
| 质感类 | 廉价电视剧质感, 网红短视频风格, 广告片质感, 平光, 过曝, 死黑, HDR, 劣质滤镜 | 通用 |
| 畸变类 | 鱼眼畸变, 桶形畸变, 枕形畸变, 超广角拉伸, 人脸边缘拉伸, 微缩景观感, 玩具模型感, 移轴效果 | 写实/建筑/室内/人物近景 |
| 风格类 | 与目标风格矛盾的词(如写实场景禁"卡通/二次元",古装禁"现代电器") | 按需 |
> 写法:`负面词:[通用项] + [勾选项]`,逗号分隔,不加解释。
## 四、时长服从内容(速查)
| 内容类型 | 建议时长 | 理由 |
|---------|---------|------|
| 一瞬间反应(一个眼神/一个动作) | 3-5 秒 | 短镜不拖 |
| 单一动作 + 一句台词 | 5-7 秒 | 刚好说完做完 |
| 两句台词交替 + 反应 | 7-10 秒 | 对话节奏 |
| 三句台词 + 走位 + 动作 | 10-12 秒 | 编排紧凑 |
| 追逐/打斗/复杂连招 | 12-15 秒(2.0)/ 12-30 秒(2.5) | 动作密度高不必硬切 |
| 古风台词(慢速)+ 情绪 | 比现代语速 +2-3 秒 | 古风语速 2-3 字/秒 |
| 完整叙事 | 12-15 秒(2.0)/ ≤30 秒(2.5) | 2.5 单次可达 30 秒 |
| 已有成片想继续演 | 延长段 ≤30 秒/次(2.5),总长 ≤60 秒 | 套娃延长 |
| 完整短片/MV/预告 | 超长视频模式 ≤180 秒(2.5) | 一次性直出,长时序一致性好 |
> 单次生成上限:2.0 = 15 秒;2.5 = 30 秒。更长的走分段流程或 2.5 超长/延长模式。
## 五、精准时间测算体系
> 来源:seedance25-timed-prompter。2.5 原生支持秒级/帧级时间戳控制——测算的每一秒模型都能精准执行。
**公式去向铁律**:测算公式(字数÷语速、步数×常数等)只出现在时间预算表等内部测算环节;**提示词正文只写时长结论**(如"(1.2s)"、"(3步,约1.5s)")。禁止把"4字÷3.5=1.2s"这类算式写进提示词正文——模型不做算术,算式是噪音且浪费字符额度。
### 5.1 台词语速公式表
| 台词类型 | 语速标准 | 测算公式 |
|---------|---------|---------|
| 普通中文对白 | 3-4 字/秒 | 字数 ÷ 3.5 = 秒数(取中值) |
| 情绪台词(哭腔/怒斥/颤抖/压抑) | 2-3 字/秒 | 字数 ÷ 2.5 = 秒数 |
| 古风台词/文言/诗词 | 2-3 字/秒 | 字数 ÷ 2.5 = 秒数 |
| 气声/耳语/低语 | 1.5-2 字/秒 | 字数 ÷ 1.8 = 秒数 |
| 外语对白(英/日/韩等) | 约 2.5-3 词/秒 | 词数 ÷ 2.8 = 秒数 |
| 停顿/迟疑/换气 | — | 每次 0.5-1 秒 |
| 表演补偿(开口前反应/说完后反应/视线变化) | — | 每次 0.5-1.5 秒 |
> 一句台词如果 >8 秒说不完 → 按自然停顿拆到多个时间戳区间,但原文不改。
### 5.2 动作时间常数表(14类)
| 动作类型 | 最短可看清时间 |
|---------|-------------|
| 简单表情反应(抬眉/抿嘴/眨眼) | 0.5-1 秒 |
| 关键眼神/对视 | 1-2 秒 |
| 转头/回身 | 1-2 秒 |
| 起身/坐下/蹲下 | 1.5-3 秒 |
| 走位(一步) | 0.5 秒/步 |
| 走位(从A点到B点,3-5步) | 2-4 秒 |
| 拔剑/推门/掀帘/摔杯 | 1-2 秒 |
| 单手交手一击 | 1-2 秒 |
| 连续交手(2-3个回合) | 3-5 秒 |
| 复杂长尾动作(后空翻+拔剑+落地连招) | 4-8 秒 |
| 物品拿起/递交/特写 | 1-2 秒 |
| 身体倒地/坠落 | 1.5-3 秒 |
| 害羞脸红 | ≥2.5 秒(视线躲闪→脸颊泛红→低头/抿嘴) |
| 落泪 | ≥3 秒(眼眶湿润→泪珠溢出→滑落) |
> 违反时间常数的动作会被 AI 压缩成"表情包式跳变",失去真实感。
### 5.3 运镜与衔接时间常数表
| 运镜类型 | 时间 |
|---------|------|
| 定场/环境建立 | 1-2 秒 |
| 推/拉镜头 | 1-3 秒 |
| 摇/移镜头 | 1-2 秒 |
| 跟拍 | 与主体动作同步 |
| 硬切 | 0-0.5 秒 |
| 淡入/淡出/叠化 | 1-2 秒 |
| 首帧承接(建立空间方位) | 1-2 秒 |
| 末帧钩子停留 | 1-2 秒 |
### 5.4 帧级时间戳换算(2.5 专用)
2.5 支持帧级时间戳。需要卡音乐点/精确到帧时使用:
**帧号 = 秒 × 24**(24fps)
- 3 秒 = 第 72 帧
- 10 秒 = 第 240 帧
- 提示词中可写 `第 0-90 帧 (0s-3s)` 双标注
- 时间戳前缀格式:`0-3s:` 或 `[00.0-03.0s]`,按时间顺序排列
### 5.5 时间预算表(必须输出)
**节奏档位判定(时间测算前置,先定档再定镜头数):**
| 节奏档位 | 适用 | 4-6秒 | 7-9秒 | 10-12秒 | 13-15秒 |
|---------|------|-------|-------|---------|---------|
| 电影感中速 | 剧情/文戏/生活流 | 1-2镜 | 2-3镜 | 3-5镜 | 4-6镜 |
| 短视频中高密度 | 抖音/竖屏默认 | 2镜 | 3-4镜 | 4-6镜 | 6-8镜 |
| 高密度动作或强钩子 | 打斗/追逐/强钩子 | 2-3镜 | 4-5镜 | 5-7镜 | 7-10镜 |
| 慢节奏但高信息 | 强情绪/仪式/悬疑凝视 | 按功能保留 | 按功能保留 | 可1-2镜(须说明慢镜头功能) | 可1-2镜(须说明慢镜头功能) |
> 按剧情功能+平台自动判档 → 定镜头数 → 逐项测算时长。10秒以上只有1-2镜时必须命中慢节奏档并写清慢镜头功能。
```
┌─────────────────────────────────────┐
│ 本段演出时长测算 │
├────────────────┬────────┬───────────┤
│ 项目 │ 详情 │ 测算时间 │
├────────────────┼────────┼───────────┤
│ 节奏档位 │ ... │ — │
│ 镜头数 │ ... │ N 镜 │
│ 台词口播 │ ... │ X.X 秒 │
│ 表情与表演 │ ... │ X.X 秒 │
│ 身体动作/走位 │ ... │ X.X 秒 │
│ 道具交互 │ ... │ X.X 秒 │
│ 运镜与转场 │ ... │ X.X 秒 │
│ 首帧承接 │ ... │ X.X 秒 │
│ 末帧钩子停留 │ ... │ X.X 秒 │
├────────────────┼────────┼───────────┤
│ 测算总时长 │ │ XX.X 秒 │
│ 规划时长 │ │ XX 秒 │
│ 结论 │ 通过/需调整 │
└────────────────┴────────┴───────────┘
```
### 5.6 超调处理优先级(测算总时长 > 规划时长)
1. 先延长到平台上限(2.0 = 15 秒 / 2.5 = 30 秒)
2. 仍不够 → 建议拆成"首段 + 延长段"(2.5 套娃延长,总长 ≤60 秒)或超长视频模式(≤180 秒)
3. 减少次要动作/反应镜头
4. 删减原创建议台词(非用户原文)
5. 用户原文台词按自然停顿拆分到下一时间戳区间/下一段
6. **用户原文台词绝不删改**
### 5.7 不足处理(测算总时长 < 规划时长)
- 不硬凑满额时长。4-30 秒内任何值都可以。
- 空余时间留给画面自然节奏,不是塞废话。
## 六、平台硬约束
### Seedance 2.0
- 提示词容量:中文 ≤500 字符(品质基准)/ 实测 ≤2000 字符(硬上限)
- 单次生成:4-15 秒;480p / 720p / 1080p;16:9 / 9:16 / 21:9 / 1:1 / 2.35:1
- 多模态:图片 9 张(<30MB)/ 视频 3 段(2-15s,<50MB)/ 音频 3 段(≤15s,<15MB)/ 合计 ≤12 个
- 不支持写实真人脸部素材(自动拦截);动漫角色卡需走真人化前缀或真人参考图
- @引用官方命名:`@图片N` / `@视频N` / `@音频N`(中文命名,不用英文)
### Seedance 2.5(相对 2.0 的关键变化)
| 能力 | 2.5 规格 | 对提示词的影响 |
|------|---------|--------------|
| 单次生成时长 | 最长 30 秒 | 单段规划区间从 4-15 秒扩大到 4-30 秒 |
| 视频延长 | 单次延长 ≤30 秒,可多次套娃,总长 ≤60 秒 | 可输出"接续上一段"的延长专用提示词 |
| 超长视频模式 | 一次性直出最长 180 秒 | 用"镜头N(0:00-0:08)"分镜脚本格式 |
| 时间戳文本控制 | 原生支持秒级 + 帧级(24fps) | 测算结果直接写成时间戳,模型按秒执行 |
| 多模态参考 | @图片/@视频/@音频/@音效,支持迁移运镜/光影/节奏 | @引用必须声明用途(参考什么、不参考什么) |
| 纯净素材 | 有效响应"无字幕、无背景音乐" | 需要干净底片时显式声明 |
| 去 AI 感 | 皮肤/毛发/长尾动作/切镜一致性大幅优化 | 可写复杂动作链;用"原生皮肤质感"等词 |
| 多语种 | 中/英/西/印尼/马来/泰/阿/葡/越/日/韩 | 台词可直接写目标语言,可声明口型同步 |
| 负向约束 | "禁止出现XX"响应可靠 | 禁止字幕/水印/BGM/IP 元素可放心写 |
> 2.5 @素材引用规则:必须声明用途,例:"@视频1仅参考运镜轨迹与动作节奏,不保留原画面质感"
> 2.5 纯净素材声明:"纯净视频,全程无字幕、无背景音乐";去除参考素材BGM:"去除@视频1中的背景音乐,仅保留人声"
> 2.5 多语种口型同步:声明"嘴型与台词发音严格同步"
## 七、双版本输出(2.5)
每个生成段输出两个版本:
1. **多模态版**(有 @素材时):包含全局约束声明 + @引用声明用途 + 时间戳分镜 + 负向约束
2. **纯文字版**(无素材可直接用):结构同上,@引用替换为完整文字描述
> 全局约束声明模板:视觉风格锁定 + 字幕与音频策略 + 参考素材用途声明 + 本段时长
> 负向约束模板:禁止出现[字幕/水印/无关BGM/IP元素等,按需声明]