Files
mcn-short-video/project/短视频脚本创作/V1.0/subskill/mcn-video-prompt/references/制作流程/分镜提示词制作流程.md
T
maogeigei ab97842030 feat(MCN工作台): 移植dsh导入账号功能 + 弹窗按钮/宽度优化 + 分镜技能归入subskill
- 账号列表页新增「导入账号」:两种方式(抖音账号信息/本地文件夹),复用 executeTask 任务链路提交 AI 任务
- 查看改写弹窗:展开源脚本按钮移入 AI脚本 标题右侧(间隔10px),弹窗最大宽度 1400→1600
- 短视频提示词生成 整体移入 短视频脚本创作/V1.0/subskill/mcn-video-prompt(与 mcn-dou-analysis 同构,138 文件 R100 保留历史)
- 工作台 dsh-data/server 若干修复 + 记忆更新
2026-08-28 18:54:01 +08:00

29 KiB
Raw Blame History

分镜提示词制作流程

来源:ShotDesign 5步工作流 + seedance2.0-prompt-skill 路径分流/极简优先铁律 + seedance-specs 官方公式 + seedance25-timed-prompter 精准时间测算体系 适用:F3(生成图片)、F4(生成分镜)单镜头提示词的标准制作路径

一、总流程(6步)

①剧本分析 → ②需求分析 → ③路径分流 → ④提示词构建 → ⑤强制校验 → ⑥交付

Step 1 剧本分析(生成提示词前必做)

产出仅在上下文中驱动下游,不单独落盘。未完成此步骤不得进入提示词构建。

1a 剧本类型判定(先做):

类型 特征 典型场景
A 叙事剧情 有角色+对白+情节弧线 短剧/情景喜剧/故事短片
B 单人出镜 单人+口播/Vlog 探店/美食/旅行/亲子Vlog
C 旁白知识 画外音驱动+无角色对白 科普/教程/纪录片/解说
D 产品展示 产品为主体+人物为辅或无 产品广告/开箱/展示
E 纯氛围 无人物无对白+纯视觉流 风景空镜/概念片/MV

1b 维度拆解(①全类型必做,②-⑤按类型选做):

维度 拆解项 适用类型 产出 → 驱动下游
① 节奏·叙事逻辑 故事线/视觉节奏一句话概括 / 叙事结构(线性·倒叙·插叙·环形)/ 节奏图(铺陈→蓄力→爆发→余韵,标注时间区间)/ 叙事驱动类型(事件·对白·旁白·混合·视觉流)/ 台词风格(方言·口语·书面·旁白语气——剧本未写但角色身份暗示的方言语气需在此提取) 全类型 → 路径分流 + 段落时长 + 台词语气修饰
② 爆点·情绪痛点 爆点定位(时间戳+触发事件+预期反应)/ 情绪痛点(观众共情触发点,非角色情绪)/ 视觉高潮点(非叙事类的画面冲击峰) A/B/C → 景别递进策略 + 运镜设计
③ 反转情节 反转类型(身份·认知·关系·命运)/ 反转锚点(铺垫在哪→引爆在哪)/ 前后对比(情绪·认知·关系变化) A → 镜头逻辑(一镜到底vs多段切换)+ 首末帧设计
④ 人物关系 关系图谱(主要角色+关系类型)/ 权力结构(谁主导·被动·被揭示)/ 关系变化弧线(反转前后) A(多角色必做)/B(单人省略) → 场景调度(站位·朝向·视线焦点)+ 景别选择
⑤ 情绪弱点 角色情绪弱点(内心最脆弱点=驱动力来源)/ 观众情绪弱点(什么击中观众=共鸣触发器)/ 弱点→爆点对应关系 A/B → 微表情弧线设计 + 动作时间常数选取

D/E类:②-⑤均不适用,只做①(节奏+视觉流),驱动④层格式的镜头层(产品展示流程/氛围流变描述)

分析 → 下游驱动关系:

剧本分析
  ├─ 类型判定 → 4层格式适配(哪些层省略/变形,见3.2.2类型适配表)
  ├─①节奏+台词风格 → 路径分流 + 段落时长 + 台词语气修饰
  ├─②爆点/视觉高潮 → 景别递进 + 运镜设计(A/B/C类)
  ├─③反转 → 镜头逻辑 + 首末帧(A类)
  ├─④关系 → 场景调度 + 站位(A类多角色)
  └─⑤弱点 → 微表情弧线 + 动作设计(A/B类)
        ↓
   Step 4 提示词构建(按类型+场景选层)

示例A(叙事剧情类)——"母亲接到失踪儿子电话":

  • 类型=A → 5维度全做
  • ①叙事逻辑=一镜到底(POV母亲眼睛)/ 线性 / 麻木→电话→紧张→不敢信→震惊→行动 → 路径C + 单段30秒
  • ②爆点=电话铃声打破平静(第4-5秒)/ 痛点=长期消耗后的疲惫被一瞬间击碎 → 景别Z8→Z2递进 + 缓推→急推
  • ③反转=认知反转(以为是日常→不是)/ 锚点=开头麻木日常铺垫→电话引爆 → 首帧=麻木日常 / 末帧=猛然行动
  • ④关系=母子(但全程不露脸,只看苍老的手)/ 母亲被动·被揭示 → 调度=手部特写+环境 / 禁止面部镜头
  • ⑤弱点=角色弱点=长期消耗后的疲惫 / 观众弱点=亲情本能触发 → 微表情降级L1 + 动作=从静止到猛然

示例D(产品展示类)——"护肤品质地展示":

  • 类型=D → 只做①,②-⑤跳过
  • ①节奏=视觉流:产品亮相→质地特写→涂抹过程→效果呈现 / 线性 / 铺陈(亮相)→蓄力(特写)→爆发(涂抹)→余韵(效果) → 路径A + 单段8秒
  • 台词风格=N/A(无对白,可选旁白)
  • 驱动4层格式:①主体=护肤品(列道具行) ②设定-人物省略 ③镜头=产品展示流程(非角色动作)

Step 2 需求分析

  • 明确:时长、画幅(9:16 竖屏 / 16:9 横屏)、单镜头还是多镜头、有无参考素材
  • 判断时长是否 >15 秒:超过则必须走《长视频分段制作流程》
  • 判断叙事形态:瞬间反应 / 单一动作 / 情绪弧线 / 小剧情 / 完整叙事
  • 结合 Step 1 剧本分析结论:叙事结构决定镜头逻辑、节奏图决定段落时长、情绪弱点决定微表情弧线

Step 3 路径分流(按输入素材类型)

路径 输入 方法 详见
A 纯文本生成 无参考素材 官方公式直写 本文件第三节
B 参考图/视频 图片或视频素材 @引用锚定 + 补充描述 《图生视频与分镜板制作流程》
C 图生视频(单图驱动) 1 张图片 双范式:反应模式 / 凝视模式 《图生视频与分镜板制作流程》
D 分镜板驱动 分镜脚本/多格规划 格间关系三分类 《图生视频与分镜板制作流程》

Step 4 提示词构建

按第三节输出格式组装:按Step 1类型判定结果选择4层结构的适用层(见3.2.2类型适配表);构建时用11字段思考清单(3.2.1)内部过目确保不遗漏。词表从 知识库/15维度 各取所需。 剧本分析(Step 1)产出是提示词组装的内容来源:景别/运镜由爆点驱动、场景调度由人物关系驱动、微表情弧线由情绪弱点驱动、人物设定由角色定位驱动、表演指令由情绪弱点驱动、负面词由场景类型勾选。

Step 5 强制校验(8项)

  1. 字符数:Python len() 实测,禁止估算;品质基准 ≤500 字符,硬性上限 ≤2000 字符(实测)
  2. 结构完整性:输出必须包含核心层(①主体 + ②设定 + ③镜头叙事 + ④负面词),②设定层按类型适配(A全用/B全用/C人物可选/D人物省略/E人物省略);顺序固定主体→设定→镜头→负面词
  3. 版权扫描:品牌词/风格借喻/涉灰场景词/夜场BGM词 四类扫描(详见《图生视频与分镜板制作流程》版权审查)
  4. 导演去名化:提示词中不得出现导演名/工作室名/IP名,只用参数化描述
  5. 动作物理合理性:三层动作分级检查(大动作禁止)
  6. 多模态引用核对:素材多时逐一检查 @对象指向正确;素材编号一致性闸门——同一角色/场景/道具在所有镜头必须用同一 @图片N,禁止编号混用(如镜头1用 @图片2 指男主、镜头2却用 @图片3 指男主)
  7. 负面提示词:标准化禁止清单(3.3)是否附上,通用项必须全带
  8. 时长与内容匹配:见"时长服从内容"速查

Step 6 交付

  • 镜头部分上方标注视频总时长(如"视频总时长:8秒",放设定层之后、镜头段之前,属投喂信息不混入画面描述)
  • 单镜头:代码块输出完整提示词
  • 多镜头:逐镜头编号 + 代码块,附过渡策略(>15秒时);每段末尾写段末状态(可见姿态/视线/道具/光线/镜头方向),供下一段继承

二、极简优先铁律(跨路径通用)

  • 默认 300-500 字符,不是越多越好。实战数据:3102 字符违规 → 271 字符过审
  • 文字只补 4 件事,其余交给参考图:
    1. 图里没有的(新增元素)
    2. 需强化的(图里弱但要突出的)
    3. 需规避的(图里有但不要的)
    4. 硬约束(画幅/时长/禁止项)
  • 二分法定位问题:砍到极限版 30-50 字符 → 每次加 1 个元素 → 对比差异

三、结构化提示词模板(路径A)

3.1 基础六要素(构建思考参考,单镜头简单场景)

主体/角色 + 所在场景 + 核心动作/时序 + 镜头语言 + 画面风格/光影材质 + 音频要求

六要素词表对应:

要素 词库位置
主体(外貌+微表情) 知识库/01_主体描述
动作(物理阻尼+时间常数) 知识库/02_动作行为
场景(环境+空间锚定) 知识库/03_场景描述
镜头语言(景别Z+高度Y+方位X+焦段F) 知识库/04~06
光影/风格/色彩 知识库/07~09、15
音效(原生音效优先) 知识库/13_音效音频

3.2 输出格式(4层结构)

实战验证(2026-08-20):编导手写提示词(~350字,叙事驱动)生成效果优于结构化11字段模板(~700字,技术参数驱动)。模型吃故事,不吃参数表。 改造原则:11字段降为构建时内部思考清单(确保不遗漏),最终输出只写4层结构——主体置顶按类别分行、设定按类型分项、镜头叙事流畅、负面词放最后。技术参数溶解进设定各分项,表演靠动作暗示而非禁令。按Step 1类型判定结果选择4层的适用层。

3.2.1 构建思考清单(内部,不落盘)

构建提示词时逐项过目,确保不遗漏。但最终提示词中不出现字段标签——信息溶解进叙事段落。

思考项 构建时想什么 输出时去哪
①一致性锚定 角色服装/道具是否需文字锁定? ①主体列表@图片引用锁定;无图才在②设定-人物补1句
②类型质感 画质/风格/光影基调? ②设定-视觉风格(1句)
③人物设定 逐角色外貌/着装/气质? ①主体列表@图片锁定;无图在②设定-人物补1句(主体中每个人物必写,不可遗漏)
④场景 空间布局/道具? ②设定-场景(1句空间描述)
⑤景深对焦 是否需非默认景深? 默认不写;特写需浅景深时加进②设定-构图
⑥摄影质感 机型/镜头/光圈/快门/ISO/色彩/光影/质感/动态范围? 按维度自动生成英文摄影参数(从知识库/10_后期细节·摄影质感维度表取值,判断适用维度组合),排除画幅/帧率
⑦表演幅度 需禁某种表演? 默认不写;用动作暗示替代("鬼鬼祟祟地说"比"禁夸张表情"有效)
⑧背景动态 需环境微动? 默认不写;仅在画面可能静止时加进③镜头动作描述
⑨镜头空间 机位/景别/朝向? 溶进③镜头叙事("中景跟拍男主正面")
⑩表演指令 逐beat微动作? 溶进③镜头叙事的动作描述
⑪负面词 场景适配禁止项? ④负面提示词(3.3标准模板)

原则:能用@图片引用解决的,绝不写文字;能用动作暗示的,绝不写技术参数。

3.2.2 输出格式(4层结构)

①主体列表(置顶,按类别分行)
人物:[角色名] @[图片N]  [角色名] @[图片N]
场景:[场景名] @[图片N]
道具:[物品名] @[图片N]  [物品名] @[图片N]
> 所有出场人物、关键场景、道具分三类分行列,@图片引用优先,无图用1句简述
> 有哪类列哪类,无道具/无场景则省略该行;D类主体=产品(列道具行),E类主体=场景(列场景行)
> **人物锚定句(仅多角色+跨镜头复用时启用)**:`将 @图片N 中的[身份/外观/服装]定义为 <角色名>`,后续镜头用 `<角色名>` 指代、不再重复写外貌;**识别不到角色名时用角色代称锚定**(`<男主>` `<兄弟>` `<角色A>` 等代称);单人单段保持现状(`人物:男主 @图片2`),不写锚定句

②设定(分项,每项1句,按类型取舍)
人物:[角色]——[气质/状态1句];[角色]——[气质/状态1句]
> **主体中出现的每个人物,此处必须有对应设定,不可遗漏**——逐人写,用分号分隔
> @图片已锁定的不重复写外貌,只补气质/状态;无图时按知识库/01_主体描述外貌原则写(宁少写不错写);D/E类省略此行
场景:[空间布局+前中后景层次1句]
光线:[光源来源+主光方向+亮暗区+色温1句]
构图:[景别+前中后景层次+构图法则+视觉重心/留白1句]
视觉风格:[画质+风格+质感1句]
摄影质感:模型按维度自动生成英文摄影参数(机型/镜头/光圈/快门/ISO/色彩/光影/质感/动态范围),**用[]框起**,根据剧情场景判断适用维度,从知识库/10_后期细节·摄影质感维度表取值组合(不照搬固定示例);排除画幅/帧率(属平台参数放代码框外)
> 场景见知识库/03_场景描述(空间锚定三层);光线见知识库/07_光线时间(光影三层);构图见知识库/14_构图布局(五法则+构图几何+雷区规避);风格见知识库/15_视觉风格(去名化);朝向见知识库/06_焦距视角X轴

③镜头(每镜头1段流畅叙事)
镜头N:[机位/景别/朝向] + [动作/变化流程] + [运镜变化嵌在动作里] + [有台词时:(人物,语气):内容]
- 每镜头1段,按动作流自然叙述,不分beat罗列
- **朝向必须写明**:正面/背后/固定/侧面——用"正面拍摄""从背后拍摄""固定视角"等明确朝向(词库见知识库/06_焦距视角X轴+知识库/03_场景描述面部朝向/过肩);**主体位置用画面坐标**——写"男主位于画面右侧、四分之三侧朝镜头",不写"从男主右侧拍摄"(画面坐标优于主体坐标,生视频模型更易定位,词库见知识库/03_场景描述演员调度);**避开构图雷区**——默认不用"正面居中",改用 X2 四分之三侧/三分法偏移(雷区见知识库/14_构图布局)
- **机位高度默认平视**:视点与人物视线齐平(Y4 平视,词库见知识库/06_焦距视角Y轴);仅剧情需要压迫(俯视 Y6)或英雄感(仰视 Y2)时才偏离
- **空间方向一致性(多人/多镜头/有明确方位时写)**:锁定空间坐标("A在左、B在右、门在A背后")+ 移动方向一致("物体始终从右向左移动");禁止镜像翻转、禁止跨越180度轴线(词库见知识库/03_场景描述·空间锚定)
- **连续动作不拆**:同一空间内连续发生的动作链保持在一个镜头段内,不拆成多个镜头
- **衔接可见化**:镜头间/段间衔接必须写成可见动作转接或画面状态("镜头停在门框上的手""视线下移到腰侧血迹"),禁止写"接下一段/接分镜2/承接下一段"这类模型无法执行的衔接语
- 运镜写在动作流程中("镜头从正面绕到背后"),不独立成字段;固定/跟拍镜头可补"轻微手持呼吸感"增加活体感,避免死板的机械固定
- **有台词时**:台词带语气/方言/神态修饰,不用禁令式约束;台词格式+方言+情绪标签见知识库/13_音效音频·台词与情绪标签
- 时间戳可选标注在段首("0-3s:"),简单场景可不标
- 动作/变化要具体可视化(写"手指蘸取乳液在手腕推开"而非"涂抹"),不要泛泛
- **视听转译四步法**(内部思考,不落盘):遇到抽象情绪描述时依次问——①"演员用身体哪部分演?"(眼神/嘴角/手指/呼吸/步伐)②"摄影机用什么镜头能拍到?"(景别/焦段/角度/运镜)③"要不要靠声音/光线/物件辅助?"(环境音/道具状态变化/光线突变)。确保每句描述拍得到、录得到,不把心理活动当画面写
- **情绪铺垫分级(强情绪镜头)**:悲伤/愤怒/崩溃等强情绪不能第一帧满格爆发,按"克制→微表情泄露→情绪压上来→爆发"逐步递进(写"先愣住半秒、眼神失焦、嘴唇抿住、眼眶蓄泪、第一滴泪滑下",而非"突然崩溃大哭")。用动作暗示情绪递进,不写"禁止夸张表演"类禁令
- 有音效时:音效嵌在动作描述中自然出现("门铃声响起"、"啪的一声"),不独立成段
- **小道具朝向锁定**:手机/照片/证件/信封/戒指等有正反面的道具,必须写清朝向——屏幕或信息面朝镜头还是朝手心/桌面。写"手机背面朝镜头、屏幕朝向手心",不写"拿着手机"(模型默认会把信息面怼向镜头造成穿帮)
- **段末状态(仅多段连续输出时写,单段不写)**:每段末尾写一句"下一段可继承的可见状态"——角色姿态/视线方向/道具位置/光线方向/镜头方向,如"段末男主缩在门框边,薯片袋已被兄弟抢走,镜头停在两人对峙的正面"。用于跨段连续性的锚点
> D/E类镜头层写产品展示流程或氛围流变,不写角色动作

④负面提示词
负面提示词:[通用项] + [场景勾选项](见3.3)
> 负面词放最后——镜头叙事写完后整体排除
> BGM禁止由负面词覆盖(通用项已含"背景音乐,BGM,配乐"),不需要单独音频段

4层×5类型适配表(按Step 1类型判定结果选层):

类型 ①主体 ②设定-人物 ②设定-其余4项 ③镜头-台词 ③镜头-动作
A 叙事剧情 人物 全用 全用 对白格式 角色动作
B 单人Vlog 人物 全用 全用 口播(非对白) 人物动作
C 旁白知识 场景/道具 可选 全用 旁白格式 画面变化
D 产品展示 产品 省略 全用 无(可选旁白) 产品展示流程
E 纯氛围 场景 省略 全用 无 氛围流变

编导式 vs 旧11字段版对比:

对比项 编导式(新) 11字段版(旧)
字段标签 无,信息溶解进叙事 【一致性锚定】【景深对焦】等11个标签
技术参数 溶进②设定层各分项 独立字段罗列(机型/f值/快门等)
表演控制 动作暗示("鬼鬼祟祟地说") 禁令约束("禁夸张喜剧化表情")
镜头组织 每镜头1段流畅叙事 时间戳逐beat分段罗列
字符量 ~350字 ~700字
生成效果 实战验证更优 token浪费在参数上

3.3 标准负面词模板

每次生成提示词时从以下分类中按场景选取,汇总为一条【负面词】段。通用项必须带,可选项按场景勾选。

通用禁止项(每次必带):

文字, 字幕, 水印, logo, 签名, 变形, 多手指, 少手指, 断肢, 肢体融合, 错误手部, 错误嘴型, 面部扭曲, 换脸, 穿模, 塑料人物质感, 过度磨皮, 蜡像感, CG感, 3D渲染感, 镜头焦点来回拉风箱游移, 不符合人类骨骼生理的关节弯曲

按场景勾选:

分类 禁止词 适用场景
表演类 夸张表演, 油腻表演, 过度煽情, 人物表情木讷僵硬, 画面静止如照片 喜剧/生活流/剧情
运镜类 慢动作(非指定), 人物瞬移, 镜头漂浮, 机械云台感, 画面静止 动态场景
质感类 廉价电视剧质感, 网红短视频风格, 广告片质感, 平光, 过曝, 死黑, HDR, 劣质滤镜 通用
畸变类 鱼眼畸变, 桶形畸变, 枕形畸变, 超广角拉伸, 人脸边缘拉伸, 微缩景观感, 玩具模型感, 移轴效果 写实/建筑/室内/人物近景
风格类 与目标风格矛盾的词(如写实场景禁"卡通/二次元",古装禁"现代电器") 按需

写法:负面词:[通用项] + [勾选项],逗号分隔,不加解释。

四、时长服从内容(速查)

内容类型 建议时长 理由
一瞬间反应(一个眼神/一个动作) 3-5 秒 短镜不拖
单一动作 + 一句台词 5-7 秒 刚好说完做完
两句台词交替 + 反应 7-10 秒 对话节奏
三句台词 + 走位 + 动作 10-12 秒 编排紧凑
追逐/打斗/复杂连招 12-15 秒(2.0)/ 12-30 秒(2.5) 动作密度高不必硬切
古风台词(慢速)+ 情绪 比现代语速 +2-3 秒 古风语速 2-3 字/秒
完整叙事 12-15 秒(2.0)/ ≤30 秒(2.5) 2.5 单次可达 30 秒
已有成片想继续演 延长段 ≤30 秒/次(2.5),总长 ≤60 秒 套娃延长
完整短片/MV/预告 超长视频模式 ≤180 秒(2.5) 一次性直出,长时序一致性好

单次生成上限:2.0 = 15 秒;2.5 = 30 秒。更长的走分段流程或 2.5 超长/延长模式。

五、精准时间测算体系

来源:seedance25-timed-prompter。2.5 原生支持秒级/帧级时间戳控制——测算的每一秒模型都能精准执行。

公式去向铁律:测算公式(字数÷语速、步数×常数等)只出现在时间预算表等内部测算环节;提示词正文只写时长结论(如"(1.2s)"、"(3步,约1.5s)")。禁止把"4字÷3.5=1.2s"这类算式写进提示词正文——模型不做算术,算式是噪音且浪费字符额度。

5.1 台词语速公式表

台词类型 语速标准 测算公式
普通中文对白 3-4 字/秒 字数 ÷ 3.5 = 秒数(取中值)
情绪台词(哭腔/怒斥/颤抖/压抑) 2-3 字/秒 字数 ÷ 2.5 = 秒数
古风台词/文言/诗词 2-3 字/秒 字数 ÷ 2.5 = 秒数
气声/耳语/低语 1.5-2 字/秒 字数 ÷ 1.8 = 秒数
外语对白(英/日/韩等) 约 2.5-3 词/秒 词数 ÷ 2.8 = 秒数
停顿/迟疑/换气 — 每次 0.5-1 秒
表演补偿(开口前反应/说完后反应/视线变化) — 每次 0.5-1.5 秒

一句台词如果 >8 秒说不完 → 按自然停顿拆到多个时间戳区间,但原文不改。

5.2 动作时间常数表(14类)

动作类型 最短可看清时间
简单表情反应(抬眉/抿嘴/眨眼) 0.5-1 秒
关键眼神/对视 1-2 秒
转头/回身 1-2 秒
起身/坐下/蹲下 1.5-3 秒
走位(一步) 0.5 秒/步
走位(从A点到B点,3-5步) 2-4 秒
拔剑/推门/掀帘/摔杯 1-2 秒
单手交手一击 1-2 秒
连续交手(2-3个回合) 3-5 秒
复杂长尾动作(后空翻+拔剑+落地连招) 4-8 秒
物品拿起/递交/特写 1-2 秒
身体倒地/坠落 1.5-3 秒
害羞脸红 ≥2.5 秒(视线躲闪→脸颊泛红→低头/抿嘴)
落泪 ≥3 秒(眼眶湿润→泪珠溢出→滑落)

违反时间常数的动作会被 AI 压缩成"表情包式跳变",失去真实感。

5.3 运镜与衔接时间常数表

运镜类型 时间
定场/环境建立 1-2 秒
推/拉镜头 1-3 秒
摇/移镜头 1-2 秒
跟拍 与主体动作同步
硬切 0-0.5 秒
淡入/淡出/叠化 1-2 秒
首帧承接(建立空间方位) 1-2 秒
末帧钩子停留 1-2 秒

5.4 帧级时间戳换算(2.5 专用)

2.5 支持帧级时间戳。需要卡音乐点/精确到帧时使用:

帧号 = 秒 × 24(24fps)

  • 3 秒 = 第 72 帧
  • 10 秒 = 第 240 帧
  • 提示词中可写 第 0-90 帧 (0s-3s) 双标注
  • 时间戳前缀格式:0-3s: 或 [00.0-03.0s],按时间顺序排列

5.5 时间预算表(必须输出)

节奏档位判定(时间测算前置,先定档再定镜头数):

节奏档位 适用 4-6秒 7-9秒 10-12秒 13-15秒
电影感中速 剧情/文戏/生活流 1-2镜 2-3镜 3-5镜 4-6镜
短视频中高密度 抖音/竖屏默认 2镜 3-4镜 4-6镜 6-8镜
高密度动作或强钩子 打斗/追逐/强钩子 2-3镜 4-5镜 5-7镜 7-10镜
慢节奏但高信息 强情绪/仪式/悬疑凝视 按功能保留 按功能保留 可1-2镜(须说明慢镜头功能) 可1-2镜(须说明慢镜头功能)

按剧情功能+平台自动判档 → 定镜头数 → 逐项测算时长。10秒以上只有1-2镜时必须命中慢节奏档并写清慢镜头功能。

┌─────────────────────────────────────┐
│         本段演出时长测算             │
├────────────────┬────────┬───────────┤
│ 项目            │ 详情    │ 测算时间   │
├────────────────┼────────┼───────────┤
│ 节奏档位        │ ...    │ —         │
│ 镜头数          │ ...    │ N 镜      │
│ 台词口播        │ ...    │ X.X 秒    │
│ 表情与表演      │ ...    │ X.X 秒    │
│ 身体动作/走位   │ ...    │ X.X 秒    │
│ 道具交互        │ ...    │ X.X 秒    │
│ 运镜与转场      │ ...    │ X.X 秒    │
│ 首帧承接        │ ...    │ X.X 秒    │
│ 末帧钩子停留    │ ...    │ X.X 秒    │
├────────────────┼────────┼───────────┤
│ 测算总时长      │        │ XX.X 秒   │
│ 规划时长        │        │ XX 秒     │
│ 结论            │ 通过/需调整        │
└────────────────┴────────┴───────────┘

5.6 超调处理优先级(测算总时长 > 规划时长)

  1. 先延长到平台上限(2.0 = 15 秒 / 2.5 = 30 秒)
  2. 仍不够 → 建议拆成"首段 + 延长段"(2.5 套娃延长,总长 ≤60 秒)或超长视频模式(≤180 秒)
  3. 减少次要动作/反应镜头
  4. 删减原创建议台词(非用户原文)
  5. 用户原文台词按自然停顿拆分到下一时间戳区间/下一段
  6. 用户原文台词绝不删改

5.7 不足处理(测算总时长 < 规划时长)

  • 不硬凑满额时长。4-30 秒内任何值都可以。
  • 空余时间留给画面自然节奏,不是塞废话。

六、平台硬约束

Seedance 2.0

  • 提示词容量:中文 ≤500 字符(品质基准)/ 实测 ≤2000 字符(硬上限)
  • 单次生成:4-15 秒;480p / 720p / 1080p;16:9 / 9:16 / 21:9 / 1:1 / 2.35:1
  • 多模态:图片 9 张(<30MB)/ 视频 3 段(2-15s,<50MB)/ 音频 3 段(≤15s,<15MB)/ 合计 ≤12 个
  • 不支持写实真人脸部素材(自动拦截);动漫角色卡需走真人化前缀或真人参考图
  • @引用官方命名:@图片N / @视频N / @音频N(中文命名,不用英文)

Seedance 2.5(相对 2.0 的关键变化)

能力 2.5 规格 对提示词的影响
单次生成时长 最长 30 秒 单段规划区间从 4-15 秒扩大到 4-30 秒
视频延长 单次延长 ≤30 秒,可多次套娃,总长 ≤60 秒 可输出"接续上一段"的延长专用提示词
超长视频模式 一次性直出最长 180 秒 用"镜头N(0:00-0:08)"分镜脚本格式
时间戳文本控制 原生支持秒级 + 帧级(24fps) 测算结果直接写成时间戳,模型按秒执行
多模态参考 @图片/@视频/@音频/@音效,支持迁移运镜/光影/节奏 @引用必须声明用途(参考什么、不参考什么)
纯净素材 有效响应"无字幕、无背景音乐" 需要干净底片时显式声明
去 AI 感 皮肤/毛发/长尾动作/切镜一致性大幅优化 可写复杂动作链;用"原生皮肤质感"等词
多语种 中/英/西/印尼/马来/泰/阿/葡/越/日/韩 台词可直接写目标语言,可声明口型同步
负向约束 "禁止出现XX"响应可靠 禁止字幕/水印/BGM/IP 元素可放心写

2.5 @素材引用规则:必须声明用途,例:"@视频1仅参考运镜轨迹与动作节奏,不保留原画面质感" 2.5 纯净素材声明:"纯净视频,全程无字幕、无背景音乐";去除参考素材BGM:"去除@视频1中的背景音乐,仅保留人声" 2.5 多语种口型同步:声明"嘴型与台词发音严格同步"

七、双版本输出(2.5)

每个生成段输出两个版本:

  1. 多模态版(有 @素材时):包含全局约束声明 + @引用声明用途 + 时间戳分镜 + 负向约束
  2. 纯文字版(无素材可直接用):结构同上,@引用替换为完整文字描述

全局约束声明模板:视觉风格锁定 + 字幕与音频策略 + 参考素材用途声明 + 本段时长 负向约束模板:禁止出现[字幕/水印/无关BGM/IP元素等,按需声明]