Files
mcn-short-video/project/短视频提示词生成/参考skills/seedance2.0-prompt-skill/references/storyboard-driven.md
T

404 lines
20 KiB
Markdown
Raw Normal View History

# 路径 D:分镜板驱动(Storyboard-Driven)方法论
> **适用场景**:用户上传 N 宫格分镜板 / 漫画分镜 / 多格拼贴图,想让 Seedance 直接输出可拼接视频——这类"已画好多格分镜"的需求**超出路径 A/B/C 的覆盖范围**,故单列路径 D。
>
> **状态**:v0.1,已由 case-10(vlog 四宫格)、case-11(雨夜电影预告)、case-13(街球 16 格)实测验证,仍在持续打磨。
---
## 0. 与现有路径的根本差异
| 维度 | 路径 A(概念驱动) | 路径 B(长视频流水线) | 路径 C(图片驱动) | **路径 D(分镜板驱动)** |
|------|-------------------|----------------------|-------------------|-------------------------|
| **输入** | 文字概念 | 完整项目企划 | 一张图 | **一张分镜板(多格拼贴图)** |
| **核心动作** | 收敛创意 | 拆 25 格→流水线 | 反向放大单图潜力 | **拆解+重排+串联多格的视觉叙事** |
| **图的角色** | 不需要 | 中间产物 | 框架参考 | **每一格都是独立的视觉锚点** |
| **时长决策** | 4-15s | >15s 分段 | 内容粒度推算 | **格数 × 单格秒数(4-15s 内)** |
| **输出形态** | 单条 prompt | 多条 prompt + 剪辑表 | 单条 prompt | **N 条独立 prompt + 拼接清单** 或 **单条多段时间戳 prompt** |
**核心识别信号**(满足任一即走路径 D):
- 用户上传的图本身是 **N 宫格分镜板**(2×2 / 3×3 / 4×4 / 1×N 等)
- 用户说 "根据分镜内容拼接视频"、"按这几格生成"、"每一格做一段"
- 图明显是 "Storyboard / 分镜脚本 / 漫画分镜风格" 的多格拼贴
---
## 1. 路径 D 的两种子模式
### 1.1 模式 D-1:单条多段时间戳模式(默认,简单)
**适用**:
- 格数 ≤ 4
- 总时长在 15s 以内
- 各格之间有连贯叙事或共同主题
**做法**:
- 把分镜板里的 N 格作为视频内的 N 段时间戳
- 每段对应一格的画面内容
- 用一条 Seedance prompt 完成
**示例分配**:
- 4 格 × 单格 3.5s = 14s 总时长
- 16 格分镜板取**关键 4 格**做单视频(用户决定哪 4 格)
### 1.2 模式 D-2:多条独立 prompt + 后期拼接模式(默认 16 格用这个)
**适用**:
- 格数 ≥ 5
- 总时长会超过 15s
- 各格之间有较强独立性(场景跳跃 / 多场景蒙太奇)
**做法**:
- 每一格生成一条独立的 Seedance prompt(4-6s 短片为主)
- 输出**拼接清单**指导用户如何剪辑
- 应用 `editing-rhythm.md` 的剪辑公式(呼吸式 / 心跳式 / 海浪式 等)
**示例分配**:
- 16 格 × 单格 4s = 64s 总片长(剪辑后建议 30-45s 成片)
- 16 条独立 prompt + 1 份剪辑节奏建议
### 1.3 ⭐ 关键前置判断:分镜板「格间关系」三分类(v0.2 新增·决定处理法的总纲)
> **教训来源**:case-13 街球(连续动作链)跑通🟢,但 case-11 雨夜 4 段(独立场景)翻车🔴。
> 真正决定怎么处理的**不是格数**,而是**格子与格子之间的关系**。
> D-1/D-2 是「按格数分」的输出形态选择,本节是「按格间关系分」的处理策略选择,**两者正交**。
**核心判断准则(一句话)**:
> 把每一格单独拎出来,它们是**「同一个动作/事件的连续切片」**,还是**「能各自独立存在的不同场景」**?
| 格间关系 | 识别特征 | 处理法 | 段间转场 | 标杆 case |
|---------|---------|--------|---------|----------|
| **① 连续动作链** | 同主角+同场景+同一时间线,N 格是一个动作/事件的分解帧(运动连拍、招式分解、舞蹈分解) | **「合并还原法」**:N 格压成 M 阶段(M≈5-7),一镜到底跟拍,模型补间还原成一次连贯动作 | 无转场(一镜到底) | case-13 街球 16 格🟢 |
| **② 顺承场景** | 同主角,场景有时间/地点的连贯递进(一晚夜游不同地点、一天 vlog 不同时段),画风色调统一 | **D-1 时间戳分段**:每格一段,段间硬切或溶解皆可 | 硬切(自然感)/ 溶解 | case-10 闺蜜夜游🟢 |
| **③ 独立场景蒙太奇** | 同主角,但场景/机位/光线/时间**各自独立、跳跃**,画风差异大,无法合并也无强时序 | **「记忆/心境蒙太奇法」**(见 1.4 D-3):靠情绪母题黏合 + 语义转场流 + 首尾呼应 | 交叉溶解 / 记忆闪回式 | 海岛旅行 9 格(本次新增范式) |
**三步决策树**:
```
看到多宫格分镜板
↓
① 格子是「连续动作切片」吗?(运动/招式/舞蹈分解)
是 → 合并还原法(D-1 降级合并,一镜到底,详见 7.3 边界 case 策略)← 街球
否 ↓
② 是「独立场景」,那画风/色调统一、有顺承时序吗?
统一+顺承 → D-1 时间戳分段(硬切或溶解都行)← 闺蜜夜游
差异大/无时序 ↓
③ 用「记忆/心境蒙太奇法」(D-3:情绪母题 + 语义转场流 + 首尾呼应)← 海岛旅行
```
### 1.4 ⭐ 模式 D-3:记忆/心境蒙太奇(独立场景串联,v0.2 新增)
> **定位**:专治「③ 独立场景蒙太奇」——同一主角、N 个画风/场景差异大的独立片段,
> 想用**一条** prompt 串成一支连贯的"回忆 MV / 情绪短片",而不是逐条独立跑(D-2)。
>
> **实证来源**:用户提供的「海岛夏日旅行 9 宫格」prompt(2026-06-02),用 `nostalgic summer memory` 母题 +
> `coming to life`/`fading out like a memory disappearing` 首尾呼应,把 9 个差异极大的场景(自拍/沙滩/船甲板/泳池/日落/室内/蓝调/小径背影)黏成一段连贯回忆。
> 这恰好补齐了 case-11 翻车后只留一句话的"心境四联画"备选方案。
**适用**:
- 格间关系 = ③ 独立场景蒙太奇(最重要的前提)
- N 格无法合并成连续动作,画风/机位/光线差异大
- 但**主角是同一人**,且能找到一个统一的**情绪母题**(怀旧/治愈/孤独/成长/告别等)
**3 个核心机制(缺一不可)**:
1. **情绪母题黏合剂**(最关键):开头一句话定调全片情绪,把所有差异片段统一解释为"同一种心境下的记忆流"。
- 例:`一支怀旧夏日旅行回忆短片,画面在各个瞬间间平滑流转,仿佛记忆逐一复活`
- 母题让"硬切的违和"转化为"回忆的跳跃感"——这是 ③ 类能跑通的根本原因。
2. **语义转场流**(替代硬时间戳):不写"0-3秒/4-8秒",改用转场连接词驱动,让模型自控节奏。
- 句式:`以…开场 → 流转到… → 切到… → 转入… → 移向… → 接着… → 最后以…收尾`
- 这与 `image-to-prompt.md`「极简优先铁律」("由模型自由设计衔接节奏")理念一致。
3. **首尾呼应的母题包裹**:开头"记忆复活",结尾"记忆消散/淡出",形成情绪闭环 = 二刷钩子。
- 例:结尾 `背影渐渐走远,画面像一段记忆般缓缓淡出`
**D-3 Prompt 模板**:
```
[一句情绪母题定调:一支[情绪]的[主题]回忆短片,画面在各瞬间间平滑流转,仿佛记忆逐一复活][比例]。
参考@图片1[拼贴图作分镜参考],但不复刻九宫格网格边框/格子分隔线/编号,
将每一格演绎为一段连贯记忆,由模型自由设计段间衔接节奏。
以[第1格场景:主体+动作+光影+情绪]开场,
流转到[第2格场景],
切到[第3格场景],
转入[第4格场景],
移向[第5格场景],
接着[第6格场景],
随后[第7格场景],
最后以[末格场景:背影/远景]收尾,画面像一段记忆般缓缓淡出。
[统一调色/光影母题一句话,让差异场景视觉收敛:如 暖金阳光与梦幻虚化贯穿全片],
[段间过渡方式:每段间用柔和交叉溶解衔接,保持记忆流转的连续感],
[BGM 一句:舒缓治愈的氛围音乐贯穿]。
禁止任何文字字幕LOGO水印,禁止网格边框与分镜板UI元素,禁止真人面孔可识别。
```
**D-3 与「合并还原法」(街球) 的本质对照**:
| | 合并还原法(街球·连续动作链) | D-3 记忆蒙太奇(旅行·独立场景) |
|---|---|---|
| 输入格子关系 | 连续切片 | 独立场景 |
| 黏合手段 | 一镜到底跟拍 + 物理动作连贯 | 情绪母题 + 语义转场流 |
| 段间 | 无转场 | 交叉溶解 |
| 节奏控制 | 模型补间还原动作 | 模型按转场流自控节奏 |
| 母题作用 | 动作时序本身就是骨架 | 情绪才是唯一骨架(场景帮不上忙) |
**⚠️ 合规提醒**:D-3 常见于旅行/写真/泳装等场景(如本次海岛 9 格含泳装),输出前必过 `image-to-prompt.md` 合规清单——泳装曲线用 case-28「小心思曲线安全措辞」(figure/waistline/silhouette,避 breast/butt),并加 tasteful body-confidence 护栏。这份英文 prompt 原文**没做合规审查**,直接上即梦有 post-TNS 风险。
### 1.4.1 ⭐ D-3 两个子变体:文艺溶解版 vs 轻快混剪版(2026-06-03 case-29 实测沉淀)
> case-29 情侣八宫格连出两版均一次过审🟢,验证 D-3 内部还可按"情绪基调"分两个子变体:
| 子变体 | 段间转场 | BGM | 节奏 | 比例典型 | 适合 |
|--------|---------|-----|------|---------|------|
| **文艺溶解版**(D-3 默认)| 交叉溶解 | 舒缓治愈氛围 | 慢、绵长 | 横/竖均可 | 怀旧回忆 MV、情感向 |
| **轻快混剪版**(case-29 v2)| **干脆硬切+卡拍** | **活泼流行电子** | 快、跳跃 | 9:16 竖屏 | 抖音旅行混剪、青春活力向 |
**关键经验**:
1. **转场不是只能溶解**——主理人觉得"溶解太像电子相册"时,改"硬切卡着节拍直切,不要渐隐渐现不要交叉溶解",立刻变抖音混剪味。
2. **抽格优于塞满**——8 格塞进 15s 太挤;**抽 5 格 × 3s** 节奏更舒服。抽格原则:选画面差异大、情绪代表性强的(早餐笑/镜面/泳池脚/夜市/合照),舍掉重复机位。
3. **竖屏成片用 `multimodal2video --ratio=9:16`**——横向拼贴图也能锁竖屏输出(image2video 会跟随横图,不能锁比例)。
4. **活泼 BGM 安全写法**:写"活泼轻快有律动和运动感的流行电子背景音乐"安全;**切勿**写"爵士/钢琴/Lounge"(夜场 BGM 雷区)。
### 1.4.2 ⭐ 夜景/手机随拍类的"真实感"修订(2026-06-03 case-16 实测沉淀)
> case-16 夜街牵手三变体实跑反馈"灯太亮/太高清/动作不自然"——**D 类若走极简版省掉画质退化,夜景/手机题材一定出片像影棚**。三个必补模块:
```
① 夜景低照度光感(治"灯太亮"):人物只被环境余光从侧面/背后微弱照到,大部分在暗部,
明暗对比强、暗部不补光,严禁影棚均匀打亮、严禁人物比环境亮、严禁面部过曝。
② 手机夜拍画质退化(治"太高清"):弱光高ISO噪点+暗部色块+自动曝光白平衡漂移+握持走动抖动模糊+
对焦呼吸+广角畸变暗角。禁用4K高清/电影级稳定/影棚布光/调色精致/画面锐利。
③ 自然动作(治"不自然"):回头改"随意一瞥"不是"摆拍定格"、微笑改"松弛的笑"、
手与头发随走动自然发生,去掉夸张造型和过度对镜头表演。
```
---
## 2. 第 1 轮:分镜板分析(路径 D 的核心动作)
### 2.1 必须输出的字段
```markdown
## 分镜板分析
**分镜板类型**:[N 宫格 / 漫画分镜 / 横向时间线 / 自由排布]
**总格数**:X 格
**单格主体**:[每格是同一主角?同一场景不同瞬间?多场景蒙太奇?]
**叙事结构**:[线性时间 / 多视角同一时刻 / 主题变奏 / 无序蒙太奇]
**画质来源判定**(继承路径 C 第四原则):[摆拍 / 生活抓拍 / 手机日常 / ...]
**对应 4 层画质退化策略**:(详见 image-to-prompt.md 第四原则)
**比例诊断**:
- 单格比例:[每一格的实际比例]
- 推荐视频比例:[基于单格比例推荐 9:16 / 16:9 / 1:1]
**Hook 范式判断**(继承路径 C 双范式):[反应 / 凝视 / 混合 / 待定·询问用户]
**模式判断**:
- D-1 单条多段(≤4 格 + 总 ≤15s) → 推荐
- D-2 多条独立(≥5 格 或 总 >15s) → 推荐
**风险检查**:
- [ ] 真人脸(每一格都要看)
- [ ] 文字/UI/水印(分镜板本身可能带的格线/编号需要剪掉)
- [ ] 平台合规风险(每一格独立评估)
- [ ] **分镜板自身的格线/标号是否会被模型当作画面元素**(重要)
```
### 2.2 分镜板特有的"格线规避"声明(强制)
分镜板图中的**网格线、格子编号、格内空隙**容易被 Seedance 误读为"画面元素"。每条 prompt 中**必须显式声明**:
```
参考@图片1 第 K 格的画面内容,但**不复刻分镜板的网格边框/格子编号/分隔线**,
视频画面应是该格的全屏单镜头延展,无任何网格 UI 元素。
```
### 2.3 用户决策询问(强制)
```markdown
## 这个分镜板想怎么处理?
**模式 1**:D-1 单条 X 秒视频,把 X 格做成时间戳分镜
- 适合:格数少、叙事连贯、想一条出片
- 限制:总时长不能超过 15s
**模式 2**:D-2 N 条独立 prompt + 拼接清单
- 适合:格数多、想要剪辑出 30-60s 成片、各格独立性强
- 输出:每格一条 prompt + 剪辑公式建议(呼吸式 / 心跳式 / 海浪式 等)
**模式 3**:精选 K 格(你来定哪 K 格)做一条 D-1 视频,剩下的格忽略
- 适合:16 格里只有 4-5 格真的好
→ 回复 1 / 2 / 3,模式 3 请同时告知保留哪几格
```
---
## 3. 模式 D-1 的 Prompt 模板
```
[X秒][风格总纲,含画质来源关键词],
参考@图片1 的整体氛围+主体外貌服装,但**不复刻分镜板的网格边框/格子编号**,
视频自由演化为 X 段连贯瞬间:
0—K1 秒(对应@图片1 第 1 格):[第 1 格画面内容的镜头化描述 + 凝视/反应模式选择],
[运镜:选择 1 个];
K1—K2 秒(对应@图片1 第 2 格):[第 2 格画面 + 与第 1 格的视觉过渡方式],
[运镜:选择 1 个];
... 继续 ...
K(N-1)—X 秒(对应@图片1 第 N 格):[最后一格 + 收束方式]。
[画质 4 层退化模板,参考 image-to-prompt.md 第四原则]
[场景常识审计已通过的关键约束]
风格锁定:禁止任何文字、字幕、LOGO、水印,禁止网格边框,禁止分镜板 UI 元素。
```
**段间过渡选择**:
- **硬切**:节奏紧凑、场景跳跃明显时(推荐 vlog / 街球扣篮 / 蒙太奇)
- **匹配剪辑**:相邻格有视觉关联时(动作连续/物体形状相似)
- **交叉溶解**:相邻格情绪/氛围连续时(情侣旅行 / 治愈系)
---
## 4. 模式 D-2 的 Prompt 模板(每格独立)
每格按路径 C v3 完整流程出一条 prompt:
```markdown
## 第 K 格(@图片1 第 K 格)
**单格描述**:[一句话概括这格画面]
**Hook 范式**:[反应 / 凝视]
**单格时长**:[3-6s]
**单格 Prompt**:
\`\`\`
[X秒][风格总纲,含画质来源关键词],
参考@图片1 第 K 格的画面(但不复刻网格边框),视频为该格的全屏镜头延展:
0—X 秒:[完整的镜头化描述,含主角动作/群演/环境/运镜],
[凝视模式:3-4 个自然小动作 / 反应模式:子节拍展开],
[画质 4 层退化模板],
[镜头运动锁死声明 / 反应模式可切镜]。
风格锁定:禁止任何文字、字幕、LOGO、水印,禁止网格边框。
\`\`\`
```
**所有格子完成后必须输出 1 份"剪辑节奏建议"**:
```markdown
## 拼接剪辑建议
**总片长**:N 格 × 平均单格 4s = ~XX s
**推荐成片时长**:30s / 45s / 60s(建议比总片长短 30-50%,留剪辑余量)
**推荐剪辑公式**:[呼吸式 / 心跳式 / 海浪式 / 子弹时间 / 脉冲式 / 静默锤击]
**理由**:[为什么这个公式适合这个分镜板的内容]
**关键剪辑节点**:
- 开场前 2 秒(生死线):用第 [K] 格做开场,因为 [理由]
- 高潮点:第 [K] 格 ~ 第 [K+1] 格,[处理方式]
- 收束:第 [K] 格做结尾,留 [二刷钩子]
**段内修剪建议**(AI 素材专属):
- 每条素材首尾各修剪 0.5-1s(AI 运镜起止最不稳定)
- 色调统一:选第 [K] 格作基准片,其他 LUT 向它对齐
详见 editing-rhythm.md
```
---
## 5. 分镜板特有的方法论原则
### ① 格内独立性 vs 格间连贯性的权衡
- **格间连贯**(同一主角同一场景):单格 prompt 可以省略主角外貌细节,统一用 "@图片1 第 K 格的同一主角"
- **格间断裂**(多场景蒙太奇):每格 prompt 都要独立写明主角外貌+场景,避免模型从前一格继承错误信息
### ② 分镜板自带的 "排版陷阱"
分镜板图本身的:
- 网格线
- 格子编号(1-16)
- 分隔留白
- 整体边框
**模型可能把这些当画面元素**。每条 prompt 必须强制声明 "禁止网格边框、禁止分镜板 UI 元素"。
### ③ 模式选择的决策树
```
分镜板格数?
├─ ≤4 格 → 总时长能 ≤15s?
│ ├─ 是 → 模式 D-1(单条多段)
│ └─ 否 → 模式 D-2(多条拼接)
└─ ≥5 格 →
├─ 用户想出 30-60s 成片 → 模式 D-2
├─ 用户只想要 15s 内单条 → 询问"精选哪 4 格"用模式 D-1
└─ 用户没明确 → 推荐 D-2,给剪辑公式建议
```
### ④ 16 格分镜板的特殊处理
16 格 × 4s = 64s 素材,剪成 30-45s 成片是黄金区间。
- **建议剪辑公式**:海浪式(情感故事 / 旅行 vlog 类)或 呼吸式(综合内容)
- **必须做色调统一**:16 格用 16 条 prompt 跑出来后必然有色差,剪辑前需要统一 LUT
- **AI 素材陷阱**:16 段都跑一遍可能花大量积分,**建议先跑 4-5 个关键格验证风格一致性**,再批量跑剩下的
---
## 6. 与路径 C 的复用关系
路径 D **完全继承**路径 C v3 的:
- 双 Hook 范式(反应模式 / 凝视模式)
- 8 条方法论原则
- 4 层画质退化模板
- 9 个禁用清单
- 风险检查清单
- 比例处理 5 类策略
- 文字要求 4 级注入
路径 D **新增**:
- 分镜板分析输出(取代单图分析)
- D-1/D-2 模式选择
- 格线/编号/UI 规避声明
- 剪辑节奏建议(衔接 editing-rhythm.md)
---
## 7. 在 SKILL.md 中的集成
**已并入 SKILL.md Step 0 判断逻辑**:
```
路径 D — 分镜板驱动(Storyboard-Driven):
- 触发:用户上传 N 宫格分镜板 / 漫画分镜 / 多格拼贴图,要求 "根据分镜生成视频" / "按这几格拼接"
- 核心任务:拆解多格 → 选 D-1/D-2 模式 → 输出 prompt(单条多段或 N 条独立)+ 剪辑节奏建议
- 完整方法论见 references/storyboard-driven.md
```
---
## 8. 待实测验证的疑点
1. **格线规避**真的有效吗?模型会不会还是把网格当画面元素?
2. **D-1 单条多段**模式下,Seedance 能否准确按时间戳执行 4 段不同画面?
3. **D-2 多条独立**模式下,跑出来的素材色调一致性如何?需不需要额外约束?
4. **16 格全跑**性价比如何?是不是应该强制限制 ≤8 格?
5. **凝视/反应混合范式**(有些格是凝视,有些格是反应)的处理逻辑?
→ 其中疑点 1-3 已由 case-11 / case-13 部分验证(多宫格对每一帧的控制力强、格线规避有效、D-1 时间戳可按段执行),疑点 4-5 仍需更多样本。
---
**版本**:v0.1(已实战验证,持续打磨)
**首次定稿**:2026-05-13
**实测案例**:case-10 闺蜜夜游四宫格 / case-11 雨夜电影预告 / case-13 街球 16 格
**作者**:基于路径 C v3 方法论扩展 + 多宫格场景实测