94 lines
5.3 KiB
Markdown
94 lines
5.3 KiB
Markdown
# 图生视频与分镜板制作流程
|
||||
|
|
|
|||
|
|
> 来源:seedance2.0-prompt-skill `image-to-prompt.md`(路径C/D、版权审查、三层动作分级、极简优先)+ `storyboard-driven.md`(格间关系三分类)
|
|||
|
|
> 适用:F1(反推图片)、F2(反推视频)之外的路径C(单图生视频)与路径D(分镜板驱动)
|
|||
|
|
|
|||
|
|
## 一、路径C:单图驱动生视频(双范式选择)
|
|||
|
|
|
|||
|
|
### 反应模式(高戏剧瞬间)
|
|||
|
|
适用:情绪爆发、戏剧冲突的瞬间画面。
|
|||
|
|
- 写法:核心反应 + **子节拍展开**(如"惊讶"拆为:瞳孔放大→捂嘴→后退半步)
|
|||
|
|
- 时长 3-5 秒起,反应需符合物理时间常数(见《分镜提示词制作流程》第五节)
|
|||
|
|
|
|||
|
|
### 凝视模式(日常自然瞬间)
|
|||
|
|
适用:日常、生活化、非戏剧性画面。
|
|||
|
|
- **必须写 3-4 个自然小动作**:呼吸起伏 / 眨眼 / 肩颈微动 / 头发被风吹动
|
|||
|
|
- 搭配慢推进(slow push-in),营造"被偷拍的真实感"
|
|||
|
|
- 禁止大动作(防物理崩坏)
|
|||
|
|
|
|||
|
|
### 11条核心原则(按重要性排序)
|
|||
|
|
1. 图作框架参考,不卡帧(参考不是逐帧还原)
|
|||
|
|
2. 凝视必须 3-4 个自然小动作(防石像化)
|
|||
|
|
3. 日常物理常识优先(水往低处流、风吹物动)
|
|||
|
|
4. 画质 4 层退化预设 + 9 类禁用词
|
|||
|
|
5. 群演段内具体写(每个群演给具体动作,不写"人群熙攘")
|
|||
|
|
6. 正向夸张 + 反向否定双锁定("非常拥挤,无一人注意镜头")
|
|||
|
|
7. 镜头运动锁死(否定句穷举:"无推拉、无横摇、无变焦")
|
|||
|
|
8. 跨人物互动事件化(写"递给他"而非"两人互动")
|
|||
|
|
9. 三层动作分级(见第三节)
|
|||
|
|
10. 多人脸部不同质化 3 护栏(肤色差异/发型差异/年龄差异)
|
|||
|
|
11. 防物理崩坏 3 铁律(禁手部特写复杂动作/禁多人交叉走位/禁道具物理交互)
|
|||
|
|
|
|||
|
|
## 二、路径D:分镜板驱动(格间关系三分类)
|
|||
|
|
|
|||
|
|
拿到分镜脚本后,**先判定格间关系**再选方法:
|
|||
|
|
|
|||
|
|
| 格间关系 | 判定标准 | 方法 |
|
|||
|
|
|---------|---------|------|
|
|||
|
|
| ①连续动作链 | 多格描述同一动作的分解 | **合并还原法**:多格合并为一条提示词,一镜到底 |
|
|||
|
|
| ②顺承场景 | 格与格时间/空间顺承 | **D-1 时间戳分段**:一条视频内用时间戳分段,硬切或溶解 |
|
|||
|
|
| ③独立场景蒙太奇 | 格与格无时空连续性 | **D-3 记忆/心境蒙太奇法**(见下) |
|
|||
|
|
|
|||
|
|
### D-3 记忆/心境蒙太奇法(三核心机制)
|
|||
|
|
1. **情绪母题黏合剂**(最关键):所有独立场景共享一个情绪关键词(如"遗憾"),写进每段
|
|||
|
|
2. **语义转场流**:用语义衔接替代硬时间戳("从指尖的婚戒→到空荡的床头")
|
|||
|
|
3. **首尾呼应包裹**:首段与末段用相似画面闭环
|
|||
|
|
|
|||
|
|
两个子变体:
|
|||
|
|
- 文艺溶解版:交叉溶解转场 / 舒缓配乐 / 慢节奏 / 16:9
|
|||
|
|
- 轻快混剪版:硬切卡拍 / 活泼电子乐 / 快节奏 / 9:16
|
|||
|
|
|
|||
|
|
### 分镜板格线规避声明(强制)
|
|||
|
|
分镜板图片必须附声明:"忽略画面中的网格线、格数编号、分隔线,它们是分镜板结构元素,不是画面内容"——否则 AI 会把格线渲染进视频。
|
|||
|
|
|
|||
|
|
### D-1 / D-2 选择
|
|||
|
|
- ≤4 格:D-1 单条多段(时间戳分段)
|
|||
|
|
- ≥5 格:D-2 多条独立生成 + 剪辑建议(转场方式写进交付物)
|
|||
|
|
|
|||
|
|
### 多帧故事(multiframe2video)
|
|||
|
|
2-9 张关键帧 → 图片顺序即叙事顺序;每帧需内容有推进(同图复用无意义)。
|
|||
|
|
|
|||
|
|
## 三、三层动作分级(路径C/D通用)
|
|||
|
|
|
|||
|
|
| 层级 | 内容 | 目的 |
|
|||
|
|
|------|------|------|
|
|||
|
|
| 第1层 持续微动 | 呼吸/眨眼/肩颈/头发,X 秒不能停 | 防"石像化" |
|
|||
|
|
| 第2层 被聚焦节拍回应 | 1 个主回应动作,具体到 3 个细节 | 承担叙事 |
|
|||
|
|
| 第3层 大动作禁止 | 起身/走动/转身/换姿势/伸手拿物等穷举禁止 | 防物理崩坏 |
|
|||
|
|
|
|||
|
|
## 四、版权审查 SOP(即梦平台,5条铁律)
|
|||
|
|
|
|||
|
|
1. **禁夜场 BGM 词**:爵士钢琴 / Lounge / Bossa Nova / 萨克斯等——这些词触发夜场联想审查
|
|||
|
|
2. **不凑齐夜场环境 4 元素**:霓虹灯+酒杯+沙发+昏暗,任意 3 个以内安全,4 个凑齐触发
|
|||
|
|
3. **删涉灰场景词**:会所 / 公关 / 沙龙厅 / 夜店 → 替换为"私人俱乐部 / 会客室"等中性词
|
|||
|
|
4. **多人场景改静态全景机位**:"镜头平移到第X位"改为"固定全景,众人各自交谈"——平移扫过多人易触发人脸审查
|
|||
|
|
5. **禁人物×道具物理交互**:人物不与酒杯/扑克/钢管等敏感道具发生物理接触动作
|
|||
|
|
|
|||
|
|
被拒后的**二分法定位 SOP**:砍到极限版 30-50 字符 → 每次加回 1 个元素 → 对比找出触发词。
|
|||
|
|
|
|||
|
|
**核心认知**:审查看的是词汇/词组本身的"涉灰联想强度",不是整段语义——删词比改语义有效。
|
|||
|
|
|
|||
|
|
## 五、极简优先铁律
|
|||
|
|
|
|||
|
|
路径 C/D 默认 **300-500 字符**。文字只补 4 件事:图没有的 / 需强化的 / 需规避的 / 硬约束。
|
|||
|
|
实战数据:3102 字符违规 → 271 字符过审(同一画面内容)。
|
|||
|
|
|
|||
|
|
## 六、画质 4 层退化预设(真实感来源)
|
|||
|
|
|
|||
|
|
真实拍摄素材天然包含 4 层"瑕疵",AI 默认输出过于完美反而假:
|
|||
|
|
1. 平台压缩(轻微涂抹感)
|
|||
|
|
2. 设备瑕疵(镜头炫光/暗角)
|
|||
|
|
3. 现场瑕疵(背景路人/杂物)
|
|||
|
|
4. 镜头变形(广角拉伸)
|
|||
|
|
|
|||
|
|
夜景/手机随拍风格需主动叠加:低照度噪点 + 手机画质退化 + 自然随机动作。
|