- 路径重构:脚本创作 V1.0/Lite1.0 扁平化(去技能文件夹层),分镜技能迁移至 短视频提示词生成/V1.0,旧路径清理 - 输出边界铁律固化:创作流程规范.md 新增「交付物输出边界(通用铁律)」+ S9 输出模板新增「输出边界」块(验收口径=执行约束非输出内容) - 开场钩子铁律三层固化:00_开场/06_编导终审/S9 相关规则 + S5 预设钩子口径区分(前3秒=呈现窗口,3-7秒=开场段总时长) - 帮助文档:新增「从账号分析到脚本创作」跨技能章节(你这样问|我会做什么风格) - mcn-dou-analysis 内嵌副本:红线边界声明+人设卡术语更新(设定分析说明)
5.3 KiB
5.3 KiB
图生视频与分镜板制作流程
来源:seedance2.0-prompt-skill
image-to-prompt.md(路径C/D、版权审查、三层动作分级、极简优先)+storyboard-driven.md(格间关系三分类) 适用:F1(反推图片)、F2(反推视频)之外的路径C(单图生视频)与路径D(分镜板驱动)
一、路径C:单图驱动生视频(双范式选择)
反应模式(高戏剧瞬间)
适用:情绪爆发、戏剧冲突的瞬间画面。
- 写法:核心反应 + 子节拍展开(如"惊讶"拆为:瞳孔放大→捂嘴→后退半步)
- 时长 3-5 秒起,反应需符合物理时间常数(见《分镜提示词制作流程》第五节)
凝视模式(日常自然瞬间)
适用:日常、生活化、非戏剧性画面。
- 必须写 3-4 个自然小动作:呼吸起伏 / 眨眼 / 肩颈微动 / 头发被风吹动
- 搭配慢推进(slow push-in),营造"被偷拍的真实感"
- 禁止大动作(防物理崩坏)
11条核心原则(按重要性排序)
- 图作框架参考,不卡帧(参考不是逐帧还原)
- 凝视必须 3-4 个自然小动作(防石像化)
- 日常物理常识优先(水往低处流、风吹物动)
- 画质 4 层退化预设 + 9 类禁用词
- 群演段内具体写(每个群演给具体动作,不写"人群熙攘")
- 正向夸张 + 反向否定双锁定("非常拥挤,无一人注意镜头")
- 镜头运动锁死(否定句穷举:"无推拉、无横摇、无变焦")
- 跨人物互动事件化(写"递给他"而非"两人互动")
- 三层动作分级(见第三节)
- 多人脸部不同质化 3 护栏(肤色差异/发型差异/年龄差异)
- 防物理崩坏 3 铁律(禁手部特写复杂动作/禁多人交叉走位/禁道具物理交互)
二、路径D:分镜板驱动(格间关系三分类)
拿到分镜脚本后,先判定格间关系再选方法:
| 格间关系 | 判定标准 | 方法 |
|---|---|---|
| ①连续动作链 | 多格描述同一动作的分解 | 合并还原法:多格合并为一条提示词,一镜到底 |
| ②顺承场景 | 格与格时间/空间顺承 | D-1 时间戳分段:一条视频内用时间戳分段,硬切或溶解 |
| ③独立场景蒙太奇 | 格与格无时空连续性 | D-3 记忆/心境蒙太奇法(见下) |
D-3 记忆/心境蒙太奇法(三核心机制)
- 情绪母题黏合剂(最关键):所有独立场景共享一个情绪关键词(如"遗憾"),写进每段
- 语义转场流:用语义衔接替代硬时间戳("从指尖的婚戒→到空荡的床头")
- 首尾呼应包裹:首段与末段用相似画面闭环
两个子变体:
- 文艺溶解版:交叉溶解转场 / 舒缓配乐 / 慢节奏 / 16:9
- 轻快混剪版:硬切卡拍 / 活泼电子乐 / 快节奏 / 9:16
分镜板格线规避声明(强制)
分镜板图片必须附声明:"忽略画面中的网格线、格数编号、分隔线,它们是分镜板结构元素,不是画面内容"——否则 AI 会把格线渲染进视频。
D-1 / D-2 选择
- ≤4 格:D-1 单条多段(时间戳分段)
- ≥5 格:D-2 多条独立生成 + 剪辑建议(转场方式写进交付物)
多帧故事(multiframe2video)
2-9 张关键帧 → 图片顺序即叙事顺序;每帧需内容有推进(同图复用无意义)。
三、三层动作分级(路径C/D通用)
| 层级 | 内容 | 目的 |
|---|---|---|
| 第1层 持续微动 | 呼吸/眨眼/肩颈/头发,X 秒不能停 | 防"石像化" |
| 第2层 被聚焦节拍回应 | 1 个主回应动作,具体到 3 个细节 | 承担叙事 |
| 第3层 大动作禁止 | 起身/走动/转身/换姿势/伸手拿物等穷举禁止 | 防物理崩坏 |
四、版权审查 SOP(即梦平台,5条铁律)
- 禁夜场 BGM 词:爵士钢琴 / Lounge / Bossa Nova / 萨克斯等——这些词触发夜场联想审查
- 不凑齐夜场环境 4 元素:霓虹灯+酒杯+沙发+昏暗,任意 3 个以内安全,4 个凑齐触发
- 删涉灰场景词:会所 / 公关 / 沙龙厅 / 夜店 → 替换为"私人俱乐部 / 会客室"等中性词
- 多人场景改静态全景机位:"镜头平移到第X位"改为"固定全景,众人各自交谈"——平移扫过多人易触发人脸审查
- 禁人物×道具物理交互:人物不与酒杯/扑克/钢管等敏感道具发生物理接触动作
被拒后的二分法定位 SOP:砍到极限版 30-50 字符 → 每次加回 1 个元素 → 对比找出触发词。
核心认知:审查看的是词汇/词组本身的"涉灰联想强度",不是整段语义——删词比改语义有效。
五、极简优先铁律
路径 C/D 默认 300-500 字符。文字只补 4 件事:图没有的 / 需强化的 / 需规避的 / 硬约束。 实战数据:3102 字符违规 → 271 字符过审(同一画面内容)。
六、画质 4 层退化预设(真实感来源)
真实拍摄素材天然包含 4 层"瑕疵",AI 默认输出过于完美反而假:
- 平台压缩(轻微涂抹感)
- 设备瑕疵(镜头炫光/暗角)
- 现场瑕疵(背景路人/杂物)
- 镜头变形(广角拉伸)
夜景/手机随拍风格需主动叠加:低照度噪点 + 手机画质退化 + 自然随机动作。