Files
mcn-short-video/project/短视频提示词生成/V1.0/参考skills/seedance2.0-prompt-skill/references/image-to-prompt.md
T
maogeigei b3685504d7 技能三副本迭代:路径重构+输出边界铁律+开场口径区分+审计修复
- 路径重构:脚本创作 V1.0/Lite1.0 扁平化(去技能文件夹层),分镜技能迁移至 短视频提示词生成/V1.0,旧路径清理
- 输出边界铁律固化:创作流程规范.md 新增「交付物输出边界(通用铁律)」+ S9 输出模板新增「输出边界」块(验收口径=执行约束非输出内容)
- 开场钩子铁律三层固化:00_开场/06_编导终审/S9 相关规则 + S5 预设钩子口径区分(前3秒=呈现窗口,3-7秒=开场段总时长)
- 帮助文档:新增「从账号分析到脚本创作」跨技能章节(你这样问|我会做什么风格)
- mcn-dou-analysis 内嵌副本:红线边界声明+人设卡术语更新(设定分析说明)
2026-08-26 17:28:21 +08:00

85 KiB
Raw Blame History

图片驱动视频提示词生成(路径 C,v3)

用户丢一张图进来,希望生成适用于 Seedance 2.0、能在社交媒体引流的视频提示词。可附带文字要求做延展。

路径 C 的核心:不是"配一段提示词",而是判断这张图属于"反应"还是"凝视",然后用对应范式把它的潜力放大成视频。


🚨🚨🚨 即梦平台版权审查·必读 SOP 速查(2026-05-24 case-17 翻盘后定型)

本节是本仓库对即梦平台版权审查机制最完整准确的描述(11 版二分法实测得出)。 未来 Agent 写女性 / 室内 / 多人场景 prompt 前必读。完整推导见 experiments/summary.md 第 20 节。

⭐ 5 条铁律(女性/室内/多人场景必遵)

  1. 🔴 绝对禁用「夜场氛围 BGM 词」(v5 真因·case-17 测试 C 实测拦截): 爵士钢琴 / Jazz Piano / Lounge / Bossa Nova / Smooth Jazz / 萨克斯独奏 / 钢琴酒吧 / 夜店电子乐 / 爵士乐 → 能不写 BGM 就不写;必须写时用 "节拍感轻快的中文流行女声背景音乐" 或 "环境音"
  2. 🔴 不要凑齐「夜场环境 4 元素」:暖橘吊灯 / 大屏柔光 / 深色大理石 / 红木 / 包房灯光 / 吊灯酒杯果盘冰块前景 → 最多写 1-2 个 + 改"室内场景"
  3. 🔴 第 3 类涉灰场景词:会所 / 公关 / 包间 / 介绍美女 / 沙龙厅 / 偷拍 / 美女群像 / KTV / 商 K → 删,改"室内场景"+"主理人/合作伙伴"等中性商务词
  4. 🟡 多人场景禁用"镜头平移到第 X 位"(防 v8 翻车 6 张脸同质化) → 改 "镜头单一固定全景静态机位" + 台词/位置词指代当前介绍谁
  5. 🟡 禁止人物 × 道具的物理交互(防 v3 翻车酒杯飞) → 不举杯 / 不拿物 / 不敲扶手;前景道具显式 "保持参考图位置不动"

⭐ 三层动作分级(v5 翻盘核心方法论·防石像 + 防物理崩)

第 1 层 · 持续微动(防石像,全程不停)
  ✅ 写:呼吸自然起伏 / 肩颈极轻微浮动 / 偶尔眨眼 / 头发飘动 / 视线极小幅度流转 / 身体重心极轻微偏移
  ✅ 显式声明 "X 秒里每位都不能停"

第 2 层 · 被聚焦/节拍回应(叙事,时间段具体写)
  ✅ 写:嘴角轻扬 + 轻微点头一次 + 视线短暂锁定镜头方向 0.5 秒
  ✅ 不能写模糊的"自然回应",要写到 3 个细节

第 3 层 · 大动作(禁止·穷举)
  ❌ 起身 / 走动 / 转身 / 换姿势 / 伸手拿物 / 举杯
  ✅ 显式禁止穷举(不能只写"不要大动作")

⭐ 动漫角色卡 → 出二次元 的根治 SOP(2026-05-30 case-25/26/28 实测新增)

现象:喂动漫风角色卡做图生视频,文字写一堆 "NOT anime" 仍出二次元(case-25 特工直接二次元、case-26 主播明显动漫感)。

🔴 根因:图生视频时「参考图的画风权重」远高于文字否定词。
        你喂一张动漫角色卡,画风就被带进来了,文字压不过图。

✅ 解法 1(最有效·首选):追求真人效果时,直接用「真人参考图」,不要用动漫角色卡。
   - 角色卡只适合"我就要这个动漫角色形象"的场景。
   - 真人参考图(如真实抖音网红截图/拼图)从源头杜绝二次元。

✅ 解法 2(仍要用角色卡时):上「超强真人化前缀」(约 480 字符),放在 prompt 最前:
   The subject must be a REAL photorealistic human woman with natural skin
   texture, visible pores and realistic hair — documentary realism, like real
   footage indistinguishable from a real video. Use the character card ONLY for
   outfit, hairstyle and proportions and COMPLETELY re-render in real-life
   photographic style, IGNORE its art style. Absolutely NOT anime, NOT cartoon,
   NOT 2D, NOT 2.5D, NOT cel-shaded, NOT manga, NOT illustration, NOT 3D CG,
   NOT a game character.

   关键三招(缺一不可):
   ① documentary realism + "像真实抖音视频、与真实录像无异"(正向锚定真实)
   ② "参考图只取 outfit/proportions,画风完全重渲染,IGNORE its art style"(切断画风迁移)
   ③ 否定词穷举到 2D/2.5D/cel-shaded/manga/game character(不止 anime)
   ④ 加皮肤细节:natural skin texture / visible pores / realistic hair / phone-camera grain

⭐ 台词按场景取舍(2026-05-30 新增)

不是每条视频都要台词。按场景判断:
  ✅ 需要台词:直播开场 / 应援助威 / 剧情金句(口播本身是看点)
  ✅ 不需台词:镜面自拍 fit-check / 泳池打卡 / 纯氛围展示
     → 改用 "punchy electronic dance beat + No dialogue",靠画面+音乐节奏吸引
目标永远是:自然、流畅、真实,贴合日常刷到的抖音网红视频质感。

⭐ "小心思"曲线展示 的安全措辞(2026-05-30 case-28 新增)

要体现身材曲线(胸/腰/臀线条)又不被审查:
  ✅ 用:figure / waistline / waist-to-hip curve / back and hip curve / athletic fit / silhouette
  ❌ 避:breast / butt / cleavage 等直白身体部位词
  ✅ 关键帧设计:正面手撩锁骨 → 三七侧身叉腰显腰线 → 推近显躯干 → 侧身显腰臀 → 背身回眸显背臀线
  ✅ 护栏必带:tasteful body-confidence / NOT an intimate-area closeup / no sexualized closeups

⭐ 推翻的 6 个流行假设(不要再走弯路)

❌ 假设 1:「会所/公关」等涉灰词换成"沙龙厅/主理人"就过 —— 错(仍含"沙龙厅"也拦)
❌ 假设 2:「展示女性叙事意图」必拦(岳哥 GPT Image 2 公式)—— 对即梦视频效果有限
❌ 假设 3:「横扫多女性 + 主角收束」运镜必拦 —— 错(极限版完全无运镜也过)
❌ 假设 4:图本身被识别高风险 —— 错(同图极简版 31 字符过审)
❌ 假设 5:单加"沙龙厅"就拦 —— 错(测试 A 单加过审)
❌ 假设 6:岳哥安全尾缀对即梦有效 —— 对即梦视频效果有限(测试 B 加了也过)

✅ 真因:词汇/词组本身在 AI 训练语料中的「涉灰联想强度」
✅ 解药:删可疑词(特别是夜场 BGM)+ prompt 极简化(短 ≈ 稳)

⭐ 遇到反复拦截 → 二分法定位 SOP

第 1 步:把 prompt 砍到极限版(30-50 字符,只写主体+动作+比例),验证图本身能不能过
第 2 步:每次只加 1 个嫌疑元素,单独验证
第 3 步:被加入后即拦的就是真凶;过审的可放心使用
第 4 步:对比"过审版" vs "拦截版"的唯一差异 = 真凶

⭐ 写 prompt 7 项 SOP checklist

✅ 写之前自检(防雷):
1. ⭐⭐ BGM 词检查:有没有"爵士/钢琴/Lounge/Bossa Nova/萨克斯/夜店电子乐"?有 → 删
2. ⭐ 夜场环境组合:有没有同时出现 4+ 元素?有 → 拆只留 1-2 个
3. 第 3 类涉灰场景词检查:有没有"会所/公关/包间/介绍美女/沙龙厅/偷拍"?有 → 删
4. 第 1/2 类品牌借喻检查:跑五关扫描脚本

✅ 写之后自检(防僵硬+防同质化):
5. 多人场景:有没有"镜头平移到第 X 位"?有 → 改"单一静态全景机位"
6. 防僵硬:有没有写"持续微动"基础层(呼吸/眨眼/肩颈/头发飘动)?没有 → 加上
7. 防物理崩坏:前景道具有没有显式"保持参考图位置不动+禁止漂浮被举起"?没有 → 加上

📚 完整 SOP 推导(建议先读速查再深读)

  • 完整翻车历程 + 真因定位过程:experiments/summary.md 第 20 节
  • 完整四层敏感词清单:本文档 下方"版权/商标/地缘敏感词规避清单"小节(含五关扫描脚本)
  • 案例参考(11 版翻盘):experiments/cases/case-17-公关经理介绍排成一排.md

v3 相对 v2 的关键升级(基于 5 个 case × 5 轮迭代实测沉淀):

  1. 新增"凝视模式"作为路径 C 第二范式,与原有"反应模式"并列
  2. 图作"框架参考",不再强制卡某一帧(推翻 v2 的"首/中/尾/反/闪"时序锚点机制)
  3. 画质升级为 4 层退化模板 + 9 个禁用清单 + 正向强约束
  4. 凝视模式必须 3-4 个自然小动作 + 主角行为正向夸张+反向否定双重锁定
  5. 多人场景必须有跨人物互动事件作为叙事骨架
  6. 新增日常物理常识审计

适用判断

满足任一条即走路径 C:

  • 用户上传/粘贴/拖入一张图片(主要触发条件)
  • 用户说"这张图怎么做成视频"、"图生视频提示词"、"用这张图打满15秒"、"根据图片生成视频"等
  • 用户在路径 A 进行中突然丢图,则切换到路径 C

与路径 A/B/D 的关系:

  • 路径 A(≤15s 概念驱动):起点是"用户脑里的概念",做的是收敛创意
  • 路径 B(>15s 长视频):起点是"完整项目企划",做的是流水线生产
  • 路径 C(图片驱动):起点是"一张已存在的图",做的是用反应/凝视范式放大它
  • 路径 D(分镜板驱动,v0.1 试运行):起点是 "N 宫格分镜板",做的是多格拆解+串联(详见 references/storyboard-driven.md)

核心方法论(v3 双范式架构)

第一原则:图片比例 = 视频比例(最优解)

否则裁切、变形或黑边几乎不可避免。详见后文"比例处理 5 类策略"。

第二原则:一张图必有一个"最有戏的元素"

爆款的本质不是把图均匀地动起来,而是抓住一个点极致放大。 读图时强迫自己回答:"如果只能让画面里一个东西动,应该是哪个?"

第三原则:图作"框架参考",不作时间锚点(v3 推翻 v2)

v2 的错误:把图作"首/中/尾/反/闪"某一帧锚点 → 模型把图卡为某一帧,反而绑架了叙事自由度

v3 的修正:图只提供"主体外貌+服装+场景氛围+大致姿态",不强制卡任何一帧

Prompt 写法默认句式:

参考@图片1 的[主体外貌服装]+[场景氛围]但不强制卡任何一帧,
视频自由演化为日常 [场景类型] 自然瞬间。

例外:图本身就是高戏剧性瞬间(爆发的一瞬、反转揭示画面),可保留 v2 的"中间关键帧"机制(详见反应模式 Step 4 模板 B)。这是少数情况。

第四原则:双 Hook 范式(v3 新增·最重要)

路径 C 必须先判断属于哪种范式,再决定后续所有写法。

4.1 反应模式(v2 已有,保留)

适用场景:

  • 图本身是"高燃情绪定格"瞬间
  • 用户希望主角有明确情绪变化(害羞、惊讶、被击中、笑得失控等)
  • 视频核心 Hook 是某个戏剧化的情绪瞬间

特征:

  • 主体有情绪变化
  • 按子节拍展开 ≥X 秒(物理时间常数适用)
  • 时序角色:通常作中间帧/尾帧/反转帧
  • 画质策略:写实质感
  • 美感来源:情绪反应的真实性

4.2 凝视模式(v3 新增)

适用场景:

  • 图本身是"日常瞬间"(看球、跟唱、讲课、地铁日常等)
  • 用户说"自然神态、不需要发现镜头/慢慢放大/不要切镜/就拍那个 X"
  • 视频核心是"被偷拍的日常感"而非戏剧化情绪

特征:

  • 主体无情绪变化但自然有动(捋头发、跟唱、看到精彩动作前倾等)
  • 整段时间被时间本身展开(无戏剧反应曲线)
  • 单一缓慢推进,不切不拉远
  • 物理时间常数不适用(无情绪反应需要展开)
  • 图作首帧或不卡帧
  • 画质策略:偏向偷拍/业余/脏镜头质感
  • 美感来源:时间凝固的诗意 + 不知情的真实感

4.3 第 1 轮分析阶段必须显式询问用户

## 这张图你想要哪种模式?

- `反应` = 主体有情绪反应(害羞/惊讶/被击中/笑),按子节拍展开
  适合:高戏剧性瞬间、明显情绪转折、想做"某一刻的爆发"
- `凝视` = 主体自然存在被偷拍,单一缓慢推进,无情绪变化
  适合:日常瞬间、想做"她/他在做某事的真实记录"
- 不指定 → 我根据图本身判断(默认按图判断戏剧性,平淡日常用凝视,高燃定格用反应)

→ 回复一个字 / 词 即可

第五原则:画质即风格——4 层退化模板(v3 升级 v2 单层声明)

核心规则:先判断图的来源类型,再选 4 层叠加 + 9 个禁用 + 正向强约束三件套。默认不要用"电影级稳定"打天下。

5.1 画质来源 → 关键词速查

图来源线索 来源判定 视频画质策略关键词
构图正、光影讲究、后期明显、肤色统一 摆拍 / 棚拍 电影级稳定、浅景深、调色精致、4K 锐利
构图随意、光线自然、轻微透视歪斜 生活抓拍 轻微手抖、自动对焦呼吸、自然曝光起伏、不刻意构图
低分辨率、噪点明显、色温偏冷或偏黄、白平衡漂移 手机日常随手拍 数码噪点保留、移动端压缩感、AE/AWB 抖动、握持不稳
低帧率感、广角畸变、画面有时间戳/GPS 水印 监控 / 行车记录仪 / DV 低帧率(15-24fps 感)、数码噪点、时间戳、画质压缩感
颗粒感、暗角、褪色、橙青色偏 胶片 / 老照片 / 复古 35mm 胶片颗粒、轻微跳帧、画幅切换、年代感色调
二次元厚涂 / CG 光影 / 非真人 动漫 / CG / 立绘 保持 CG 质感,允许夸张运镜与超现实物理
偷拍感、有遮挡物、构图极不正 抓拍 / 偷拍 第一人称视角、物体遮挡前景、二次对焦、镜头突然甩动
直播流截图、低码率、信号瞬抖 直播流偷拍 平台压缩+设备瑕疵+信号瞬抖+录屏特征

5.2 凝视模式必用:"4 层画质退化"模板

通用句式:

画质:[场景对应的录像类型]的双重画质退化:
①[平台压缩 artifacts]——[平台名] 低码率压缩感、画面细节磨平、暗部色块、彩色色噪、压缩边缘抖动;
②[设备瑕疵]——[设备] 在 [环境] 下的 ISO 噪点/曝光起伏/白平衡漂移;
③[现场瑕疵]——[场景特定瑕疵 如 信号瞬抖/雨水痕迹/手肘擦镜];
④[镜头变形]——广角畸变/色散/脏点污染。
禁用4K高清禁用Cinematic禁用电影级禁用稳定器质感禁用调色精致禁用工业渲染禁用画面锐利禁用清晰画质。

风格锁定结尾必加正向强约束:

画质必须呈现明显的 [X 感] 不可呈现 4K 锐利画质不可呈现电影级稳定画质

5.3 4 个场景的"4 层退化"实例库(已通过验证)

场景类型 第 1 层(平台压缩) 第 2 层(设备瑕疵) 第 3 层(现场瑕疵) 第 4 层(镜头变形)
手机看直播流 H.264 低码率块状压缩感 手机录屏屏幕摩尔纹+反光+色温偏移 直播信号瞬抖让画质瞬降 0.3 秒 自动曝光/白平衡漂移+握持抖+脏点
粉丝手机录夜场 抖音/小红书低码率压缩+暗部色块 夜场极弱光下感光元件高 ISO 粗粒 镜头前雨水痕迹+握持随兴奋节拍抖 手机广角畸变+画面边缘色散
学生手机偷拍课堂 B 站/视频号低码率压缩 教室白光下中等 ISO 粗粒+白平衡略偏冷 前景虚焦学生剪影+构图非完美略歪 后摄轻微广角畸变+粉笔灰丁达尔
室内闪光自拍朋友圈 微信短视频低码率压缩 闪光灯硬光过曝+室内中等 ISO 粗粒 镜子反射次级光源+手肘擦镜瞬抖 广角自拍轻微鱼眼畸变

5.4 反向清单(生活/凝视类禁止出现的词)

  • ❌ 电影级、Cinematic、4K 超高清、IMAX
  • ❌ 工业光魔级 VFX、Octane 渲染、UnrealEngine5
  • ❌ 稳定器质感、超平稳运镜、构图完美
  • ✅ 应该写:[对应来源]质感、轻微手抖、自然曝光、未做后期、像 vlog 抓拍

第六原则:现实物理时间常数——仅反应模式适用(v3 限定)

v2 默认所有现实类视频都遵守 → v3 修正为仅反应模式适用。凝视模式没有戏剧反应需要展开,不适用此原则。

反应 最少占用时长 子节拍拆解
害羞脸红 2.5s 眼神飘 0.8s → 低头 / 抿唇 0.5s → 耳根/颧骨缓慢泛红 1.2s
流泪 / 哭 3s 眼眶湿润反光 1s → 眼神颤抖 / 呼吸急 1s → 一滴落下 1s
惊吓 / 一惊 1.2s 瞳孔骤缩 0.2s → 身体微绷 0.3s → 表情变化 0.7s
思考迟疑 2s 停顿 0.5s → 眼神游移 1s → 落定(决定/放弃)0.5s
笑(自然忍不住) 2.5s 眼角先松 0.8s → 嘴角扬起 0.7s → 露齿 / 出声 1s
愤怒 / 怒 2s 屏息 0.4s → 下颌咬紧 / 鼻翼张开 0.6s → 眉头压、眼神冷 1s
悲伤 / 失神 3s+ 眼神涣散 1s → 焦点失去 1s → 嘴唇微动 / 长呼吸 1s+
羞愤 / 委屈 3s 眼眶微红 1s → 嘴抿紧 1s → 眼泪打转或别开脸 1s
欲言又止 2s 张口 0.3s → 停顿 / 喉结动 0.7s → 闭口低头 1s

输出落地:反应模式视频提示词中包含上述反应时,必须写出子节拍,不能写"她害羞地脸红了"一句话。动漫/科幻/CG 不受此限。

第七原则:时长服从内容——AI 推算 + 人工确认

图的内容特性 推荐时长 典型例子
一瞬间的反应 / 神态 3-5s 害羞、惊讶、回眸、一个眼神
单一动作的完成 5-7s 喝水、转身、点烟、拨发、撑伞
一个情绪弧线 7-10s 迟疑→决定、平静→爆发、克制→释放
凝视模式日常瞬间 6-10s 看球、跟唱、讲课、地铁日常
小剧情(两个动作 + 一个反应) 10-12s 进门→看到某物→反应;接电话→脸色变
完整场景叙事(多动作 + 环境展开) 12-15s 角色在战场行进、产品 360 展示 + 环境爆发

15s 是上限不是目标。Seedance 2.0 family 支持 4-15 秒任意时长。


路径 C v3+v5 共 11 条核心方法论原则(按重要性排序)

前 8 条是 v3 沉淀的实战原则(详见 experiments/summary.md 第 4 节)。 第 9-11 条是 v5 新增(case-17 11 版翻盘后定型,详见 summary.md 第 20 节):

  • ⑨ 三层动作分级(防石像 + 防物理崩坏)
  • ⑩ 多人场景脸部不同质化 3 条护栏(防同质化)
  • ⑪ 防物理崩坏 3 条铁律(防酒杯飞)

① 图作"框架参考",不作时间锚点

参考@图片1的[主体外貌服装]+[场景氛围]但不强制卡任何一帧,
视频自由演化为日常 [场景类型] 自然瞬间。

② 凝视模式必须 3-4 个自然小动作

v3 早期错误:把"凝视模式"理解为"主角不可大幅度移动" → 主角呆滞 v3 v5 修正:凝视模式下主角必须做这个场景里的人会自然做的事

主角必须做 [场景] 中自然会做的事(X秒内必须明显发生 3-4 个动作):
- 动作1(具体动作 + 主动方/被动方)
- 动作2(具体动作 + 反应)
- 动作3(具体)
- 动作4(具体)
不可表情呆滞不可一动不动不可只是 [被动姿态] 不可平静

③ 符合日常物理常识(v3 新增)

v2 错误案例:

  • 演唱会主角站最前排但前景出现其他观众挡视线(不可能)
  • 老师"边面向学生边在黑板上写字"(手与黑板物理矛盾)
  • 老师"突然转头看学生但什么也没讲"(不符合讲课常识)
环境:[场景描述],[关键常识约束](**禁止 [反常识动作]**)

常识审计 Checklist(写 prompt 前必过一遍):

  • 主角的物理位置在该场景下合理吗?(前排不会有人挡)
  • 主角的动作是否物理可行?(不能边面向 A 边对 B 操作)
  • 场景里其他人会做什么?(不能全部静止)
  • 时序逻辑是否符合常识?(讲课要嘴动+看球要有比赛)

④ 画质"4 层退化" + 9 个禁用 + 正向强约束(详见第五原则 5.2-5.4)

⑤ 群演必须"段内具体写动作"

v2/v3 错误:风格锁定写"群演不可静止" → 模型忽略 v3 v4 修正:每个位置(左侧/右后方/前景/远处)写具体动作

环境同步演化:身边 [群演类型] 必须有可见微动具体写——
左侧 [位置] [群演角色] [具体动作]、
右后方 [群演角色] [具体动作]、
前景 [群演角色] [具体动作]、
远处 [群演角色] [具体动作]。

⑥ 主角行为"正向夸张 + 反向否定"双重锁定

v3 v4 错误:写"嘴唇随歌词轻动小声跟唱+小幅度晃动" → 模型理解为"几乎不动" v3 v5 修正:每个行为都写正向夸张+反向否定

弱版本(v3 早期) 强版本(v5 定型)
"嘴唇随歌词轻动小声跟唱" "嘴明显张开跟唱嘴动幅度大能看出是在唱(不是抿唇小声哼是真的在唱出声)"
"随节拍小幅度晃动" "头部和身体随 BGM 节拍明显律动+随节拍点头"
"主角全程保持自然看比赛状态" "主角必须有 3-4 个自然小动作分布;不可表情呆滞不可一动不动不可只是站着"
给主角隐含定位 "她是这条视频的核心主角是全场所有粉丝里最投入的那个"

⑦ 镜头运动锁死声明(凝视模式专用)

镜头单一 Very Slow Push In 极缓慢推进(X秒内仅放大约15%),
全程单一机位无任何切换无任何拉远不可上升下降不可切角度。

关键:用否定句穷举(不可切换/不可拉远/不可上升/不可下降/不可切角度)锁死,否则模型会自由发挥。

⑧ 跨人物互动事件(多人场景必加)

v3 v4 错误:多人场景中每个人各做各的事 = 6 个孤立角色拼贴 v3 v5 修正:必须有至少一个跨人物的互动事件作为视频的"叙事骨架"

跨人物互动事件(视频核心,必须发生):[发起者] [发起动作] 作为视频起点的招呼信号,
[其他人] [响应动作] 但不需要 [完成度过高的动作],过程中有自然 [互动类型] 动作发生:
- 角色1:[具体动作 + 对其他人的反应]
- 角色2:[具体动作 + 对其他人的反应]
- ...

⑨ 三层动作分级(v5 新增·case-17 11 版翻盘后定型·多人场景必用)

v8/v9 翻车症状:

  • v8 用"镜头平移到第 X 位" → AI 把每次抵达理解为"特写"→ 6 张脸都长一样
  • v9 用"保持参考图站姿不动""不要做大动作" → AI 让人物全程石像化

v10 修复 = 三层动作分级:

层级 范围 写法 防什么
第 1 层 · 持续微动 呼吸自然起伏胸口轻微抬落 / 肩颈极轻微浮动 / 偶尔眨眼 / 头发被空气自然轻微飘动 / 视线在画面前方做极小幅度流转 / 身体重心极轻微左右偏移 "全程持续微动 X 秒每位都不能停" 防石像化(v9 翻车症状)
第 2 层 · 被聚焦/节拍回应 嘴角轻扬 / 轻微点头一次 / 视线短暂锁定镜头方向约 0.5 秒 / 跟节拍极小幅度律动 时间段具体写"X-Y 秒:[人物 Z] 做[具体回应]" 保持画面节奏(叙事要求)
第 3 层 · 大动作(禁止) 起身 / 走动 / 转身 / 换姿势 / 伸手拿物 / 举杯 / 拿出物品 "禁止任何起身/走动/转身/换姿势/伸手拿物等大动作" 防物理崩坏(v3 酒杯飞、v4 物体错乱)

Prompt 写法模板:

[X 位人物]全程持续微动(消除石像感的基础动态层):所有人呼吸自然起伏胸口轻微抬落、
肩颈极轻微浮动、偶尔眨眼、头发被空气自然轻微飘动、视线在画面前方做极小幅度流转、
身体重心极轻微左右偏移,**这层动态 X 秒里每位都不能停**——保持参考图站位姿态的同时
呈现"活人自然存在"的微妙感。

[节拍/被聚焦时的差异化回应](在基础微动之上叠加):
- [人物 1]:[具体回应 + 时间段]
- [人物 2]:[具体回应 + 时间段]
...

禁止任何起身/走动/转身/换姿势/伸手拿物等大动作。

关键写作技巧:

  • 第 1 层用「持续微动」「X 秒不能停」正向声明抵消"保持参考图站姿"的石像副作用
  • 第 2 层回应描述要具体到 3 个细节(嘴角+点头+视线时长),不能写模糊"自然回应"
  • 第 3 层禁止动作要穷举(起身/走动/转身/换姿势/伸手),不能只写"不要大动作"

⑩ 多人场景脸部不同质化 3 条护栏(v5 新增·case-17 v8 翻车后定型)

v8 翻车症状:用"镜头平移到第 X 位"导致 6 张脸都长一样——AI 的"特写"会重新生成脸,不会跟参考图对齐。

3 条护栏(多人场景必用):

✅ 护栏 1:镜头零移动 + 全员永远在画面里
   ❌ "镜头平移到第 X 位"(→ AI 把每次抵达理解为脸特写)
   ✅ "镜头单一固定全景静态机位 X 秒不动" + "全员全部入画"
   ✅ 靠台词指代("画面左 X 这位是...")+ 该位轻微回应

✅ 护栏 2:禁止面部特写
   ✅ 末尾必加:"关键约束:脸部容貌严格遵循参考图,不要做面部特写不要替换面孔"

✅ 护栏 3:被聚焦时的动作幅度极小
   ✅ "嘴角轻扬+轻微点头+视线锁定 0.5 秒" 这种**只动微表情**的描写
   ❌ "撩头发+举杯+转头看朋友"(→ 大动作触发 AI 重新生成姿态,姿态变了脸也跟着变)

⑪ 防物理崩坏 3 条铁律(v5 新增·case-18 v3 酒杯飞翻车后定型)

v3 翻车症状:用"举杯 cheers"导致酒杯飞——多人 + 物理交互是 AI 视频生成的崩坏重灾区。

3 条铁律(前景有道具的场景必用):

✅ 铁律 1:前景道具显式锁定
   ✅ "前景酒杯/果盘/冰块保持参考图位置不动"
   ✅ "禁止酒杯漂浮/移动/被举起"

✅ 铁律 2:禁止人物与道具的物理交互
   ❌ "举杯 cheers / 拿起手机 / 抓起头发别上发卡"
   ✅ 改成纯肢体动作(律动/微笑/点头)

✅ 铁律 3:动作越多,物理越容易崩
   ✅ 5 个人 5 个动作 → 改成 5 个人共享同一个动作或微动
   ✅ 整体律动统一 + 仅主角靠视线/表情差异化(不靠肢体)

Step 1:读图分析(v3 升级输出字段)

按这个结构给用户:

## 图片分析

**主体**:[一句话,谁/什么是画面焦点]
**当前画面氛围**:[风格 + 色调 + 情绪],例如"赛博朋克写实,冷蓝霓虹,孤独"
**最有戏的元素**:[这张图里最适合"动起来"的那个点 + 为什么]

**画质来源判定**:[摆拍 / 生活抓拍 / 手机日常 / 监控DV / 胶片复古 / 动漫CG / 抓拍偷拍 / 直播流] —— [一句话依据]
**对应 4 层画质退化策略**:
- ①平台压缩:[关键词]
- ②设备瑕疵:[关键词]
- ③现场瑕疵:[关键词]
- ④镜头变形:[关键词]

**比例诊断**:[图片实际比例] → [推荐视频比例](必要时附说明或扩图建议)

**建议时长**:[X 秒]
**推算理由**:[这张图适合表达哪种内容粒度,为什么不打满 15s 或为什么需要打满]

**Hook 范式判断(v3 核心)**:[反应 / 凝视 / 待定·询问用户]
**理由**:[一句话]

**日常常识审计(v3 新增)**:
- [ ] 主角物理位置合理性:[OK / 问题:XXX]
- [ ] 主角动作物理可行性:[OK / 问题:XXX]
- [ ] 场景中其他人合理性:[OK / 问题:XXX]
- [ ] 时序逻辑常识性:[OK / 问题:XXX]

**风险检查**:
- [ ] 真人脸:[无 / 有,需要规避方案]
- [ ] 文字/LOGO:[无 / 有,需要锁定声明]
- [ ] 清晰度/构图:[OK / 不够,建议先重生]
- [ ] **平台合规风险**:[低 / 中度(说明) / 高(拒跑)]

1.2 读图必查的 7 个维度

维度 看什么
主体 人 / 物 / 场景 / 抽象元素,谁是焦点
构图 主体在画面什么位置(中心/偏左右/上下/分散)
风格 写实 / 半写实 / 国漫 / 水墨 / 油画 / 卡通 / 像素...
色调 冷暖、明度、饱和度、主色
质感/材质 主体的材质特征(金属/液体/织物/植物/皮肤...)
氛围线索 光影、天气、时间、空间空旷度
隐藏戏点 画面里那个"如果它动起来会很炸"的元素

1.3 风险检查(强制项)

风险 处理建议
写实真人脸部 平台会拦截。建议:①卡通化/半写实化处理 ②图作为参考但不直接 @引用,改用文字描述 ③用 NanoBanana 重生一版去真人化
文字 / LOGO / 水印 建议裁掉或用 NanoBanana 修掉,否则会被带进视频
清晰度不足 / 构图差 建议先用 NanoBanana 重生一版首帧图,提示词参考 image-generation.md

1.4 Hook 范式询问(v3 强制·替代 v2 的时序角色询问)

读图分析输出后必须显式询问用户 Hook 范式:

## 这张图你想要哪种模式?

- `反应` = 主体有情绪反应(害羞/惊讶/被击中/笑),按子节拍展开
  适合:高戏剧性瞬间、明显情绪转折、想做"某一刻的爆发"
- `凝视` = 主体自然存在被偷拍,单一缓慢推进,无情绪变化
  适合:日常瞬间、想做"她/他在做某事的真实记录"
- 不指定 → 我根据图本身判断(默认按图判断戏剧性,平淡日常用凝视,高燃定格用反应)

→ 回复一个字 / 词 即可

用户选定 Hook 范式后:

  • 选 反应:进入反应模式 Step 4 模板(A/B/C/D/E),可保留 v2 的"图作时序锚点"机制
  • 选 凝视:进入凝视模式 Step 4 模板(详见下文),图作"框架参考不卡帧"

1.5 平台合规风险

Seedance 平台有 pre-TNS(提交时审)+ post-TNS(生成后审) 双重审查机制。post-TNS 失败会扣完积分但平台会退还——但仍然耗时 5-7 分钟空跑一次。第 1 轮必须做合规预判:

风险等级 触发条件 处理
高(拒跑) 写实/动漫的暴露画面(侧胸 underboob / 高开衩露臀 / 无遮挡半裸 / 透视服装) 直接告诉用户不能跑,建议换图
中度(警告) 紧身贴体服装的特定角度、抽烟 / 酒精消费画面、轻度暴力(持械但无血腥) 告知有 30-50% 概率被 post-TNS 拦截,让用户决定
低(继续) 服装完整、无政治符号、无血腥、无品牌 LOGO 抢镜 正常进入 Step 2

重点:动漫风格不豁免合规。post-TNS 对动漫画面里的暴露同样敏感,视频化后逐帧审查会比静图严。


Step 2:比例处理 5 类策略

核心原则:让图片比例 = 视频比例,避免任何裁切。

图片比例 处理策略 默认动作
9:16 竖 直接 9:16 视频,最优解(社交媒体原生) 不询问,直接用
16:9 横 询问用户:①保留 16:9(视频号/B站友好,但抖音/小红书会被压缩)②改 9:16(社交平台原生,但图会被裁掉左右约 60%,需主体在中央)③扩图到 9:16(推荐,见 Step 5) 询问 + 推荐扩图
1:1 方 默认 1:1(适合小红书/Instagram);如用户想做抖音原生竖屏,推荐扩图到 9:16 用 1:1 或建议扩图
接近标准的非常规(3:4、4:5、2:3) 明确告知会被归到 9:16 并裁切。建议:①先扩图到 9:16(推荐)②接受裁切(说明哪部分会被裁) 推荐扩图
极端比例(2.35:1、超长条、超宽幅) 不建议直接当首帧。备选:①作为"画中画"嵌入到 9:16/16:9 的新构图里 ②先扩图到标准比例 ③仅作为风格参考,不直接 @引用 强制不直接用 + 给备选

用户用文字明确指定比例时("我要竖屏"),文字优先级 > 图片比例。


Step 3:Hook 模式匹配(基于范式 + 图特征)

3.1 凝视模式的 Hook 候选

凝视模式下 Hook 候选不是"模式名",而是"这一刻被偷拍是因为 [X]"的角度选择。

凝视角度 适合什么图
不知情的真实感 主角自然存在做着什么的图(看球、跟唱、讲课、地铁日常)
同框 N 个人都很有戏 多人场景(化妆间合影前打闹、聚餐、班级合照前)
平凡中的诗意 一个人安静做某事(厨房、窗边、落地灯下)
氛围浸入 强氛围感场景(演唱会前排、酒吧灯光、夜晚)

3.2 反应模式的 Hook 候选

图特征 推荐 Hook 模式 默认演化方向
有强材质感的物体(玫瑰、金属、果实、玻璃...) 材质魔术 触发 → 材质瞬变(结晶/液化/燃烧/汽化)
人像 / 角色立绘 风格突变 / 服装/造型变化 / 情绪演绎 写实↔水墨/油画/像素 / 100年挑战变化
风景 / 场景 / 建筑 一镜到底(拉远/潜入) / 时间流逝 微观→宏观 / 白昼→黑夜 / 完好→废墟
产品 / 商品图 360 展示 + 环境爆发 / 材质魔术 旋转展示叠加粒子/光效爆发
微观元素(花瓣、水珠、晶体) 尺度穿越 微距→星云→宇宙的递归
强构图人物动作图 子弹时间 / 定格环绕 360 环绕被定格的瞬间
有反差感 / 荒诞感的图 2 秒反转 看似正常 → 最后揭示真相
抽象 / 流体 / 粒子图 极致满足感 / 完美循环 流畅生长/塑形/绽放
赛博朋克 / 科幻 / 末世场景 史诗大制作 调用品质锚定+光影三层+大气连贯

3.3 输出 Hook 候选时的格式

每个候选必须包含:

### 候选 [A/B]:[名称]
- **Hook 范式**:凝视 / 反应(与 Step 1.4 用户选择一致)
- **演化轨迹**:基于推算时长 X 秒(凝视模式:3-4 个自然小动作分布;反应模式:分镜结构)
- **传播因子**:[这个版本的钩子是什么——为什么用户会想分享/二刷]
- **适用度**:★★★★★(一句话理由)

3.4 数量策略

  • 默认给 2 个版本(最稳的 + 一个差异化的)
  • 不要每次都强行 3 版,避免决策疲劳

Step 4:演化模板库

4-A:凝视模式专用模板(v3 新增·路径 C 90% 场景用这个)

[X秒][风格总纲,含画质来源关键词],

参考@图片1 的[主体外貌服装]+[场景氛围]但不强制卡任何一帧,
视频自由演化为 [场景类型] 自然瞬间,[主角角色定位声明:她/他是这条视频的核心主角]。

主角必须做 [场景] 中自然会做的事(X秒内必须明显发生 3-4 个动作):
- 0—K1秒:[动作1,正向夸张+反向否定]
- K1—K2秒:[动作2]
- K2—K3秒:[动作3]
- K3—X秒:[动作4]
不可表情呆滞不可一动不动不可只是 [被动姿态] 不可平静。

环境:[场景描述],[关键常识约束](禁止 [反常识动作])。

环境同步演化:身边 [群演类型] 必须有可见微动具体写——
左侧 [位置] [群演角色] [具体动作]、
右后方 [群演角色] [具体动作]、
前景 [群演角色] [具体动作]、
远处 [群演角色] [具体动作]。

[多人场景才加] 跨人物互动事件(视频核心,必须发生):[发起者] [发起动作] 作为视频起点的招呼信号...

镜头单一 Very Slow Push In 极缓慢推进(X秒内仅放大约15%),
全程单一机位无任何切换无任何拉远不可上升下降不可切角度。

画质:[场景对应的录像类型]的双重画质退化:
①[平台压缩]——[关键词];
②[设备瑕疵]——[关键词];
③[现场瑕疵]——[关键词];
④[镜头变形]——[关键词]。
禁用4K高清禁用Cinematic禁用电影级禁用稳定器质感禁用调色精致禁用工业渲染禁用画面锐利禁用清晰画质。

风格锁定:画质必须呈现明显的 [X 感] 不可呈现 4K 锐利画质不可呈现电影级稳定画质,
[现场音/BGM 贯穿全片不可寂静不可渐入不可中段才出现],
禁止任何文字、字幕、LOGO、水印。

4-B:反应模式·图作首帧(v2 模板 A 保留)

[X秒][风格总纲,含画质来源关键词],
0-2秒:@图片1为首帧静态画面,[微动铺垫——如尘埃浮动/光线变化/角色呼吸],
为下一刻爆发蓄势;
3—(X-3)秒:[核心戏点爆发——材质瞬变/动作展开/镜头推进/风格突变启动],
[运镜:组合 1-2 个],[现实类反应必须按子节拍展开];
(X-2)—X 秒:[余韵收束——画面凝固成新的"封面感",或回呼应开头]。

风格锁定:[一句风格描述,含画质来源],禁止任何文字、字幕、LOGO、水印。

4-C:反应模式·图作中间关键帧(高戏剧瞬间专用)

[X秒][风格总纲,含画质来源关键词],
0—(K-1)秒:[平静铺垫——主体的局部特写/前情交代,与最终画面有视觉关联],
[运镜:缓慢推进或微动];
(K-1)—K 秒:画面演化抵达 @图片1 所示状态,[关键帧定格 0.5 秒],
[运镜:定住或环绕];
K—X 秒:[超越关键帧的余韵——画面继续延伸/碎散/回落],
[音效:高点之后的回声],[现实类反应必须按子节拍展开]。

风格锁定:[一句风格描述],禁止任何文字、字幕、LOGO、水印。

X = 总时长(推算值),K = 抵达图的时刻(默认 X×0.55,例如 X=10 时 K≈5.5s)。 必须在提示词里显式写"第 K 秒画面演化抵达 @图片1 所示状态",模型才不会乱演化。

4-D:反应模式·图作反转揭示帧

[X秒][风格总纲,含画质来源关键词],
0—(X-4)秒:[看似平常的开场——刻意营造"这就是个普通xx"的预期],
[运镜:标准、克制];
(X-4)—(X-2)秒:[转折触发——某个动作/视角变化让一切开始改变];
(X-2)—X 秒:[揭示——画面演化为 @图片1 所示状态],
[音效:突然的静默或一记重音]。

风格锁定:[一句风格描述],禁止任何文字、字幕、LOGO、水印。

4-E:反应模式·图作尾帧

[X秒][风格总纲,含画质来源关键词],
0—(X-2)秒:[完整的故事推进——铺垫 → 发展 → 接近图的状态],
[运镜:依故事节奏];
(X-2)—X 秒:画面定格成 @图片1 所示状态,
[最后一秒静止 / 极慢推进 / 暗角渐入]。

风格锁定:[一句风格描述],禁止任何文字、字幕、LOGO、水印。

4-F:反应模式·图作闪回 / 记忆一瞬

[X秒][风格总纲,含画质来源关键词],
0—K 秒:[当下时间线的主画面——主体的当前状态],
[运镜:与当下场景一致];
K—(K+0.8)秒:[短暂闪回 / 一闪而过——画面快速切换为 @图片1 所示状态],
[过渡:白光闪 / 模糊抽帧 / 心跳声切入];
(K+0.8)—X 秒:[回到当下时间线,主体表情或环境因为闪回而有微妙变化]。

风格锁定:[一句风格描述],禁止任何文字、字幕、LOGO、水印。

K = 闪回触发点(默认 X×0.4),闪回本身只占 0.5-1.5s。

模板填充时的注意事项(v3)

  • 时长 X 由 Step 1 推算确定,不再默认 15s
  • 风格总纲必须包含画质来源关键词(凝视模式优先用 4 层退化模板)
  • 凝视模式:必须 3-4 个自然小动作 + 主角行为正向夸张+反向否定 + 镜头运动锁死声明
  • 反应模式:现实类反应必须按子节拍展开 + 图作非首帧时显式时间锚点
  • 多人场景:必须加跨人物互动事件
  • 每段都要有"画面 + 镜头",可选叠加"音效"
  • Seedance prompt 上限 2000 字符(硬约束):必须用 Python len() 实测而非估算 —— 见下方"字符数实测铁律"
  • 路径 C/D 强烈建议走极简优先策略(详见下方"极简优先铁律")—— 信任 Seedance 对图的理解能力,文字只补"图没有的+图需要规避的+关键 hook+硬约束"
  • 运镜词参考 vocabulary.md
  • 风格锚定参考 image-generation.md

⭐ 极简优先铁律(v3.1 升级·路径 C/D 默认策略)

教训来源(2026-05-16 实战验证):case-09~13 批次最初按"凝视模式 v3 八条原则"逐秒逐动作写到 1800-2000 字符,结果:

  • 画质退化模板/正反向锁定/4 层退化等"细节绑死"反而让 Seedance 出片僵硬
  • 大量描述性词汇聚集让即梦平台版权过滤误判("对标 X 平台/X 联赛"等借喻措辞触发笼统违规)
  • 实战发现:5 个 case 全部精简到 270-490 字符后,反而出片自由度更高、过审更稳

核心原则:

路径 C/D 的 prompt 应该优先信任 Seedance 2.0 对图的理解能力——文字只补 4 件事,其它让模型自由发挥。

文字 prompt 只补 4 件事:

# 补什么 例子
1 图本身没有的 时长(X 秒)、比例(9:16/16:9)、运镜大方向(一镜到底跟拍/缓慢推进/段间硬切或溶解)
2 图存在但需强化的 节奏(4 个动作大方向/3 个慢动作高潮)、情绪 hook(克制凝视/治愈微笑/爆笑收束)、关键瞬间(防守失衡瞬间/反手上篮/落地)
3 图里需要规避的 不复刻网格边框/格子编号/底部文字/箭头/英文标签/原图水印
4 保险的硬约束 禁止文字/字幕/LOGO/水印、禁止真人面孔可识别、禁止特定合规风险(低胸/嘴唇接触脸颊)

不要写(减负清单):

  • ❌ 每个动作具体到 0.X 秒的时间戳
  • ❌ "正向夸张+反向否定"双重锁定("不是 X 是 Y")
  • ❌ 4 层画质退化模板("抖音平台压缩+手机弱光录像+现场瑕疵+广角畸变")
  • ❌ 9 个画质禁用清单("禁用 4K/Cinematic/电影级/稳定器质感...")
  • ❌ 光影三层结构(光源/光行为/色调)详细描述
  • ❌ 品质锚定开头("UE5 渲染+工业光魔级 VFX"等借喻商业产品的渲染词)
  • ❌ 段内具体写群演每个位置的动作
  • ❌ 跨人物互动事件的详细分镜

极简版 prompt 标准结构(300-500 字符):

[时长][主题一句话][9:16 或 16:9]。

参考@图片1[图作什么用],[不复刻什么]。[整体演绎方向一句话],由模型自由设计动作衔接节奏。

[运镜大方向一句话]。

[氛围/色调/BGM 一句话]。

[关键瞬间或分段定位(如有四宫格则每段一句话)]。

[硬约束:禁止文字/水印/真人面孔可识别/合规风险]。

实战案例(case-13 街球 1v1 16 宫格):

版本 字符 出片效果
繁式 v1(4 层退化+6 阶段每段 2-3 动作+光影三层) 3102(超 1100+) 版权违规
繁式 v2(删品牌词+删借喻) 1874 版权违规
极简版 v3 271 过审 ✓
15秒雨夜街头女篮一对一进攻一镜到底,16:9 横屏。

参考@图片1中两位女篮球员的外貌服装和雨夜街头球场的氛围作为视觉风格参考,
**不复刻4×4网格边框/格子编号/底部中文字/箭头/英文动作标签**。
将原图分解的连续动作合并为一次完整连贯的进攻演绎,由模型自由设计动作衔接节奏。

镜头一镜到底跟拍主角,关键瞬间用慢动作放大表现力(防守失衡瞬间、空中反身上篮、自信落地),
其余阶段保持流畅运动跟随。

雨夜湿润地面反光,水珠飞溅,冷蓝主色调,节奏感强烈的电子鼓点贯穿。

禁止任何文字字幕LOGO水印,禁止两位球员真人面孔可识别。

何时仍可走繁式(v3 八条原则):

  • 用户明确要求"细节精雕"且第一版极简版出片不达标
  • 用户给的图本身信息密度很低,需要 prompt 大量补充
  • 反应模式(高戏剧瞬间需要精确时间锚点)—— 但凝视模式默认走极简

判断流程:

  1. 默认走极简版(300-500 字符)—— 首选
  2. 出片后若用户反馈"细节不够 / 节奏太自由",再升级为繁式(v3 八条原则)
  3. 出片后若反馈"画面僵硬 / 不像图 / 版权违规",更要回到极简版

⚠️ 极简优先策略·边界条件验证(2026-05-23 实战反馈后追加)

实测数据:8 个 case 极简版出片后主理人反馈:

评级 数量 case
🟢 通过 2 case-08 厨房抖音、case-13 街球 16 宫格
🟡 还行但缺心动点/灵动感 4 case-07/09/10/12
🔴 翻车 2 case-06 商 K 惊讶、case-11 雨夜电影预告

结论:极简优先策略不是万能的——通过率 25%、中规中矩 50%、翻车 25%。需要进一步细分适用边界。

适用边界(v3.1 修正)

场景类型 是否适用极简 原因
✅ 多宫格图本身就是分镜板(case-13) 强烈推荐 图本身约束力极强,文字只需补"段间转场+硬约束"
✅ 凝视模式·单图·简单情绪(case-08) 推荐 主角"自然存在"不需要复杂情绪过渡
⚠️ 凝视模式·需要心动 hook(case-09/12) 极简 + 显式 hook 极简框架 + 1 个明确的"心动瞬间"具体写
⚠️ 多宫格画风一致(case-10) 极简 + 自然感强化 加 1 句"保持真实日常感不要做作"弱化指令感
❌ 反应模式·复杂情绪过渡(case-06 惊讶、case-07 偷拍紧张) 不适用 惊讶/慌乱/紧张感需要子节拍展开
❌ 多宫格画风差异大(case-11 雨夜 4 段独立场景) 不适用 段间叙事连贯性低,极简版 Seedance 无法弥合

3 条共性问题与应对(v3.1 必修课)

共性 1:极简版容易丢"心动点"

症状:case-09/12 反馈"少了跟镜头的互动 / 缺乏灵动感"。

应对:极简版必须保留 1 个明确的心动 hook(不要写到秒,但要写明"什么瞬间最抓人"):

✅ 推荐:「第 X 秒主角对镜头吐舌/眨眼/比 V/凑近镜头小声说话,作为视频的心动 hook」
❌ 反例(极简过度):「主角自然演绎 4 个动作,由模型自由设计节奏」

抖音爆款类(凝视+抖音味子模式)的心动 hook 锚点库:

  • 对镜头互动类:吐舌/眨眼/比 V/飞吻/挑眉/凑近镜头小声说话
  • 被发现类:突然看向镜头微笑/掩嘴笑/捂脸笑/装作没看见又偷瞄
  • 情绪反转类:从淡定到爆笑/从认真到俏皮/从严肃到吐舌
  • 道具互动类:举起食物/饮料对镜头 cheers/把物品凑近镜头展示

共性 2:反应模式不能极简

症状:case-06(惊讶)反馈"假,不自然";case-07(地铁偷拍)反馈"缺局促紧张感"。

应对:反应模式必须按子节拍展开(极简版无法表达情绪精度):

反应模式的子节拍模板(以"惊讶"为例 · 6 秒):
- 0-0.3s:日常状态(呼吸/微动)
- 0.3-0.5s:认知瞬间(眼神聚焦/微抬头)
- 0.5-1s:瞳孔放大 + 眉毛抬起
- 1-1.5s:嘴唇微张
- 1.5-2.5s:完整惊讶定格(眼睛睁大 + 嘴张开 + 头微后仰)
- 2.5-4s:情绪持续保持(不要立刻收)
- 4-6s:微微调整 + 情绪余韵

物理时间常数参考(实战验证):

  • 脸红 ≥ 2.5s(颜色变化的生理时间)
  • 哭 ≥ 3s(眼眶湿润→泪滴→嘴角下垂的完整链路)
  • 惊吓 ≥ 1.2s(认知→反应→定格的最短时间)
  • 笑场 ≥ 2s(嘴角→眼睛→肩膀的连锁反应)
  • 偷拍紧张感 ≥ 全程(不是某个瞬间,是镜头握持+被拍主角的持续紧张过渡)

共性 3:路径 D 多宫格选 case 要看"画风一致性"

症状:case-11(雨夜 4 段独立场景)反馈"硬切、不协调、云里雾里";case-10/13(同主角/同场景延续)通过。

应对:路径 D 多宫格拼接前必须先评估画风一致性:

画风一致性评估 3 项:
1. **主角是否同一人**:✅ 同一人(case-10 闺蜜/case-11 同女主/case-13 同球员)/ ❌ 不同人 → 不适合 D-1
2. **场景是否同一场景或顺承场景**:
   - ✅ 同场景延续(case-13 球场同一时间线)
   - ✅ 顺承场景(case-10 夜游晚上不同地点的连贯时间线)
   - ❌ 完全独立场景跳跃(case-11 公寓→厨房→雨夜窗→夜市)→ 不适合 D-1 叙事
3. **色调是否统一**:
   - ✅ 统一冷色/暖色基调 → 段间硬切或溶解都可
   - ❌ 色调差异大 → 极简版 Seedance 无法弥合,需要繁式版强声明"统一调色"

不适合 D-1 叙事拼接时的备选方案:
- **方案 A(首选·已升级为 D-3「记忆/心境蒙太奇法」)**:放弃硬时序框架,用**情绪母题黏合剂 + 语义转场流 + 首尾呼应**把差异片段串成"回忆 MV"。母题让"硬切的违和"转化为"回忆的跳跃感"——这是独立场景型多宫格能跑通的根本。完整模板见 `references/storyboard-driven.md` 1.4
- **方案 B**:拆成 4 个独立 prompt 单独跑(D-2 模式),后期手动剪辑
- **方案 C**:建议用户换图

方案 A 可复制模板(记忆/心境蒙太奇法):

[一句情绪母题定调:一支[怀旧/治愈/告别]的[主题]回忆短片,画面在各瞬间间平滑流转,仿佛记忆逐一复活][比例]。

参考@图片1,但不复刻网格边框/分隔线/编号,将每一格演绎为一段连贯记忆,由模型自由设计段间衔接节奏。

以[第1格场景]开场,流转到[第2格],切到[第3格],转入[第4格]……最后以[末格背影/远景]收尾,画面像一段记忆般缓缓淡出。

[统一调色母题一句话让差异场景视觉收敛],段间柔和交叉溶解,[舒缓氛围音乐贯穿]。

禁止任何文字字幕LOGO水印,禁止网格边框,禁止真人面孔可识别。

实证来源:用户「海岛夏日旅行 9 宫格」prompt(2026-06-02)用 nostalgic summer memory 母题 + coming to life/fading out like a memory disappearing 首尾呼应,把 9 个画风差异极大的场景(自拍/沙滩/船甲板/泳池/日落/室内/蓝调/小径背影)黏成一段连贯回忆,验证了本方案威力。 关键区分:这是「独立场景蒙太奇」专用法,与 case-13 街球「连续动作链合并还原法」是两极——前者靠情绪母题黏合,后者靠一镜到底跟拍。判断准则见 path-D 1.3「格间关系三分类」。


⚠️ 字符数实测铁律(必须遵守)

教训来源:case-09~13 批次 5 个 prompt 中 4 个超长(最严重的 case-13 实测 3102 字符,自估"约 1995",超 1100+),原因都是按"中文字感觉"估算时严重低估。

铁律:

  1. 中文每个字 = 1 字符(Python len() 算法),标点也算
  2. 写完 prompt 不能凭感觉报字数——必须用脚本实测后才能输出"字符数:X"
  3. 目标控制在 1900 以内,预留 100 字符余量以防主理人微调追加

实测脚本(Agent 写完 prompt 后必须跑一次,把代码块路径换成 case 文件即可):

python3 -c "
import re, sys
txt = open(sys.argv[1]).read()
blocks = re.findall(r'\`\`\`\n(.*?)\n\`\`\`', txt, re.DOTALL)
if not blocks:
    print('NO_BLOCK'); sys.exit()
n = len(max(blocks, key=len))
print(f'{n} chars  |  {\"OK ✓\" if n <= 2000 else f\"超 {n-2000}\"}')
" experiments/cases/case-XX-xxx.md

超长削减策略(按优先级):

  1. 删除每段尾部的"画质重复行"(整体画质已声明无需段内复述)
  2. 把 ① ② ③ 序号合并为"先…再…最后…"句式
  3. "过程明显能看到""动作完成""自然演化"等 AI 易理解的废词全删
  4. 合并"品质锚定"和"大气连贯声明"两段(重复度高)
  5. 收束句砍掉次要修饰,保留张力宣言核心
  6. 不得动:4 层画质退化 / 段内动作时序 / 正反向锁定 / 跨人物互动 / 镜头锁死否定句穷举 / 范式锚定关键词 / 平台合规约束

⚠️ 版权/商标/地缘敏感词规避清单(必扫)

教训来源(v1):case-12 + case-13 出片前主理人提示"涉及版权限制",扫描发现两个 prompt 共有 9 个具体品牌词残留。

教训来源(v2,2026-05-16 实测后追加):替换掉具体品牌词后,case-12/13 仍被即梦平台笼统判定为版权违规。重新审视才发现:真凶不是具体品牌名,而是"风格借喻"措辞——「社交短视频爆款 vlog 自拍感」「职业联赛级体育转播画质」即便不写"抖音/ESPN",平台也能识别出"这是想对标 X 平台/X 实体的质感",触发版权过滤。

Seedance/即梦平台已知会触发版权过滤的关键词类型:

第 1 类:具体品牌/商标/IP 词(v1 清单)

类型 敏感词示例 中性替换
数码品牌 iPhone / iPad / Mac / Apple / Sony / Canon / Nikon / Leica 智能手机 / 平板 / 笔记本 / 数码相机 / 单反
社交平台 抖音 / TikTok / 小红书 / 快手 / 微博 / Instagram / YouTube (不要替换为"社交短视频"等借喻,详见第 2 类)
流媒体/体育媒体 ESPN / NBA TV / NBA / FIFA / Netflix / HBO / Disney+ (不要替换为"职业联赛级转播"等借喻,详见第 2 类)
游戏/渲染引擎商标 UE5 / Unreal Engine / Unity / Maya / Houdini 次世代游戏引擎渲染 / 实时渲染引擎
后期/VFX 工作室 工业光魔 / ILM / Pixar / Weta / Marvel (不要替换为"顶级 VFX 工作室级"等借喻,详见第 2 类)
音乐流派敏感词 hip-hop / trap(英文容易关联具体艺人) 电子鼓点 / 重低音节拍 / 嘻哈(中文中性)
导演风格借代 王家卫 / 杜可风 / 诺兰 / 库布里克 (不要替换为"X 大师式"借喻,详见第 2 类)
地缘政治 台湾 / 香港(涉政语境)/ 西藏 / 新疆 现代都市 / 街边 / 高原地区(去地名化)
影视 IP 角色名 哈利波特 / 小丑 / 钢铁侠 / 蜘蛛侠 改为外貌+气质通用化描述
现存知名艺人/真人姓名 任何具体姓名(明星/网红/历史人物) 改为外貌+气质描述

第 2 类:⚠️ 风格借喻措辞(v2 新增·更隐蔽更危险)

"风格借喻"= 即便不写品牌名,但用"对标 X 平台/X 实体质感"的句式仍会触发版权过滤。这一类比第 1 类更危险,因为 Agent 容易自以为"已经规避了品牌词"。

借喻措辞类型 危险示例 安全替换(纯物理描述)
借喻短视频平台质感 抖音爆款 / 小红书爆款 / 抖音 vlog / 旅行 vlog / 探店 vlog / 社交短视频爆款 / 社交短视频平台压缩感 手机随手拍 / 同伴帮拍随手感 / 画面经过二次压缩传播后的画质损失感 / 生活记录瞬间
借喻职业联赛/转播 ESPN 级 / NBA TV 级 / 职业联赛级转播 / 体育转播级 / 体育解说级 / 街球 1v1 高速摄影专业运动拍摄 / 高动态范围 / 120fps 慢动作 / 一对一对抗
借喻 VFX 工作室 工业光魔级 / ILM 级 / 顶级 VFX 工作室级 次世代实时渲染 / 顶级运动场景特效 / 粒子特效
借喻电影大师风格 王家卫式 / 王家卫调色 / 诺兰式 / 库布里克式 / 杜可风风格 35mm 胶片质感 / 暗光胶片美学 / 都市文艺片调色 / 疏离孤独感
借喻动漫/游戏 IP 风格 黑神话风 / 原神风 / 赛博朋克 2077 风 / 鬼灭之刃风 中式仙侠美学 / 东方玄幻 / 未来都市霓虹 / 日式动漫风(这种通用风格词目前可用,但"X-X-X 具体作品名"必拦)
借喻产品级专业术语 "电影级 4K HDR" 同时提及具体平台 拆解为纯参数(4K / HDR / 120fps / 高速摄影)+ 物理描述

第 3 类:⚠️ 行业敏感场景词(v3 新增·2026-05-24 case-17 实测后追加 · v5 大扩展)

"行业敏感场景词"= 单个词不一定违规,但聚集出现会被笼统判定为涉灰/涉黄擦边内容。这一类是第 3 个隐性陷阱——case-0913 批次完全没踩到,case-1420 批次的 case-17(高级会所公关介绍美女)才暴露出来。

v5 重大扩展(2026-05-24 case-17 二分法定位后追加):发现夜场氛围 BGM 词是隐藏雷区!具体过程:case-17 主理人极限测试发现「爵士钢琴」这一个词独立加入即触发审查——即梦平台把它和"室内+女性+暖光"组合时直接判涉灰。这类词比涉灰场景词更隐蔽,因为它们看起来完全是中性的氛围/BGM 描述词。

类型 敏感词示例 中性替换(语义重构)
KTV/夜店/会所语境词 高级会所 / 包间 / 夜店 / KTV / 酒吧包厢 / 沙龙厅(v5 新增) 室内场景 / 高端酒店大堂 / 高端商务场所 / 接待空间
服务行业敏感角色 公关 / 公关经理 / 陪侍 / 陪酒 / 服务员 / 妈妈桑 主理人 / 接待主管 / 沙龙女主人 / 礼宾员
暗示选秀/挑选 介绍美女 / 挑选 / 排队选 / 验货 迎宾女士列队致意 / 优雅列队 / 礼仪列队
女性集合敏感词 美女群像 / 美女介绍 / 一排美女 优雅女士群像 / 优雅女士并肩站姿
偷拍/偷窥语境 偷拍视角 / 偷拍美女 / 偷偷拍 旁观视角 / 远观记录视角 / 不刻意的旁观
发现/被拍语境 不察觉被拍 / 装作没看见 不察觉被注视 / 自然不刻意
🚨 v5 新增·夜场氛围 BGM 词(最隐蔽!) 爵士钢琴 / Jazz Piano / Lounge 音乐 / Bossa Nova / Smooth Jazz / 萨克斯独奏 / 钢琴酒吧 / 夜店电子乐(在女性 + 暖光场景下必触发) 柔和氛围音乐 / 轻柔背景音乐 / 环境音 或直接不写 BGM
🚨 v5 新增·夜场暖光氛围词(与上面组合更危险) 暖橘吊灯 + 大屏柔光 + 深色大理石 + 红木(在女性场景下组合触发) 拆解组合:单写其中 1-2 个 + 改"室内场景"即可,避免 4 元素全凑齐

核心策略·语义重构而非简单替换:

❌ 浅层替换(不够):「会所」→「场所」、「美女」→「女生」
✅ 语义重构:把"高级会所公关介绍美女"重构为"室内场景一位女士走入面对镜头微笑"——
   保留视觉效果(女主角+室内+优雅气质),但**砍掉所有夜场氛围联想词**(沙龙厅/爵士钢琴/暖橘吊灯+大屏柔光组合)。

case-17 实战对照(v1 → 最终版完整路径):

旧词 新词 修订原因
公关经理 主理人 → 直接砍掉 "公关"涉灰
介绍 6 位美女 迎宾 6 位优雅女士列队致意 → 直接砍掉,改单人主角 "介绍美女"暗示选秀
高级会所 高端艺术沙龙 → 高端私人沙龙厅 → 室内场景(v5 终极版) "会所/沙龙厅"在中文都有 KTV/夜店敏感联想
包间 沙龙厅 / 厅室 → 直接砍掉 同上
美女 优雅女士 → 长发女士 中性化
偷拍视角(case-19) 旁观视角 "偷拍"涉违法/伦理敏感
不察觉被拍 不察觉被注视 同上
柔和爵士/Lounge 氛围音乐(v3/v4 都没改) 柔和氛围音乐 / 环境音 或直接不写(v5 修订) 🚨 "爵士钢琴"是隐藏地雷——独立加入即触发涉灰审查
暖橘吊灯 + 大屏柔光 + 深色大理石(4 元素组合) 拆解只写 1-2 个 + 改"室内场景"(v5 修订) 4 个夜场环境元素全凑齐 = 即梦判夜场氛围

第 4 类:⚠️⚠️ 整体语义意图 + 镜头运动模式(v4 推测·v5 全面推翻并修正)

v4 第一稿假设(来自岳哥 GPT Image 2 文章):审查机制审的是"画面意图组合","展示女性 / 凝视女性身体" 必拦。

v4 第二稿假设:「镜头横扫多位女性 + 主角收束」运镜 = AI 训练数据里"选秀/挑选"叙事模式必拦。

v5 二分法实测全面推翻 v4 两稿假设:

case-17 二分法测试 5 个版本(按时间顺序):

测试 prompt 内容 字符 结果 揭示
方案 1(174) 含"沙龙厅"+主角描述+爵士钢琴+岳哥安全尾缀 174 ❌ 拦 起点
极限版 "8秒室内场景一位长发女士走入画面面对镜头微笑,16:9 横屏。" 31 ✅ 过 完全没运镜没意图也过 → v4 第二稿"运镜模式必拦"假设推翻
中等版 极限版 + @图片1 + 单一固定机位 + 柔和暖光 + 禁止文字水印 150 ✅ 过 这些都不是真凶
测试 A 中等版 + "高端沙龙厅" ~160 ✅ 过 "沙龙厅"也不是真凶(颠覆 v3 假设)
测试 B 中等版 + 岳哥安全尾缀(克制/气质姿态服装光影) ~190 ✅ 过 岳哥安全尾缀也不是真凶(反向颠覆 v4 第一稿对岳哥公式的过度信仰)
测试 C 中等版 + 仅加"柔和爵士钢琴音乐贯穿"一句 ~170 ❌ 拦 🎯 真凶定型:「爵士钢琴」

v5 真因定型(颠覆 v4 全部假设):

真正的真凶是隐藏在"中性氛围词"里的「夜场氛围 BGM 词」——「爵士钢琴」「Lounge 音乐」「Bossa Nova」「萨克斯独奏」这类词,看起来是无害的氛围描写,但在 AI 训练语料里 + 女性主角 + 室内场景的组合下,太容易关联到夜场/会所/酒廊语义场景,所以即梦审查直接拦。

v4 假设的反思:

  • ❌ v4 第一稿(岳哥的"叙事意图论")对即梦视频生成不适用:测试 B 证明岳哥安全尾缀加入反而能过——岳哥公式是针对 GPT Image 2 的,不能照搬到即梦视频生成
  • ❌ v4 第二稿("横扫运镜必拦")也不成立:极限版完全没运镜也能过,证明"运镜模式"不是核心审查维度
  • ✅ v5 真因:词汇/词组本身的"涉灰联想强度"才是核心——单个看似中性的"爵士钢琴"在特定语境组合下就足以触发

v5 真正的禁忌清单(核心)

类型 禁忌词 何时触发 替代
🔴🔴 夜场氛围 BGM(v5 新增·最隐蔽) 爵士钢琴 / Lounge / Bossa Nova / Smooth Jazz / 萨克斯 / 钢琴酒吧 与"女性主角 + 室内 + 暖光"组合 柔和氛围音乐 / 环境音 / 直接不写 BGM
🔴 第 3 类涉灰场景词 会所 / 公关 / 包间 / 介绍美女 / 偷拍 与女性主角组合 室内场景 / 主角自然行为
🔴 第 1/2 类品牌借喻 已知清单 任何场景 物理描述

v5 写女性场景 prompt 的实战策略(取代 v4 八条 checklist)

1. ⭐⭐ BGM 描写优先级最低——能不写就不写。必须写时用"柔和氛围音乐 / 环境音",
   严禁出现"爵士 / 钢琴 / Lounge / Bossa Nova / 萨克斯"等任何夜场 BGM 联想词
2. ⭐ 环境氛围词不要凑齐 4 元素:暖橘吊灯 + 大屏柔光 + 深色大理石 + 红木——这是夜场标准画面,
   即梦看到全凑齐就判夜场。拆解只写 1-2 个 + 改"室内场景"
3. 第 3 类涉灰词全删(沙龙厅 / 会所 / 包间 / 公关 都删)
4. 镜头运动可以随便写(极限版没运镜也过、中等版"单一固定机位"也过)——v4 第二稿假设作废
5. 岳哥安全尾缀可以加也可以不加(测试 B 证明不是真凶)——但加上无害,作为保险措施保留
6. prompt 越短越稳:极限版 31 字符过审,方案 1 174 字符就拦

给未来 Agent 的 3 条 v5 铁律

  1. 写女性 + 室内场景时,BGM 的优先级最低——能不写就不写。必须警惕"爵士钢琴 / Lounge / Bossa Nova"这类看似中性的氛围 BGM 词,它们在女性场景下就是地雷
  2. 不要被岳哥的 GPT Image 2 公式绑架——即梦视频生成跟 GPT 图像生成是两套审查机制,岳哥的"叙事意图论"对即梦不适用,真正起作用的是词汇/词组本身的"涉灰联想强度"
  3. prompt 字符越短,过审概率越高——case-17 极限版 31 字符过审,告诉我们:与其加大量"安全声明",不如直接砍掉所有可疑词

附录·欲望词→审美词对照表(v4 遗留·仅作参考非必用·v5 实测对即梦视频效果有限)

v5 实测发现:岳哥这套词汇替换公式对 GPT Image 2 有效,但对即梦视频生成效果有限——测试 B 证明加入岳哥安全尾缀的 prompt 反而能过审,说明它不是必杀技也不是雷区。保留此表作为词汇层防御参考,但v5 真正的核心防御是第 3 类涉灰场景词清单(含夜场氛围 BGM)+ prompt 极简化。

危险表达("欲望词") 安全替换("审美词")
性感 / 魅惑 / 妩媚 / 撩人 高级女性美 / 成熟吸引力 / 神秘优雅 / 眼神有故事感
身材火辣 / 丰满 / 胸大腰细臀翘 / 身体凝视 身形圆润匀称 / 曲线自然流畅 / 健康丰腴 / 高级体态
突出胸部 / 突出臀部 / 局部特写 / 低胸 整体身形协调 / 上半身丰腴 / 比例协调 / 剪裁合身
挑逗姿势 / 趴着 / 身体前倾 / 撩人动作 自然站姿 / 端正坐姿 / 轻微侧身 / 肩颈舒展
暧昧氛围 / 床上 / 浴室湿身 / 私密空间 明亮室内 / 柔软卧室场景但保持端正姿态 / 高级家居
低机位仰拍凝视 平视 / 时尚商业人像视角 / 自然 lookbook 视角
性感回眸 头部自然回望镜头 / 肩颈线条舒展 / 高级时尚人像感
露点 / 衣服快掉落 / 透明若隐若现 / 暴露 剪裁优雅 / 材质柔软 / 版型合身 / 整体得体高级
性感泳装美女 高端泳装品牌 lookbook / 度假穿搭 / 重点表现版型与场景
兔耳朵 / 女仆 + 性感 / 幼态可爱 角色美术设计 / 幻想系造型 / 成熟温柔气质 / 端正姿态
公关介绍美女 / 一排美女 / 美女群像 时尚 lookbook 群像 / 品牌活动模特列队 / 商务接待场景(注意:词换了不够,运镜也要换)
长腿美女走来 商务女士进入会议室 / 品牌活动入场 / 模特走位(case-19 实测安全)
镜头扫视女性 / 挨个看一遍 / 横扫一排 直接砍掉这个运镜,改单一固定机位 / 主角主动行为

安全边界尾缀模板(高风险 case 的兜底,必加在 prompt 末尾)

整体保持高级、得体、克制氛围,重点表现人物气质、姿态、服装质感、光影层次和镜头美学,
不以身体特写或感官刺激为画面重点,画面整体呈现商业人像 / 时尚 editorial / 品牌 lookbook 视觉风格。

岳哥短版(适合极简 prompt 用):

画面保持高级、得体、克制,不做挑逗姿态,不突出身体局部,不使用低俗或成人向表达。

写 prompt 前必过的 8 项 checklist(视频场景适配·v4 升级)

1. 是否明确写了"成年女性"?(不写"少女/萝莉/幼态")
2. 是否避免了"少女感 + 性感"的组合?
3. 是否没有单独强调胸部、臀部等身体局部?
4. 是否没有使用挑逗、诱惑、勾引等词?
5. 是否没有低机位、身体凝视、局部特写?
6. 服装是否写成得体、合身、剪裁优雅?
7. 场景是否明亮、干净、商业化,而不是私密暧昧?
8. 画面重点是否放在气质、姿态、服装、光影、运镜美学上?
9. ⚠️ v4 新增:**镜头运动是不是"横扫多位女性 + 收束"?是 → 必须改成单一固定机位 / 主角主动行为 / 静态群像之一**

8+1 项全过 → 出片稳定性显著提升。任何一项没过 → 必须重写。


核心原则(v4 升级版·四关合一):

  • ✅ 保留功能性物理描述:「4K HDR」「120fps 高速摄影」「胶片质感」「暗光噪点」「冷蓝色调」「广角畸变」「水珠飞溅粒子」等中性技术词全部安全
  • ✅ 保留地域生活元素(食物/服饰/建筑符号):蛋饼/不锈钢台面/机车骑士/塑料招牌/榻榻米/旗袍/胡同等中性元素安全
  • ✅ 多人女性场景默认运镜:单一固定机位 / 主角主动行为 / 静态群像(三选一)
  • ❌ 禁止任何借喻:不论是「对标 X 平台」「X 联赛级」「X 大师式」「X 工作室级」统统改为纯物理描述
  • ❌ 禁用品牌/商标:哪怕只是"质感参考"也不行
  • ❌ 禁用敏感地名:哪怕只是"场景设定"也建议中性化
  • ❌❌ 禁止"横扫多位女性 + 主角收束"运镜(v4 真因):这是 AI 训练数据里"选秀/挑选"叙事模式,不论叫"品牌发布会"还是"时尚 lookbook"都会被识别——必须从镜头运动逻辑层重写

安全 vs 危险句式对照(实战必读):

❌ 危险:「8 秒台湾早餐店女生比手挡镜被偷拍旅行 vlog 抖音爆款」
✅ 安全:「8 秒街边小吃店女生伸手挡镜大笑被同伴随手拍到的生活瞬间」

❌ 危险:「ESPN/NBA TV 级体育解说画质 + UE5 渲染 + 工业光魔级 VFX」
✅ 安全:「高速摄影质感 + 高动态范围 + 120fps 高速摄影慢动作捕捉 + 次世代实时渲染雨夜湿润效果 + 顶级运动场景特效」

❌ 危险:「王家卫式都市文艺片大师式调色」
✅ 安全:「35mm 胶片质感 + 都市文艺片调色 + 暗光胶片美学」

❌ 危险:「街球 1v1 进攻分解 BEHIND-BACK + EUROSTEP + crossover」
✅ 安全:「一对一对抗连续变向 + 背后运球 + 大跨步过人 + 体前变向」

实测脚本扩展版(v5 升级·五关扫描:字符数 + 第 1 类品牌词 + 第 2 类风格借喻 + 第 3 类涉灰场景词(含夜场 BGM)+ 第 4 类整体意图自检):

python3 -c "
import re, sys
txt = open(sys.argv[1]).read()
blocks = re.findall(r'\`\`\`\n(.*?)\n\`\`\`', txt, re.DOTALL)
if not blocks:
    print('NO_BLOCK'); sys.exit()
longest = max(blocks, key=len)
n = len(longest)
print(f'{n} chars  |  {\"OK ✓\" if n <= 2000 else f\"超 {n-2000}\"}')
# 第 1 类:具体品牌词
brand = ['iPhone','iPad','Apple','Sony','Canon','抖音','TikTok','小红书','快手','微博',
         'ESPN','NBA','FIFA','Netflix','HBO','UE5','Unreal','Unity','工业光魔','ILM','Pixar',
         '台湾','香港','西藏','新疆','哈利波特','小丑','蜘蛛侠','钢铁侠','王家卫','Arnold','V-Ray']
# 第 2 类:风格借喻(更隐蔽)
mimic = ['vlog','爆款','探店','社交短视频','旅行vlog','体育转播','体育解说','职业联赛',
         'VFX工作室','大师式','大师风格','crossover','BEHIND-BACK','EUROSTEP','hip-hop','trap']
# 第 3 类:涉灰场景词 + v5 新增夜场氛围 BGM 词(最隐蔽!)
gray = ['公关','陪侍','陪酒','KTV','夜店','会所','包间','沙龙厅','介绍美女','服务员','妈妈桑',
        '偷拍','偷窥','不察觉被拍','美女群像','一排美女','挑选美女']
# v5 新增:夜场氛围 BGM 词(case-17 实测真凶)
night_bgm = ['爵士钢琴','Jazz Piano','Lounge','Bossa Nova','Smooth Jazz','萨克斯独奏','钢琴酒吧','夜店电子乐','爵士乐','Lounge音乐']
# 第 4 类:整体意图欲望词(v4 遗留·v5 实测效果有限·仅作参考)
desire = ['性感','魅惑','妩媚','撩人','身材火辣','丰满','胸大','翘臀','低胸','突出胸部','突出臀部',
          '身体凝视','低机位仰拍','挑逗','诱惑','勾引','暧昧','私密','湿身','床上','浴室',
          '露点','暴露','透明','若隐若现','局部特写','回眸凝视','美女','少女感','幼态','萝莉']
b_hits = [w for w in brand if w in longest]
m_hits = [w for w in mimic if w in longest]
g_hits = [w for w in gray if w in longest]
ng_hits = [w for w in night_bgm if w in longest]
d_hits = [w for w in desire if w in longest]
print(f'  第1类品牌词: {b_hits if b_hits else \"✓ 无\"}')
print(f'  第2类借喻词: {m_hits if m_hits else \"✓ 无\"}')
print(f'  第3类涉灰词: {g_hits if g_hits else \"✓ 无\"}')
print(f'  🚨 第3类·夜场BGM(v5 新增·case-17 实测真凶): {ng_hits if ng_hits else \"✓ 无\"}')
print(f'  第4类欲望词(参考): {d_hits if d_hits else \"✓ 无\"}')
" experiments/cases/case-XX-xxx.md

给未来 Agent 的执行口诀(v5 终极版·case-17 真因定型):

写完 prompt → 跑五关扫描脚本 → 特别关注夜场 BGM 词(爵士钢琴 / Lounge / Bossa Nova 等)→ 全过才能输出。 女性 + 室内场景的 BGM 描写优先级最低——能不写就不写。 不要被岳哥 GPT Image 2 公式绑架——岳哥安全尾缀对即梦视频可有可无,真正起作用的是删掉所有夜场氛围联想词 + prompt 极简化。 case-17 终极教训:31 字符极限版过审,174 字符方案 1 拦——最大的安全策略是"少写"而不是"写更多安全声明"。


Step 5:扩图建议(增值能力)

当图片比例不理想,但构图本身很好时,主动给用户扩图方案。

触发条件(满足任一)

  • 图是 16:9 / 1:1 / 非标准比例,但用户想做 9:16 抖音视频
  • 图主体居中、左右/上下有可延伸的氛围空间
  • 用户明确希望"打满 9:16"获得最大社交媒体曝光

扩图工具推荐

  • NanoBanana(默认):自然语言描述扩展方向,对中文友好
  • 即梦图片生成:可指定"扩图"功能,但写实人脸场景受限
  • Photoshop 生成式填充:精度最高,但需要本地操作

扩图提示词模板(NanoBanana)

[原图描述:主体+风格+色调],将原画面[扩展方向:上方/下方/左右]扩展,
扩展区域延续原画面的[风格/光影/氛围],[扩展区域具体内容描述:天空/地面/环境延伸],
保持主体不变,整体画面比例[目标比例:9:16竖版/16:9横版/1:1方形],
风格统一无拼接痕迹。禁止:任何文字、字幕、LOGO、水印。

输出扩图建议时的格式

### 扩图建议(推荐)

**原图比例**:16:9 横版
**目标比例**:9:16 竖版(抖音原生)
**扩展方向**:上方 + 下方
**扩展内容建议**:
- 上方:延续画面的天空/光线,扩出 [具体描述]
- 下方:延续画面的地面/前景,扩出 [具体描述]

**扩图提示词**(NanoBanana):
\`\`\`
[完整可复制的扩图提示词]
\`\`\`

扩完之后再用扩图后的 9:16 图作为首帧 @图片1 接入下方视频提示词。

Step 6:文字要求注入规则

用户附带的文字要求,按 4 级优先级处理(高到低):

Level 1:硬约束(必须满足,否则方案废)

例:

  • "不要出现人脸"
  • "必须 9:16 竖屏"
  • "不要任何文字"
  • "时长必须 15 秒"
  • "不要某品牌/角色"
  • "自然神态、不需要发现镜头"(v3 新增·直接锁定凝视模式)
  • "主角必须有戏剧反应"(v3 新增·直接锁定反应模式)

→ 直接进生成参数或负面提示词,不询问,不妥协。

Level 2:延展方向(覆盖图片本身的风格判断)

例:

  • "往赛博朋克方向"
  • "做成东方仙侠"
  • "改成水墨风"
  • "现代都市感"

→ 覆盖我从图里读到的风格判断,自动激活"风格突变"模式作为推荐 A。

Level 3:情绪 / 用途(影响 hook 选择和收束)

例:

  • "做奶茶店开业宣传"
  • "想要高级感"
  • "要治愈系"
  • "用来涨粉"

→ 影响 Hook 范式排序和结尾收束方式。比如奶茶店开业 → 优先反应模式"极致满足感 + 产品 360 展示";治愈系 → 优先凝视模式。

Level 4:风格细节(注入到具体段落)

例:

  • "加点慢镜头"
  • "用航拍视角"
  • "加雨水特效"

→ 注入到对应分镜的运镜或大气描述。

冲突处理

冲突类型 处理方式
用户文字 ≠ 图本身风格 风格突变模式自动成为推荐 A,告诉用户"这本来就是 Seedance 的强项"
用户要"15s 满" + 图作为反转帧 优先满足 15s,反转帧版本的 0-12s 用模板 4-D 的铺垫填充
用户要"竖屏" + 图是 16:9 优先满足竖屏,主推扩图方案(不裁切原图)
用户要凝视 + 图是高戏剧瞬间 凝视优先,但提醒用户"图本身的戏剧性会被弱化为氛围参考"

完整交互流程(v3)

用户:[丢图 + (可选)文字]
  ↓
Skill:执行 Step 1(读图分析)+ Step 2(比例诊断)
  - 输出含画质来源判定 / 4 层退化策略 / 建议时长 / 平台合规风险 / 常识审计
  - 给出 Hook 范式判断(反应/凝视/待定)
  ↓
Skill:Step 1.4 询问 Hook 范式(反应/凝视)
  ↓
用户:回复范式(或不指定)
  ↓
Skill:基于范式 + 推算时长,输出 2 个 Hook 候选(Step 3)
  ↓
用户:选 A/B 或自己提方向
  ↓
Skill:基于选定 + 对应 Step 4 模板(凝视用 4-A / 反应用 4-B~F)+ 文字要求(Step 6)
  - 凝视模式:3-4 个自然小动作 + 群演段内具体写 + 跨人物互动事件 + 镜头运动锁死 + 4 层画质退化
  - 反应模式:子节拍展开 + 时间锚点(如选中间帧)
  - 风格总纲带画质来源关键词
  - 时长 = 推算值(非默认 15)
  - 检查总字符数 ≤ 2000(Python `len()` **实测**而非估算,见"字符数实测铁律")
  ↓
输出完整可复制的 Seedance 提示词
  ↓
(可选)追加 CLI 执行询问,参数含推算时长,详见 cli-integration.md
  ↓
(可选)用户要求微调 → 在选定版本上调整

输出格式(最终视频提示词,v3)

选定 Hook 模式后,按 SKILL.md 的完整模式输出,但有几点强化:

## 视频提示词(基于你的图)

**主题**:[一句话概括]
**时长**:X 秒(推算理由:[一句话])  |  **比例**:[与图一致 / 扩图后]
**Hook 范式**:[反应 / 凝视](v3)
**Hook 模式**:[选定的具体 Hook 名]
**画质策略**:[手机随手拍 / 直播流偷拍 / 电影级稳定 / ...](来自 Step 1 判定)
**字符数**:X 字符(≤2000)

### 参考素材
- @图片1:[原图 / 扩图后图] —— [一句话说明用途,凝视模式标"作框架参考不卡帧"]
- (如需)@图片2:[首帧补充图],图片生成提示词:[NanoBanana 中文提示词]

---

### Seedance 提示词

\`\`\`
[完整 X 秒提示词]
\`\`\`

### 设计意图

- **前 2 秒生死线**:[这版怎么抓住前 2 秒]
- **核心 hook**:[最炸的那一下在第几秒,是什么]
- **画质真实感**:[为什么用 X 画质策略,匹配图的来源感]
- **范式选择**:[为什么选凝视/反应,对应模板的关键约束]
- **二刷钩子**:[结尾的呼应/隐藏细节]
- **传播预期**:[适合哪个平台、为什么会引流]

### 微调建议

如果想调整:
- 风格更[xx] → 改 [具体段落]
- 节奏更[xx] → 改 [具体段落]
- 加 [xx] 元素 → 加在 [具体段落]
- 时长改为 [xx]s → 重新分配各段时间

路径 C v3 质量自检 Checklist

输出最终提示词前,自动检查:

核心字段:

  • 比例诊断已完成,图片比例与视频比例的匹配方案明确
  • Hook 范式已确定(反应/凝视)(v3 替代 v2 时序角色询问)
  • 画质来源已判定,对应 4 层退化策略已写入风格总纲
  • 建议时长已推算,并给出推算理由(非默认 15s)
  • 平台合规风险已评估(高 → 拒跑 / 中 → 警告 / 低 → 继续)
  • 日常物理常识审计已通过(v3 新增)
  • 风险检查已扫(真人脸/文字水印/清晰度)

提示词内容(通用):

  • 前 2 秒有视觉钩子,没有用"缓缓推进"开场
  • X 秒分镜完整,无时间空缺(X = 推算时长)
  • 图作框架参考不卡帧(除非选反应模式且图是高戏剧瞬间,那种情况按 4-C/D/E/F 模板显式写时间锚点)
  • 画质 4 层退化已写齐(凝视模式必须)
  • 9 个禁用清单已写
  • 风格锁定的正向强约束已写("画质必须呈现 X 感不可呈现 4K")
  • 现场音/BGM 贯穿声明已写("贯穿全片不可寂静不可渐入不可中段才出现")
  • @图片1 引用方式明确(首帧 / 编辑 / 框架参考)
  • 风格锁定语句已加(防漂移)
  • 文字要求已分级注入(硬约束/延展/情绪/细节)
  • 总字符数 ≤2000(Python len() 实测禁止估算;目标 ≤1900 留 100 余量;超长按"字符数实测铁律"削减)

凝视模式专属:

  • 主角有 3-4 个自然小动作分布
  • 主角行为用"正向夸张+反向否定"双重锁定
  • 主角角色定位声明已写("她是这条视频的核心主角")
  • 镜头运动否定句穷举锁死(不可切换/拉远/上升/下降/切角度)
  • 群演段内具体写动作(不只是单句声明,每个位置具体写)

反应模式专属:

  • 现实类反应使用了子节拍(脸红 ≥2.5s、哭 ≥3s、惊吓 ≥1.2s 等)
  • 图作非首帧时,提示词中显式写明时间锚点(如"第 X 秒抵达 @图片1 状态")

多人场景专属:

  • 跨人物互动事件已写(视频核心叙事骨架)

输出辅助:

  • 扩图建议已给出(比例不理想时)
  • 二刷钩子已设计(结尾呼应或细节)
  • 总文件数 ≤12(图+视频+音频)
  • 未包含写实真人面部素材

实例 Prompt 库(已通过验证)

场景类型 Hook 范式 文件位置
演唱会前排追星 凝视模式 experiments/cases/case-01-演唱会.md 第 15 节 v5(1456 字符)
多人场景合影前打闹 凝视模式 + 跨人物互动 experiments/cases/case-03-化妆间.md 第 15 节 v5(1701 字符)
课堂偷拍 凝视模式 + 时间分段 experiments/cases/case-04-讲课.md 第 15 节 v5(1886 字符)
直播流偷拍看球 凝视模式(奠基 case) experiments/cases/case-05-球场大屏.md 第 15 节 v4.1(1408 字符)

与其他文档的关系


常见误区(v3)

  1. 平均用力让所有元素都动:错。一张图只放大一个戏点。
  2. 直接把图比例当视频比例不询问:错。16:9 横图做抖音是高频踩坑。
  3. 看到图默认走反应模式(v3 新增):错。90% 路径 C 场景应该走凝视模式。日常瞬间硬塞戏剧反应必出戏。
  4. 把图卡为某一帧时间锚点(v3 新增·推翻 v2):错。图应作"框架参考"不强制卡帧,让模型自由演化。
  5. 文字要求一股脑塞 prompt:错。必须分级注入。
  6. 扩图建议只提一句:错。要给出完整的扩图提示词,让用户能直接执行。
  7. 跳过风险检查:错。真人脸/水印/清晰度/合规风险不查清楚,跑完发现被拦截就晚了。
  8. 画质默认电影级 CG 高清稳定:错。生活类图变高清就是变假。视频画质必须匹配图的来源感(凝视模式必走 4 层退化模板)。
  9. 写情绪反应只写结果(反应模式专属):错。"她害羞地脸红了"会被模型瞬间执行,必须按子节拍展开(眼神飘 → 低头 → 缓慢泛红)。
  10. 默认打满 15s:错。时长服从内容。一瞬间的反应 3-5s 即可,硬拉到 15s 必然注水编造。
  11. 动漫风格 = 合规豁免:错。post-TNS 对动漫暴露同样敏感,视频化逐帧审查比静图严。
  12. 凝视模式 = 主角呆滞一动不动(v3 新增):错。凝视模式必须有 3-4 个自然小动作分布,每个动作用"正向夸张+反向否定"双重锁定。
  13. 多人场景每个人各做各的事(v3 新增):错。必须有跨人物互动事件作为叙事骨架,否则就是孤立角色拼贴。
  14. 群演只写"不可静止"风格锁定(v3 新增):错。每个位置(左侧/右后方/前景/远处)必须段内具体写动作。模型只听具体的,不听抽象的。
  15. 跳过日常常识审计(v3 新增):错。前排有人挡视线、老师边面向学生边写黑板等反常识动作必须显式禁止。