Files
mcn-short-video/project/内容创作产品规划/内容知识库设计/1_短剧创作知识库/入库规范/商业数据入库规范.md
T

4.3 KiB
Raw Blame History

商业数据入库规范

V5.0新增:商业表现数据的入库规范,确保数据真实性和完整性


一、数据入库标准

1.1 必填字段

每部剧的商业表现数据入库必须完成以下字段:

字段类型 必填字段 说明
分类字段 region / gender / genre / style / monetization 五维定位,决定分区
标签字段 universe / identity / golden_finger / tone / element 核心设定标签
剧级标识 drama_id / drama_title / launch_date / total_episodes / platform 剧基本信息
通用指标 total_views / viewer_count / 7day_retention / engagement_rate 通用商业指标
变现模式指标 按变现模式选择对应指标体系(见商业数据指标标签.md) 付费/免费/IAP专属指标
数据来源 data_source / data_date 数据来源标注

缺必填字段拒绝入库。

1.2 数据真实性要求

  1. 严禁虚构数据:所有数据必须来源于真实市场数据
  2. 严禁推测填充:缺失字段标注"暂无",不得用推测值填充
  3. 数据来源必须标注:每条数据标注来源类型和获取日期
  4. 多源交叉验证:同一指标尽量从2个以上来源交叉验证

1.3 数据口径标注

  1. 不同平台数据口径不同:必须标注数据口径说明
  2. 同一剧在不同平台的数据可能有差异:按主平台数据为准,辅助平台数据标注差异
  3. 海外数据需要标注汇率:海外数据以当地货币为单位,同时标注汇率折算

二、数据入库流程

商业数据入库流程(6步):

① 数据采集 → 从平台公开数据/行业报告/采购数据获取原始数据
② 五维定位 → 确定 region + gender + genre + style + monetization
③ 标签标注 → 标注 universe + identity + golden_finger + tone + element
④ 商业数据填写 → 按变现模式选择指标体系,填写全部必填字段
⑤ 数据来源标注 → 标注 data_source + data_date + 数据口径说明
⑥ 分区归类与审核 → 按五维+变现模式归入对应商业数据目录,管理员确认数据真实性后入库

三、数据更新规范

3.1 更新频率

数据类型 更新频率 责任方
爆款剧数据 月度 数据运营
非爆款剧数据 季度 数据运营
海外剧数据 月度 数据运营
数据口径调整 半年度 数据团队

3.2 更新流程

  1. 每月采集新上线剧的商业数据
  2. 每季度更新已有剧的累计数据(total_views等持续增长指标)
  3. 每半年校验数据口径一致性
  4. 数据更新后同步更新关联的创作-商业归因映射

四、创作-商业关联标注规范

4.1 关联映射格式

每部剧的商业数据分块必须包含 创作维度-商业结果关联映射 表格:

| 创作维度 | 关联指标 | 关联分析 | confidence |

4.2 confidence 分级标准

confidence值 判定标准 说明
高 同五维定位≥5部剧数据统计验证 多剧统计支撑,因果性较强
中 同五维定位2-4部剧数据+逻辑推断 有限统计+逻辑合理,相关性较强
低 仅1部剧数据+主观推断 单剧个案,仅相关不推断因果

4.3 归因规则

  1. 相关性≠因果性:confidence=高仅代表统计相关性强,不代表确定因果关系
  2. 单剧归因必须标注confidence=低:除非有≥5部同类型剧数据统计验证
  3. 多剧统计必须标注样本量:如"基于5部国内女频重生复仇付费剧数据"
  4. 优化建议引用商业数据时必须标注confidence:不能把相关性强归因当作确定性结论使用

五、数据质量巡检

巡检维度 频率 标准
必填字段完整性 月度 100%覆盖
数据真实性 季度 多源交叉验证≥50%
数据时效性 月度 近6个月上线剧≥80%入库
数据口径一致性 半年度 同指标不同来源口径≤10%差异
归因confidence标注 月度 100%归因有confidence标注
商业数据覆盖率 月度 每种地域×性别×变现模式≥3部剧数据