4.3 KiB
4.3 KiB
商业数据入库规范
V5.0新增:商业表现数据的入库规范,确保数据真实性和完整性
一、数据入库标准
1.1 必填字段
每部剧的商业表现数据入库必须完成以下字段:
| 字段类型 | 必填字段 | 说明 |
|---|---|---|
| 分类字段 | region / gender / genre / style / monetization | 五维定位,决定分区 |
| 标签字段 | universe / identity / golden_finger / tone / element | 核心设定标签 |
| 剧级标识 | drama_id / drama_title / launch_date / total_episodes / platform | 剧基本信息 |
| 通用指标 | total_views / viewer_count / 7day_retention / engagement_rate | 通用商业指标 |
| 变现模式指标 | 按变现模式选择对应指标体系(见商业数据指标标签.md) | 付费/免费/IAP专属指标 |
| 数据来源 | data_source / data_date | 数据来源标注 |
缺必填字段拒绝入库。
1.2 数据真实性要求
- 严禁虚构数据:所有数据必须来源于真实市场数据
- 严禁推测填充:缺失字段标注"暂无",不得用推测值填充
- 数据来源必须标注:每条数据标注来源类型和获取日期
- 多源交叉验证:同一指标尽量从2个以上来源交叉验证
1.3 数据口径标注
- 不同平台数据口径不同:必须标注数据口径说明
- 同一剧在不同平台的数据可能有差异:按主平台数据为准,辅助平台数据标注差异
- 海外数据需要标注汇率:海外数据以当地货币为单位,同时标注汇率折算
二、数据入库流程
商业数据入库流程(6步):
① 数据采集 → 从平台公开数据/行业报告/采购数据获取原始数据
② 五维定位 → 确定 region + gender + genre + style + monetization
③ 标签标注 → 标注 universe + identity + golden_finger + tone + element
④ 商业数据填写 → 按变现模式选择指标体系,填写全部必填字段
⑤ 数据来源标注 → 标注 data_source + data_date + 数据口径说明
⑥ 分区归类与审核 → 按五维+变现模式归入对应商业数据目录,管理员确认数据真实性后入库
三、数据更新规范
3.1 更新频率
| 数据类型 | 更新频率 | 责任方 |
|---|---|---|
| 爆款剧数据 | 月度 | 数据运营 |
| 非爆款剧数据 | 季度 | 数据运营 |
| 海外剧数据 | 月度 | 数据运营 |
| 数据口径调整 | 半年度 | 数据团队 |
3.2 更新流程
- 每月采集新上线剧的商业数据
- 每季度更新已有剧的累计数据(total_views等持续增长指标)
- 每半年校验数据口径一致性
- 数据更新后同步更新关联的创作-商业归因映射
四、创作-商业关联标注规范
4.1 关联映射格式
每部剧的商业数据分块必须包含 创作维度-商业结果关联映射 表格:
| 创作维度 | 关联指标 | 关联分析 | confidence |
4.2 confidence 分级标准
| confidence值 | 判定标准 | 说明 |
|---|---|---|
| 高 | 同五维定位≥5部剧数据统计验证 | 多剧统计支撑,因果性较强 |
| 中 | 同五维定位2-4部剧数据+逻辑推断 | 有限统计+逻辑合理,相关性较强 |
| 低 | 仅1部剧数据+主观推断 | 单剧个案,仅相关不推断因果 |
4.3 归因规则
- 相关性≠因果性:confidence=高仅代表统计相关性强,不代表确定因果关系
- 单剧归因必须标注confidence=低:除非有≥5部同类型剧数据统计验证
- 多剧统计必须标注样本量:如"基于5部国内女频重生复仇付费剧数据"
- 优化建议引用商业数据时必须标注confidence:不能把相关性强归因当作确定性结论使用
五、数据质量巡检
| 巡检维度 | 频率 | 标准 |
|---|---|---|
| 必填字段完整性 | 月度 | 100%覆盖 |
| 数据真实性 | 季度 | 多源交叉验证≥50% |
| 数据时效性 | 月度 | 近6个月上线剧≥80%入库 |
| 数据口径一致性 | 半年度 | 同指标不同来源口径≤10%差异 |
| 归因confidence标注 | 月度 | 100%归因有confidence标注 |
| 商业数据覆盖率 | 月度 | 每种地域×性别×变现模式≥3部剧数据 |