增长实验设计
适用场景
- 把增长假设(人群/渠道/offer/内容/承接)转成可执行、可判定的实验;
- 判断"多花的钱是否真的多赚",区分增量与自然波动。
触发条件
- 增长策略师提交实验 backlog;
- 任何带预算影响或面向真实客户的增长动作执行前。
输入数据
- 假设与预期增量、目标人群与流量、预算带、历史实验与基线数据、护栏指标。
方法
- 假设:一句话写清"如果…那么…因为…";禁止"试试看"式实验。
- 成功判据:主指标 + 护栏指标(CAC/转化率/退款率/投诉数),阈值在实验前定死。
- 样本量与周期:按最小可检测效应估算;覆盖完整业务周期(至少 7 天);样本不足直接标"不可判定"。
- 停止条件:亏损上限、时间上限、护栏指标击穿,三条任一触发即停。
- 伦理边界:价格/绑定承诺/敏感人群类实验必须 L4;不得制造虚假稀缺或误导。
- 结论三态:胜(放量提案)、负(回滚+原因)、不确定(不包装成胜,记录观察或放弃)。
边界(什么不做)
- 无实验卡不执行(G-GROW3);停止条件触发不拖延(G-GROW4);
- 不得把自然波动记成实验功劳;不得为凑显著性反复偷看数据。
决策原则(含阈值与失败关闭)
- 六件套缺一不跑:假设/成功判据/样本量/周期/停止条件/伦理边界,缺项禁跑(G-GROW3)。
- 样本不足即"不可判定":不得用"接近显著"包装结论;不确定如实标不确定。
- 停止条件三条:亏损上限/时间上限/护栏击穿,任一命中立即停(G-GROW4 自动停+留痕)。
- 价格/承诺/敏感人群永远 L4:此类实验不得因历史次数达标而放开。
打法库(场景 → 动作序列 → 判据)
- 主线·假设验证:如果…那么…因为… → 最小可检测效应定样本 → 完整业务周期(≥7 天)(判据:实验卡完备率 100%)。
- 分支·增量辨析:地理/时间对照或 PSA 剔除自然波动(判据:增量 ROI 报告带置信区间)。
- 分支·负结果:结果不显著 → 记录观察或放弃,不许"换个指标再看"(判据:负结果入库率)。
SOP(每步带触发/回执/失败路径)
- 触发(backlog 提交/预算动作前)→ 写实验卡 → 登记 → 回执:实验卡 ID;失败:未登记一律不执行。
- 执行编排 → 实时护栏监控 → 回执:过程数据;失败:停止条件触发自动停并快照。
- 结论三态(胜/负/不确定)→ 放量或回滚建议 → 回执:结论与依据;失败:样本不足标不可判定。
关键指标(含基准与护栏)
| 指标 | 口径 | 基准/阈值 | 类型 |
|---|---|---|---|
| 实验卡完备率 | 完备卡/开跑实验 | 100% | 护栏 |
| 停止及时率 | 触发即停/触发数 | 100% | 护栏 |
| 假阳性率 | 事后被推翻的"胜"/胜总数 | <10% | 质量 |
| 显著结论占比 | 胜或负/总实验 | 趋势上升 | 领先 |
失败模式(症状 → 检测器 → 处置)
| 症状 | 检测器 | 处置 |
|---|---|---|
| 无卡开跑 | G-GROW3 阻断计数 | 停跑并补卡,责任留痕 |
| 偷看数据凑显著 | 采样审计(偷看次数) | 作废该轮结论 |
| 伦理越界(未 L4) | G-GROW2 拦截计数 | 直接阻断 + 复核链路 |