← 返回知识库

CRO 单变量实验:从假设到样本量的完整做法

A/B 测试不是"改一版看数据"。从写可证伪的假设、算样本量、跑满周期到设护栏指标,一篇讲清单变量实验的完整纪律,避免把测试做成占卜。

独立站做 CRO(转化率优化)的常见翻车方式高度一致:同时改了标题、主图、按钮颜色和布局,跑了一周,转化率涨了 0.3%,然后所有人都很满意,但没人说得清是哪个改动起了作用,也没人说得清 0.3% 是不是噪音。下一轮改版,还是同样一锅炖。

问题不在工具,在纪律。这篇把单变量实验拆成六个步骤:选题、写假设、算样本量、按规则运行、判定结果、设护栏指标。适合流量已经稳定、想让页面优化变成可积累方法的团队。

CRO A/B 单变量实验示意图
CRO A/B 单变量实验示意图|可可以以出海营销(KK11 Marketing)同主题内容底稿

为什么是单变量,而不是一锅炖

多变量测试(MVT)不是不行,而是有前提:每加一个变量,组合数是相乘的。Shopify 官方博客举过的例子——3 个元素各有 2 个版本产生 8 种组合;3 个标题 × 2 张主图 × 4 种按钮处理就是 24 种组合。流量被切碎后,每个组合分到的样本都不足以得出结论。

对大多数日流量几千以内的独立站:

  • A/B 单变量测试:验证“一个改动是否有效”,流量要求最低,结论最干净
  • 多变量测试:适合高流量页面、且想理解元素之间如何配合的场景,门槛高得多

结论:先把 A/B 纪律跑熟,MVT 留给流量大户。

第一步:用优先级框架选题,而不是拍脑袋

团队会议室里“我觉得应该改 X”的声音,不构成实验清单。常用的打分框架是 PIE(Potential / Importance / Ease),每个想法按三个维度打 1–10 分,取平均分排序:

维度 问的问题 高分特征
Potential 潜力 这个页面/元素现在有多差 跳出高、停留短、加购率明显低于基准
Importance 重要性 多少人看它、对收入影响多大 结账页、高流量 PDP、主落地页
Ease 难度 改起来多快、需要谁 改文案、换图、调按钮自己就能上线

得分最高的前三个进实验队列。低流量低影响的页面(About 页、旧博客)不配进队。

第二步:把想法写成可证伪的假设

每个实验开跑前,写下这句话并存在文档里:

因为我们观察到【数据现象】,我们相信把【具体改动】改成【具体版本】,会让【核心指标】提升【预期幅度】,因为【用户侧理由】。

例:因为 PDP 加购率 2.1% 低于中位口径且滚动数据显示 60% 用户没看到评价区,我们相信把评价摘要上移到价格下方,会让加购率提升 15% 以上,因为首次看到价格的用户会同时看到购买证据。

没有“用户侧理由”的假设(例如“因为竞品是红色的”)不进实验队列。

第三步:算样本量——测试资格线

这一步淘汰大部分“拍脑袋测试”。打开可信的 A/B 测试样本量计算器,输入三个数:

  • 基准转化率: 当前页面的转化率(如加购率 2.1%)
  • 最小可检测提升(MDE): 你认为值得检测的最小变化幅度(如相对提升 15%)
  • 显著性水平与功效: 通常取 95% 置信水平、80% 统计功效

计算器会给出每组所需样本量和预计转化数。两个硬规则:

  1. 算不出所需样本就别开跑。 月流量只够跑一半的实验,等于注定没有结论——把 MDE 调大,或者选流量更大的页面
  2. 转化事件数太少的页面不适合做 A/B。 每组低于几十个转化的实验,结果基本是噪音。这类页面先做定性优化(走查、热力图),不做实验

第四步:按规则运行,戒掉偷看

  • 一次一个实验: 同一页面同时只跑一个测试,别的改动等排队
  • 跑满预估样本量或完整周期: 至少覆盖 1–2 个完整周(含工作日与周末差异),以先到者为准
  • 提前偷看不算数: 某个版本暂时领先就提前结束,是测试结果不可复现的最大来源
  • 流量对半随机分配: 用平台自带 A/B 工具(Shopify 的 A/B 测试功能、广告端的实验工具),不要上午跑 A 下午跑 B

第五步:判定结果——三种出口

跑满周期后只有三种合法结论:

结果 判定 动作
处理组显著优于对照组 达到预设显著水平 上线新版本,记录进实验档案
无显著差异 样本已足,效果未达 MDE 保留原版,假设存疑,记录“未证实”
处理组更差 显著劣化 回滚,检查是否伤了核心体验

“未证实”也是 valuable 的结论——它防止团队六个月后把同一个想法再测一遍。

第六步:护栏指标——局部赢、全局输的保险

核心指标涨了不算完,同时盯护栏:

  • 客单价(AOV): 弹窗折扣换来的转化提升,可能被让利吃掉
  • 退货率与客诉: 更激进的销售话术可能带来更差的客户
  • 页面速度: 新增模块拖慢加载,转化涨 1% 流失 2%

任何护栏指标明显恶化,实验回到判定桌重新讨论。

常见误区

  • 测按钮颜色。 低影响元素上消耗测试名额,PIE 得分应该直接淘汰它
  • 拿不同时期的数据比。 上周 vs 本周不是 A/B,季节、促销、库存都在污染结论
  • 结论写“版本 B 赢了”就归档。 档案里必须有假设原文、样本量、显著水平与护栏数据,否则半年后没人知道当初学到了什么
  • 测试是手段不是目的。 连续三个“未证实”说明页面方向没大问题,把精力转去流量端或产品端

下一步

  1. 把团队最近的五个改版想法写 PIE 打分,选出队列第一名
  2. 写成完整假设句,算出所需样本量
  3. 确认流量资格,用平台工具开跑,定好结束日期
  4. 实验对象不知道选哪个页面的,先读《独立站转化链路排查》找最大流失段;PDP 的具体模块审查见《产品详情页高转化信息结构》

参考资料

  • Shopify:什么是 A/B 测试
  • Shopify:多变量测试(MVT)说明

计算器与平台功能以当前版本为准;文中中位口径引用见《独立站转化链路排查》参考资料部分。

KK11 GROWTH

CRO 实验,从假设到样本量

实验设计、样本量计算、护栏指标与复盘,我们帮你把 CRO 从"改改看"变成可积累的方法。

LET'S TALK

让出海更简单
让增长更确定

告诉我们你的业务阶段与当前问题,先判断下一步最值得做什么。

预约一次免费诊断 ↗