8.3 抽样与统计推断:从观测数据到有限结论
A/B 实验中 B 组转化率高 0.4 个百分点。这个差异可能来自真实效果、随机波动、分流偏差、指标口径变化或同时上线的其他功能。统计推断不会自动识别因果,它在明确设计和假设下量化不确定性。
总体、样本与估计量
- 总体:想研究的全部对象或过程;
- 样本:实际观察到的数据;
- 参数:总体中未知的量,如均值
μ; - 估计量:样本的函数,如样本均值
X̄。
抽样分布描述在重复抽样下估计量怎样变化。只有一次样本时看不到这个重复过程,但推断公式基于该思想。
数据量大不能修复系统偏差。若只采集成功请求,百万样本也估不出包含失败的真实延迟。
大数定律不是有限次数保证
在适当独立同分布和期望存在等条件下,大数定律说明样本均值随样本量增长收敛到总体期望。
它不表示:
- 抛 10000 次硬币一定接近一半;
- 样本均值随每次新增观测单调靠近;
- 任意相关、重尾过程都快速收敛;
- 一次观测序列能证明分布模型正确。
“收敛”是概率意义或几乎必然意义的渐近结论,有限样本误差仍要量化。
中心极限定理与标准误
对独立同分布、方差有限等常见条件,标准化样本均值的分布随 n 增大趋近标准正态:
(X̄-μ)/(σ/√n) ⇒ N(0,1)均值标准误约为:
SE(X̄)=σ/√n样本量扩大 4 倍,标准误约减半,而不是降到四分之一。
重尾、强相关、集群抽样和极端偏态会让简单近似失效。延迟数据常明显偏态,均值的 CLT 也不等于原始延迟分布近似正态。
置信区间的正确解释
频率学派 95% 置信区间的含义是:若重复使用同一抽样和构造程序,长期约 95% 的区间覆盖固定真参数。
得到具体区间后,参数不是按该频率学派模型以 95% 概率在区间里随机移动。口语中常说“95% 可信”,但正式解释应区分频率置信区间与 Bayesian credible interval。
区间宽度受:
- 样本量;
- 数据方差;
- 置信水平;
- 估计方法和模型假设影响。
窄区间也可能围绕有偏估计,不能只看精度不看抽样设计。
假设检验和 p 值
设零假设 H₀ 表示“无效果”。p 值是在 H₀ 及检验模型成立时,观察到至少同样极端统计量的概率。
p 值不是:
H₀为真的概率;- 结果由随机造成的概率;
- 效果大小;
- 实验可复现的概率。
显著性阈值控制的是长期一类错误率的一部分。还应报告效应量与区间,评估业务意义。
一类错误、二类错误与检验功效
- 一类错误:
H₀真却拒绝它; - 二类错误:存在目标效果却未拒绝
H₀; - 功效:在指定真实效果下正确拒绝
H₀的概率。
样本量规划需要:基线率、最小可检测效果、显著性水平、目标功效和分配比例。实验结束后再根据观察差异决定样本量,会引入选择偏差。
多重比较与持续窥视
同时测试 100 个无效指标,每个以 5% 阈值判断,出现至少一个假阳性的概率会大幅上升。需要预先定义主指标,并使用 Bonferroni、FDR 等适合目标的校正。
每天查看结果,一显著就停止,也会破坏固定样本检验的错误率。可采用预先设计的序贯检验或 alpha spending,而不是随意停止。
A/B 实验的因果前提
随机分配用于让两组在期望上可比。还要检查:
- 样本比例失配;
- 用户跨组污染;
- 网络效应和干扰;
- 新奇效应与时间趋势;
- 指标埋点是否组间一致;
- 实验单位是用户、会话还是请求;
- 重复用户观测是否相关。
请求级随机但用户行为跨请求相关,会低估标准误。集群随机化需要相应分析。
模型概率需要校准
分类器输出 0.8 不自动表示“长期 80% 的这类样本为正”。若要解释成概率,需要评估校准:预测约 0.8 的样本中,真实正例比例是否接近 0.8。
区分:
- 判别能力:正例排序是否优于负例,如 ROC-AUC;
- 校准:概率数值是否匹配频率;
- 决策质量:在具体成本和阈值下结果是否有用。
分布漂移会让历史校准失效,线上需要持续监控。
延迟和 SLO 的统计口径
“95% 请求低于 200 ms”不意味着剩余 5% 可以忽略。若每天一亿请求,5% 是五百万次慢请求。
定义指标时写清:
- 窗口和采样率;
- 成功、失败、重试是否纳入;
- 客户端还是服务端计时;
- 分位数估计方法;
- 分组维度和流量权重;
- 数据丢失怎样处理。
SLO 是产品可靠性目标,不是分布定理。统计估计帮助判断是否满足目标,但目标本身来自用户需求和风险权衡。
完成检查
设计一个转化率 A/B 实验:
- 定义实验单位、总体和随机分配;
- 选择主指标与最小可检测效果;
- 说明样本量和停止规则;
- 报告效应量、置信区间与 p 值;
- 处理多指标和重复用户;
- 列出至少三个会破坏因果解释的实现问题。