5.2 检验选择、功效与多重比较:分析计划先于结果
统计软件可以对任何两列返回一个 p 值。真正困难的是选择正确的分析单位、比较结构和误差模型,并在看结果之前写下决策规则。
本课目标
- 根据结果类型、设计和依赖结构选择方法;
- 同时报告原始尺度效应、标准化效应和区间;
- 用功效分析连接样本量与最小有意义效应;
- 控制多重比较、选择性报告和可选停止。
1. 检验方法由研究设计决定
| 场景 | 常见起点 | 关键前提或替代 |
|---|---|---|
| 两独立组连续指标 | Welch t 检验 | 独立单位;长尾时看稳健/置换方法 |
| 同一单位前后测 | 配对 t 检验 | 配对差值为分析对象 |
| 二分类结果 | 比例差/score 检验、logistic 模型 | 保留分子分母;小样本需调整 |
| 多组连续结果 | ANOVA/回归 | 先定义总体比较与后续 contrasts |
| 计数或率 | Poisson/负二项模型 | exposure、过度离散 |
| 重复测量/集群 | cluster-robust、GEE、混合模型 | 聚类数量与层级结构 |
| 生存时间 | Kaplan–Meier/Cox 等 | censoring 与比例风险等假设 |
这张表不是自动选择器。随机分配、缺失、协变量调整和测量误差都会影响方法。
2. 配对数据不要拆成独立组
同一队伍在新旧方案下各完成一次任务,应该分析每对差值:
$$ d_i=Y_{i,new}-Y_{i,old}. $$
配对利用单位内相关性,通常降低噪声。用独立 t 检验会忽略配对,并可能损失功效。
反过来,把并不一一对应的记录强行按时间最近配对,会引入选择偏差。配对规则属于设计,最好在观察结果前固定。
3. 效应量先报告原始尺度
平均时长差:-4.2 分钟
完成率差:+3.1 个百分点
相对风险:1.08原始尺度能直接对应业务成本和最小有意义差异。Cohen's $d$ 等标准化效应便于跨尺度比较,但依赖标准差;群体异质性改变时,$d$ 也会变化。
“0.2/0.5/0.8 是小中大”只是特定背景下的粗略惯例,不应替代领域阈值。对于安全事件,极小相对变化也可能重要;对高波动体验指标,更大变化才值得发布。
4. 最小有意义效应连接决策
在收集数据前定义 MDE 或 practical threshold:小于这个差异,即使存在,也不会改变行动。
样本量取决于:
- 显著性水平;
- 目标功效 $1-\beta$;
- 基线率或方差;
- MDE;
- 分配比例;
- 集群、重复测量和流失;
- 多重比较计划。
功效不是“研究成功的概率”的无条件保证。它是在指定真实效应和模型假设下拒绝零假设的概率。输入假设过于乐观,样本量仍会不足。
5. 结果后功效通常不提供新信息
把观测效应代回公式计算“observed power”,通常只是 p 值的变形,不能解释不显著结果。更有用的是:
- 预先功效与样本量设计;
- 报告估计区间覆盖哪些有意义效应;
- 做敏感性分析;
- 若目标是排除大效应,使用区间或等效性设计。
6. 多重比较改变错误率
若在 100 个真正无效指标上各以 $\alpha=0.05$ 检验,期望约有 5 个假阳性;至少出现一个的概率更高。
常见控制目标:
- FWER:出现任何一个假阳性的概率,如 Bonferroni/Holm;
- FDR:所有拒绝中假发现的期望比例,如 Benjamini–Hochberg。
选择取决于后果。安全阻断可能重视 FWER;大规模探索筛选可能使用 FDR。校正集合必须预先定义,不能只把不喜欢的检验排除在 family 外。
7. 可选停止会膨胀错误率
每天查看普通 p 值,一显著就停止,并不保持固定样本 t 检验的 5% 错误率。可使用:
- 预定固定样本量与结束时间;
- group sequential 设计与 alpha spending;
- always-valid inference / sequential 方法;
- 明确 futility 与 safety 停止规则。
业务监控可以天天看描述指标,但确认性决策要遵守预定分析规则。
8. 协变量调整应预先指定
随机实验中,基线协变量调整可提高精度;调整后的模型仍需匹配随机化单位与聚类结构。看到结果后尝试许多协变量组合,再挑显著模型,会引入 researcher degrees of freedom。
报告未调整与预设调整结果,并说明缺失协变量处理。随机化保证的是处理分配机制,不保证每个有限样本所有协变量完全平衡。
9. 一份可审计的报告
问题与 estimand
样本来源、排除和时间窗口
分配/抽样单位与依赖结构
主指标与 MDE
预设检验、单/双侧、alpha
点估计、95% CI、原始尺度效应
p 值与多重比较方法
缺失、流失和协议偏离
敏感性与分组分析(标记探索性)
业务决策及仍未确定的范围不要只输出“显著/不显著”。例如区间 [-1.0, 7.2] 个百分点同时容纳轻微损害和有意义收益,正确结论是当前精度不足,而不是“没有效果”。
10. 置换检验也要遵守设计
置换检验通过在零假设下交换标签建立参考分布。只有可交换性成立时才有效:集群随机实验应在集群层置换,配对设计在配对内交换,分层随机应在层内置换。
“非参数”不等于没有假设。置换单位错了,p 值同样会过于乐观。
常见误区
- 数据不正态就一律换 Mann–Whitney:它检验的分布关系不总等同均值或中位数差。
- 标准化效应有统一大小标准:业务意义取决于原始尺度和后果。
- 看结果后计算功效能解释不显著:区间和预先设计更有用。
- 只要逐个 p<0.05 就行:多重比较与可选停止会放大假阳性。
练习
- 为独立、配对和集群三种设计分别确定分析单位。
- 给一个完成率实验定义 MDE,并列出样本量计算所需输入。
- 比较 Holm 与 BH 控制的错误目标。
- 把一份只有 p 值的报告改写为可审计模板。
小结
检验是研究设计的延伸,不是数据列类型的自动函数。效应尺度、MDE、功效、多重比较和停止规则必须在结果之前确定;最终报告要展示不确定范围,而不是只给显著性标签。
下一章用线性回归组织多个变量之间的条件关系。第一步会区分预测与因果解释,避免把一个高 $R^2$ 模型当成机制证明。