跳到内容

5.2 检验选择、功效与多重比较:分析计划先于结果

统计软件可以对任何两列返回一个 p 值。真正困难的是选择正确的分析单位、比较结构和误差模型,并在看结果之前写下决策规则。

本课目标

  • 根据结果类型、设计和依赖结构选择方法;
  • 同时报告原始尺度效应、标准化效应和区间;
  • 用功效分析连接样本量与最小有意义效应;
  • 控制多重比较、选择性报告和可选停止。

1. 检验方法由研究设计决定

场景常见起点关键前提或替代
两独立组连续指标Welch t 检验独立单位;长尾时看稳健/置换方法
同一单位前后测配对 t 检验配对差值为分析对象
二分类结果比例差/score 检验、logistic 模型保留分子分母;小样本需调整
多组连续结果ANOVA/回归先定义总体比较与后续 contrasts
计数或率Poisson/负二项模型exposure、过度离散
重复测量/集群cluster-robust、GEE、混合模型聚类数量与层级结构
生存时间Kaplan–Meier/Cox 等censoring 与比例风险等假设

这张表不是自动选择器。随机分配、缺失、协变量调整和测量误差都会影响方法。

2. 配对数据不要拆成独立组

同一队伍在新旧方案下各完成一次任务,应该分析每对差值:

$$ d_i=Y_{i,new}-Y_{i,old}. $$

配对利用单位内相关性,通常降低噪声。用独立 t 检验会忽略配对,并可能损失功效。

反过来,把并不一一对应的记录强行按时间最近配对,会引入选择偏差。配对规则属于设计,最好在观察结果前固定。

3. 效应量先报告原始尺度

text
平均时长差:-4.2 分钟
完成率差:+3.1 个百分点
相对风险:1.08

原始尺度能直接对应业务成本和最小有意义差异。Cohen's $d$ 等标准化效应便于跨尺度比较,但依赖标准差;群体异质性改变时,$d$ 也会变化。

“0.2/0.5/0.8 是小中大”只是特定背景下的粗略惯例,不应替代领域阈值。对于安全事件,极小相对变化也可能重要;对高波动体验指标,更大变化才值得发布。

4. 最小有意义效应连接决策

在收集数据前定义 MDE 或 practical threshold:小于这个差异,即使存在,也不会改变行动。

样本量取决于:

  • 显著性水平;
  • 目标功效 $1-\beta$;
  • 基线率或方差;
  • MDE;
  • 分配比例;
  • 集群、重复测量和流失;
  • 多重比较计划。

功效不是“研究成功的概率”的无条件保证。它是在指定真实效应和模型假设下拒绝零假设的概率。输入假设过于乐观,样本量仍会不足。

5. 结果后功效通常不提供新信息

把观测效应代回公式计算“observed power”,通常只是 p 值的变形,不能解释不显著结果。更有用的是:

  • 预先功效与样本量设计;
  • 报告估计区间覆盖哪些有意义效应;
  • 做敏感性分析;
  • 若目标是排除大效应,使用区间或等效性设计。

6. 多重比较改变错误率

若在 100 个真正无效指标上各以 $\alpha=0.05$ 检验,期望约有 5 个假阳性;至少出现一个的概率更高。

常见控制目标:

  • FWER:出现任何一个假阳性的概率,如 Bonferroni/Holm;
  • FDR:所有拒绝中假发现的期望比例,如 Benjamini–Hochberg。

选择取决于后果。安全阻断可能重视 FWER;大规模探索筛选可能使用 FDR。校正集合必须预先定义,不能只把不喜欢的检验排除在 family 外。

7. 可选停止会膨胀错误率

每天查看普通 p 值,一显著就停止,并不保持固定样本 t 检验的 5% 错误率。可使用:

  • 预定固定样本量与结束时间;
  • group sequential 设计与 alpha spending;
  • always-valid inference / sequential 方法;
  • 明确 futility 与 safety 停止规则。

业务监控可以天天看描述指标,但确认性决策要遵守预定分析规则。

8. 协变量调整应预先指定

随机实验中,基线协变量调整可提高精度;调整后的模型仍需匹配随机化单位与聚类结构。看到结果后尝试许多协变量组合,再挑显著模型,会引入 researcher degrees of freedom。

报告未调整与预设调整结果,并说明缺失协变量处理。随机化保证的是处理分配机制,不保证每个有限样本所有协变量完全平衡。

9. 一份可审计的报告

text
问题与 estimand
样本来源、排除和时间窗口
分配/抽样单位与依赖结构
主指标与 MDE
预设检验、单/双侧、alpha
点估计、95% CI、原始尺度效应
p 值与多重比较方法
缺失、流失和协议偏离
敏感性与分组分析(标记探索性)
业务决策及仍未确定的范围

不要只输出“显著/不显著”。例如区间 [-1.0, 7.2] 个百分点同时容纳轻微损害和有意义收益,正确结论是当前精度不足,而不是“没有效果”。

10. 置换检验也要遵守设计

置换检验通过在零假设下交换标签建立参考分布。只有可交换性成立时才有效:集群随机实验应在集群层置换,配对设计在配对内交换,分层随机应在层内置换。

“非参数”不等于没有假设。置换单位错了,p 值同样会过于乐观。

常见误区

  • 数据不正态就一律换 Mann–Whitney:它检验的分布关系不总等同均值或中位数差。
  • 标准化效应有统一大小标准:业务意义取决于原始尺度和后果。
  • 看结果后计算功效能解释不显著:区间和预先设计更有用。
  • 只要逐个 p<0.05 就行:多重比较与可选停止会放大假阳性。

练习

  1. 为独立、配对和集群三种设计分别确定分析单位。
  2. 给一个完成率实验定义 MDE,并列出样本量计算所需输入。
  3. 比较 Holm 与 BH 控制的错误目标。
  4. 把一份只有 p 值的报告改写为可审计模板。

小结

检验是研究设计的延伸,不是数据列类型的自动函数。效应尺度、MDE、功效、多重比较和停止规则必须在结果之前确定;最终报告要展示不确定范围,而不是只给显著性标签。

下一章用线性回归组织多个变量之间的条件关系。第一步会区分预测与因果解释,避免把一个高 $R^2$ 模型当成机制证明。

Built with VitePress | Software Systems Atlas