跳到内容

8.3 DAG 与观察性识别:控制变量也可能制造偏差

训练时长无法随机分配,指挥部仍要判断延长训练是否提高任务成功率。把经验、伤情、任务难度等所有字段都塞进回归,看起来“控制得很充分”,却可能控制了训练造成的中间结果,或打开一条原本关闭的对撞路径。

观察性因果推断的核心不是某个算法,而是:哪些假设让数据中的比较等价于目标反事实比较?

本课目标

  • 用 DAG 区分混杂、媒介与对撞变量;
  • 写出一致性、可交换性和正值性假设;
  • 理解回归、匹配和加权能够解决与不能解决的问题;
  • 审查工具变量、差分中的差分和回归不连续的识别条件。

1. 从相关问题改写为因果问题

先写目标试验的基本要素:

  • 符合条件的总体;
  • 处理策略及其时间零点;
  • 对照策略;
  • 结果与随访窗口;
  • 分配机制;
  • estimand 与分析方案。

例如“训练较多的队伍成功率更高”只是关联;“对符合条件队伍,把训练从 10 小时增加到 20 小时,对未来 30 天任务成功率的平均影响”才接近可识别问题。

时间零点必须一致。若处理组从开始训练时入组,对照组却从任意日期起算,会产生 immortal time 等时间偏差。

2. DAG 表达的是假设

考虑:

text
经验 ──→ 训练时长 ──→ 协作熟练度 ──→ 成功率
  └────────────────────────────→ 成功率

训练时长 ──→ 受伤 ──← 任务难度 ──→ 成功率
  • 经验同时影响处理与结果,是混杂变量;
  • 协作熟练度位于处理到结果的路径上,是媒介;
  • 受伤由训练时长和任务难度共同导致,是对撞变量。

估计训练的总效应时,应阻断经验造成的后门路径,但通常不控制协作熟练度;在这个图里控制受伤还会打开 训练时长 → 受伤 ← 任务难度 → 成功率 路径。

DAG 的箭头来自领域知识、时间顺序和机制证据,不是从相关矩阵自动生成真相。遗漏变量的节点即使没有数据也应画出来,因为它决定识别是否可能。

3. 三个基础识别条件

一致性

观测到接受处理 $A=a$ 的单位,其结果等于对应潜在结果 $Y(a)$。这要求“20 小时训练”不是多个效果不同却混为一类的版本。

条件可交换性

给定充分的处理前混杂变量 $L$ 后:

$$ Y(a)\perp A\mid L. $$

它意味着没有剩余的未测混杂,是观察数据本身通常无法验证的假设。

正值性

在每个需要推广的 $L$ 组合中,各处理都有正概率:

$$ 0<P(A=a\mid L=l)<1. $$

若最危险任务从不接受短训练,就无法从数据比较该群体的两种策略。模型外推不能制造真实重叠。

4. 调整集不是“所有可用变量”

合适调整集应阻断处理与结果之间所有后门路径,且不包含处理后变量或会打开路径的对撞变量。

处理前变量也不必全部控制:某些工具变量式变量强烈预测处理但不直接预测结果,在有限样本中可能增加方差并放大未测混杂偏差。变量选择应由因果图和 estimand 指导,再考虑统计效率。

“分层后相关系数变小”不是充分因果分析。需要直接估计目标效应,并传播模型与抽样不确定性。

5. Outcome regression、匹配与加权

结果模型

拟合 $E[Y\mid A,L]$,再为每个单位分别预测 $A=1$ 与 $A=0$ 下结果并平均。正确性依赖结果模型足够合理。

倾向评分

倾向评分 $e(L)=P(A=1\mid L)$ 描述给定混杂变量后的处理概率。它可用于匹配、分层或逆概率加权。

ATE 的稳定权重形式可按具体目标定义;无论哪种,都要检查:

  • 处理组与对照组 propensity overlap;
  • 加权后的协变量平衡,而非只看 propensity 模型 AUC;
  • 极端权重和有效样本量;
  • 权重截尾与模型选择的敏感性。

匹配只能平衡已测且进入设计的变量。匹配后直接使用独立样本标准误也可能不正确。

双重稳健方法

把结果模型与处理模型结合,在适当条件下其中一个正确即可保持一致性。但“双重稳健”不防未测混杂、正值性违反或错误时间顺序。

6. 工具变量的四道审查

工具 $Z$ 用于处理 $A$ 和结果 $Y$ 时,至少要论证:

  1. 相关性:$Z$ 确实改变 $A$;
  2. 独立性:$Z$ 与影响结果的未测因素独立;
  3. 排除限制:$Z$ 只通过 $A$ 影响 $Y$;
  4. 处理版本与干扰假设符合目标解释。

在不依从随机试验中,若再加入单调性等条件,常识别的是 compliers 的局部平均处理效应(LATE),不一定是总体 ATE。

弱工具会使估计不稳定并放大有限样本偏差。第一阶段显著不是完整证明;应报告强度诊断、置信区间和对排除限制的机制论证。

7. 准实验仍依赖设计

差分中的差分(DiD)

比较处理组与对照组在干预前后的变化差。关键是适当的平行趋势假设,而不是“有前后数据就能做”。应检查干预前趋势、提前反应、同时发生的政策、组成变化和错位采用下的估计问题。

回归不连续(RD)

处理由阈值附近的 running variable 决定。识别阈值附近的局部效应,依赖单位不能精确操纵阈值、潜在结果在阈值处连续等条件。带宽和函数形式需做稳健性分析。

自然实验

“自然发生”不等于随机。必须解释外生变化为何只通过目标处理影响结果,以及谁受到影响。

8. 敏感性分析与反证

观察性结论要展示在假设变化下是否稳定:

  • 改变调整集、模型形式、带宽或权重截尾;
  • 用负对照结果/暴露检查不应存在的关系;
  • 检查处理前结果是否被“处理”预测;
  • 量化多强的未测混杂才能推翻结论;
  • 报告 overlap 不足的群体并缩小目标总体;
  • 将不同识别策略的结果并列,而不是只挑有利者。

敏感性分析不能证明假设成立,但能说明结论依赖它到什么程度。

9. 因果报告最少包含什么

text
目标试验与 estimand
数据来源、纳入规则和时间零点
DAG 与调整集理由
识别假设及其不可检验部分
重叠、平衡和权重诊断
主效应、区间与绝对风险
替代模型和敏感性分析
适用总体与不能回答的问题

常见误区

  • 控制变量越多越接近因果:媒介和对撞变量可能改变或制造偏差。
  • propensity score 匹配等于随机实验:它只处理已测混杂并依赖重叠。
  • 工具与处理显著相关就够了:独立性和排除限制通常更难论证。
  • DAG 从数据学出来就客观:纯观测分布通常不能唯一确定因果方向。

练习

  1. 为训练时长、经验、协作熟练度、受伤和成功率画 DAG,并选择总效应调整集。
  2. 用模拟数据展示控制对撞变量如何制造关联。
  3. 做倾向评分加权,报告加权前后标准化差异、overlap 和有效样本量。
  4. 审查一个候选工具变量的相关性、独立性、排除限制和目标 estimand。

小结

因果推断不是把相关分析换成更复杂模型,而是让目标试验、因果图、时间顺序和识别假设彼此一致。方法只能执行假设,不能替你证明假设。

下一章处理规模问题:当单机内存容不下数据时,先理解分区、shuffle、容错和执行语义,再决定是否采用分布式系统。

Built with VitePress | Software Systems Atlas