Appearance
第 16 章:因果推断基础
统计关联描述“共同出现”,因果效应回答“如果把同一个研究对象的处理状态改变,结果会怎样”。从关联跨越到因果,需要研究设计或不可由数据单独验证的识别假设。
0. 知识图谱
图表渲染中…
因果分析必须依次回答:
- 处理、结果和目标总体是什么?
- 目标因果量是什么?
- 哪些假设使它能由观测分布识别?
- 在识别成立后,用什么估计量?
- 哪些诊断和敏感性分析能说明结论是否稳健?
1. 二元变量的关联度量
令
1.1 风险差
它有直接的概率差解释。例如
1.2 风险比
1.3 优势比
当结果罕见时,
若各单元格概率均为正,则
但它们对效应大小的刻画不同。
2. 混杂与 Simpson 悖论
混杂变量
肾结石治疗例子
汇总数据中:
| 治疗 | 成功 | 失败 | 成功率 |
|---|---|---|---|
| 开放手术 | 273 | 77 | 78.0% |
| 小穿刺 | 289 | 61 | 82.6% |
边缘上似乎小穿刺更好。但结石大小同时影响治疗选择和成功率。按结石大小分层后,两个层内都可能显示开放手术成功率更高。
反转的原因不是算术矛盾,而是两种治疗面对的病例构成不同:更困难的大结石更常接受开放手术。边缘成功率混合了处理效应和病例严重程度。
因此
通常只是关联,不自动等于因果效应。
3. 潜在结果模型
对个体
观测结果满足一致性关系
每个个体只能处于一种处理状态,所以只能看到两个潜在结果之一。缺失的那个是反事实。这就是因果推断的基本困难。
3.1 个体处理效应
通常无法直接识别,因为无法同时观察同一个体的两种状态。
3.2 平均处理效应
它针对目标总体的平均因果效应。
3.3 ATT 与 ATC
若处理组比例为
ATE、ATT 与 ATC 面向不同人群,在效应异质时数值可能明显不同。
4. SUTVA、一致性与干扰
稳定单元处理值假设通常包括:
- 处理版本明确:同一个
不应混合实质不同的干预; - 无个体间干扰:个体
的结果只取决于自己的处理,而不取决于他人的处理。
若疫苗接种具有群体免疫、社交网络中的信息会扩散、班级教学会影响同学,则无干扰可能失败。此时潜在结果应写成整个处理向量的函数
需要定义直接效应、溢出效应或总体策略效应。
5. 随机化实验
随机化使处理分配独立于潜在结果:
于是
从而
随机化把因果效应转化为可观测均值差,这是实验被称为因果识别“黄金标准”的原因。
5.1 Bernoulli 随机化
每个个体独立地以概率
优点是分配独立、实施简单;缺点是处理组人数随机,极端情况下可能严重不平衡。
5.2 完全随机化
固定恰好
种分配中等概率抽取。组容量精确平衡,但不同个体的处理指标并不独立。
5.3 分层随机化
按预处理协变量(如性别、医院、疾病阶段)分层,在每层内完全随机化。这样能保证关键离散协变量在处理组和对照组内平衡。
5.4 重随机化
连续或高维协变量难以精确分层时,可反复生成完全随机分配,只有在平衡准则满足时才接受。例如使用协变量均值差的 Mahalanobis 距离
并要求
6. Fisher 随机化检验
考虑 sharp null
在该假设下,观测到的
步骤:
- 固定观测结果
; - 按实验设计生成所有或大量允许的处理分配
; - 计算每个分配下的统计量
; - 计算至少与实际统计量同样极端的比例。
Monte Carlo 随机化 p 值常写为
加 1 可以避免有限模拟下得到 0。
sharp null 比
7. 观察性研究的识别假设
7.1 条件可忽略性
含义是:给定观测协变量
这个假设无法仅由观测数据检验,因为它涉及从未同时观察的潜在结果。其合理性依赖研究设计、领域知识以及是否测量了所有共同原因。
7.2 Positivity / Overlap
应在目标总体中的所有相关
positivity 分为:
- 结构性违反:某类人按制度绝不可能接受某处理;
- 有限样本重叠差:理论概率非零,但样本中几乎没有对应个体。
前者需要重新定义目标总体或 estimand,后者导致高方差和模型外推。
7.3 识别公式
在一致性、条件可忽略性和 positivity 下,
因此
其中
这就是 outcome regression / g-formula 的基础。
8. 分层估计
若
再按目标总体层比例加权:
它直观地实现了“只比较背景相同的人”。但当协变量很多时,层数指数增长,大量层会为空,这就是维数灾难。
9. 回归调整
拟合结果模型
再标准化到目标样本:
9.1 线性模型
最简单模型
假定处理效应在所有
则条件效应为
若协变量先中心化,
9.2 二元结果
可用 logistic 回归估计条件概率,但 ATE 应由预测概率差计算:
logistic 模型中
10. 倾向得分
倾向得分定义为
若处理在给定
同时,倾向得分具有平衡性质
这使高维协变量调整可转化为倾向得分分层、加权或匹配。但倾向得分不是结果模型,也不应只按处理预测准确率评价。真正要检查的是调整后的协变量平衡。
11. 逆概率加权
利用恒等式
可得 Horvitz-Thompson 型估计量
每个个体按“接受自己实际处理的概率倒数”加权,从而构造一个加权伪总体,使处理与协变量近似独立。
11.1 Hájek 归一化
归一化估计通常在有限样本更稳定,但会引入小量偏差。
11.2 权重诊断
必须检查:
- 倾向得分在两组的重叠区间;
- 最大权重与权重分布;
- 加权后协变量标准化均值差;
- 有效样本量
极端权重表明某些反事实只能依靠少量观测推断。截尾或稳定权重可降低方差,但会改变偏差与目标总体,应明确报告。
12. 双稳健与 AIPW
把结果回归与倾向得分加权结合:
结构可理解为
双稳健性质:若结果模型
双稳健不等于“双重保险”:
- 两个模型都严重错误时可能表现更差;
- positivity 差时残差修正仍可能被极端权重放大;
- 使用复杂机器学习时,应通过样本拆分或 cross-fitting 减少过拟合带来的经验过程偏差。
13. 匹配
匹配为处理组个体寻找协变量相近的对照,反之亦然,以近似填补缺失潜在结果。
常见选择:
- 最近邻匹配;
- 是否允许重复使用对照;
- 1 对 1 或 1 对多;
- caliper:只允许距离小于阈值;
- 在原始协变量、Mahalanobis 距离或倾向得分上匹配。
匹配后的关键不是“匹配算法运行成功”,而是:
- 匹配后协变量是否平衡;
- 丢弃了哪些个体,目标 estimand 是否从 ATE 变成重叠人群或 ATT;
- 标准误是否考虑匹配结构和重复匹配;
- 是否仍可能存在未观测混杂。
倾向得分把多维协变量压缩为一维平衡分数,但不同倾向分相近不保证每一个关键协变量都在有限样本中平衡,因此仍需逐项诊断。
14. 不依从与主层类型
设
按二者组合分为:
| 类型 | 含义 | ||
|---|---|---|---|
| 始终接受者 | 1 | 1 | 无论分配如何都接受 |
| 依从者 | 1 | 0 | 按分配行动 |
| 反抗者 | 0 | 1 | 与分配相反 |
| 从不接受者 | 0 | 0 | 无论分配如何都不接受 |
随机分配
对实际处理的第一阶段效应为
15. 工具变量与 LATE
把
- 相关性:
确实改变 ; - 独立性:
与潜在结果、潜在处理类型独立; - 排除限制:
只通过 影响 ; - 单调性:
,没有反抗者。
在这些条件下,依从者局部平均处理效应
LATE 只属于由工具变量推动而改变处理状态的依从者,不一定能推广为 ATE。
15.1 线性 IV 与两阶段最小二乘
结构模型
中,若
- 第一阶段用
回归 ,得到 ; - 第二阶段用
回归 。
实际标准误不能把第二阶段当作普通回归直接计算,应使用正确的 2SLS 方差公式或软件实现。
弱工具使第一阶段信号很小,导致有限样本偏差、重尾分布和不可靠置信区间。第一阶段显著并不自动证明排除限制成立。
16. 阴性对照
当担心未观测混杂
16.1 阴性对照暴露
变量
16.2 阴性对照结果
变量
阴性对照最直接的用途是诊断。若希望进一步非参数识别因果效应,还需要完备性、桥函数或离散矩阵可逆等额外条件,不能仅凭一个阴性对照变量自动消除混杂。
17. 识别、估计与检验必须分开
因果分析常见的逻辑错误是:估计方法很复杂,于是误以为因果假设也被验证。实际上:
- 识别:在总体层面,观测分布和假设是否唯一决定目标因果量;
- 估计:有限样本中如何逼近已识别的量;
- 推断:如何量化估计误差;
- 敏感性分析:识别假设偏离时结论如何变化。
回归、神经网络、倾向得分或双稳健方法主要解决估计问题。若存在未测量混杂,它们不能仅靠拟合能力恢复不存在的信息。
18. 实际分析流程
第一步:定义 estimand
明确 ATE、ATT、LATE、风险差、风险比,或某个时间点的平均结果。先定义目标,后选择算法。
第二步:画出因果结构
列出处理前共同原因、处理后的中介、碰撞点和潜在工具变量。不要机械地“控制所有变量”:控制中介会改变目标效应,控制碰撞点可能引入偏差。
第三步:说明识别假设
随机化、条件可忽略性、positivity、排除限制、单调性等必须明确写出。
第四步:检查设计与重叠
查看处理组/对照组样本量、倾向得分重叠、权重、协变量平衡和缺失机制。
第五步:使用至少一种主分析方法
根据设计选择均值差、分层、回归、IPW、AIPW、匹配或 IV。
第六步:量化不确定性
使用与设计和估计量相匹配的解析标准误、bootstrap、随机化分布或影响函数。
第七步:做敏感性分析
改变模型规格、权重截尾、目标人群、未观测混杂强度或排除限制,检查结论是否稳定。
19. 常见错误
错误 1:把显著回归系数直接叫作因果效应
回归系数只有在处理定义、无混杂、一致性、positivity 和模型条件成立时才有相应因果解释。
错误 2:把 propensity score 当成结果预测分数
倾向得分建模的目标是实现协变量平衡,不是最大化 AUC。
错误 3:忽略 overlap
即使模型能输出 0.001 或 0.999 的概率,也不表示数据对相应反事实有充分支持。
错误 4:把双稳健理解为永远可靠
双稳健要求两个工作模型至少一个正确,且仍依赖因果识别假设和重叠。
错误 5:把 LATE 报告成总体平均效应
LATE 针对依从者,其人群由具体工具变量定义。
错误 6:根据观测结果事后修改随机化规则
随机化检验必须按真实设计产生零分布。
20. 本章复习清单
| 核心内容 | 需要做到 |
|---|---|
| 关联量 | 会计算并区分 RD、RR、OR |
| Simpson 悖论 | 能解释分层与汇总方向为何反转 |
| 潜在结果 | 会定义 |
| 基本困难 | 说明为何个体效应通常不可直接观察 |
| 随机化 | 区分 Bernoulli、完全、分层与重随机化 |
| 随机化检验 | 理解 sharp null 与分配零分布 |
| 可忽略性 | 会写 |
| Positivity | 理解无重叠为何导致不可识别或外推 |
| 回归估计 | 会写 g-formula 标准化估计 |
| IPW | 会写 HT、Hájek 并检查极端权重 |
| AIPW | 会解释结果模型和倾向模型的两项修正 |
| 匹配 | 能区分匹配算法与平衡诊断 |
| IV/LATE | 会写 Wald 比率并说明四个关键假设 |
| 阴性对照 | 理解诊断作用与额外识别条件 |
21. 全章主线
text
相关不等于因果
-> 用潜在结果定义“改变处理会怎样”
-> 用随机化或可忽略性等假设识别反事实均值
-> 用回归、加权、匹配或双稳健方法估计
-> 当无混杂不可信时考虑 IV、阴性对照与敏感性分析
-> 始终区分目标人群、识别假设、估计误差与可推广性