Skip to content
  • 可交换性是关联等于因果的数学条件
  • Rubin反事实与Pearl因果图是互补而非对立
  • 标准化与IPW是控制混杂的镜像方法
  • 正值性是IPW最脆弱的假设权重易爆炸
  • 效应修饰需报告混杂需控制本质不同
  • 优势比不可折叠性是被滥用的根源
  • SUTVA是因果推断最脆弱假设干扰
  • ITT保护可交换性而非估计真实依从效应
  • IV估计LATE非ATE依从者局限---

关联不等于因果——可交换性是两者之间的数学分界线,而控制混杂就是让数据逼近可交换性

因果推断的核心问题

每个因果问题都可以归结为同一个形式:如果让同一群人既接受处理又不接受处理,结果的差异就是因果效应。但同一个人不能同时处于两种状态——这是「因果推断的根本问题」(Holland, 1986)。

因此我们退而求其次:如果处理组和对照组在除了处理之外的所有方面都相同,那么两组结果的差异就可以归因于处理。这个条件就是可交换性

\[Y^a \perp\!\!\!\perp A\]

在可交换性下,观察到的关联等于因果效应。随机化(RCT)通过物理手段强制可交换性成立。观察性研究中,可交换性不成立——两组在基线就不同——这就是混杂

两种因果语言:互补而非对立

Rubin 的潜在结果框架Pearl 的因果图(DAG)被视为「两种因果推断学派」,但这个对立是人为的:

Rubin 框架 Pearl 框架
起点 个体潜在结果 Y¹, Y⁰ 变量间的因果图
核心问题 「如何估计缺失的反事实?」 「哪些变量应该/不应该控制?」
混杂处理 通过方法(IPW、标准化、匹配)创造可交换性 通过后门准则识别需要控制的变量
优势 与统计估计方法无缝连接 直观地可视化假设

Pearl 的框架告诉你该控制哪些变量,Rubin 的框架告诉你控制之后如何估计效应。两者不矛盾——它们分别解决了「识别」和「估计」两个不同的问题。

DAG 的实用价值:后门准则告诉你「控制 X、Y、Z 就足够消除混杂」——不需要控制所有变量,只需要阻断所有后门路径。相反,控制对撞变量(collider)会引入偏倚——这是标准教科书很少强调的一点。

控制混杂的两种镜像方法

给定一组足以实现条件可交换性的协变量 L,有两种对称的方法来估计因果效应:

标准化(G-formula):建模「给定 L 后 Y 的条件期望」,然后对 L 的分布取平均。 $\(E[Y^a] = \sum_l E[Y|A=a, L=l] \cdot P(L=l)\)$

逆概率加权(IPW):建模「给定 L 后被分配处理 A 的概率」,然后用权重建构伪人群。 $\(E[Y^a] = E\left[\frac{I(A=a) \cdot Y}{P(A=a|L)}\right]\)$

两者是镜像:G-formula 建模结局,IPW 建模处理分配。G-formula 依赖结局模型的正确指定,IPW 依赖倾向评分模型的正确指定——双重稳健估计结合两者,只要有一个模型正确就得到一致估计。

正值性(positivity)是 IPW 最脆弱的假设:如果某些 L 值下 P(A=1|L) ≈ 0 或 1,IPW 权重会爆炸。这是实践中最容易被忽视的因果推断失败模式——不是你选错了方法,而是你的数据中某些亚组「根本没有变异性」。

效应修饰 ≠ 混杂——一个要描述,一个要消除

效应修饰 混杂
本质 真实的生物学/科学现象 偏倚来源
处理 描述和分层报告 消除或控制
分层后 各层效应不同 各层效应趋于相同

混淆两者的后果:有人发现「亚组分析显示药物在男性中有效、女性中无效」就声称发现了效应修饰——但如果性别同时混杂了药物分配(医生更倾向给男性开药),这实际上是混杂,不是效应修饰。

优势比的不可折叠性(non-collapsibility)进一步复杂化了效应修饰的判断:OR 是一种非可折叠的效应度量——即使不存在真实的效应修饰,不同层的 OR 也可能不同,仅仅因为基线风险不同。这就是为什么临床研究越来越多地转向风险差(RD)作为主要效应度量——RD 是可折叠的。

跨域链接

  • → 概念笔记「因果推断方法阵营」:本笔记讨论因果推断的基本原理——可交换性、识别 vs 估计、混杂控制。方法阵营对比笔记在此基础上展开:给定这些原理,不同的方法(IV/DID/RDD/PSM)如何在不同的数据结构和假设条件下实现它们?
  • → 概念笔记「机器学习失败金字塔」:预测模型只需要相关(「哪些客户会流失?」),因果模型需要反事实识别(「做什么能留住他们?」)。混淆两者是 ML 项目失败的根本原因之一
  • → 概念笔记「频率推断核心张力」:因果推断中控制变量的选择(哪些协变量入回归?)本质上也是多重假设检验问题——每个「试试加一个变量看 p 值变不变」都是 p-hacking
  • → 概念笔记「贝叶斯与频率学派分歧」:贝叶斯因果推断(贝叶斯网络、概率图模型)提供了处理先验因果知识的自然框架——这与 Pearl 的 DAG 因果关系不是竞争而是互补
  • → 概念笔记「概率分布选择不是数学偏好」:因果推断中效应度量的选择(RD/RR/OR)与分布族的选择共享同一个底层逻辑——选择的不是统计特征,而是「这个度量在目标受众的认知框架下是否有意义」

追加——2026-06-29:可交换性的边界——SUTVA、ITT 与「估计的是什么因果量」

SUTVA——可交换性之外最脆弱的假设

即使可交换性通过随机化得到保证,SUTVA(Stable Unit Treatment Value Assumption)要求: 1. 一个人的处理分配不影响另一个人的结局(无干扰) 2. 处理对所有人以相同的方式定义(一致性)

在社交网络、双边市场(Uber/滴滴——一个司机的定价影响附近司机的需求)、流行病学(群体免疫)、教育(同伴效应)中,SUTVA 几乎总是被违反。这些领域恰恰是因果推断最有实践价值的地方,也是最难做的地方。

SUTVA 的脆弱性解释了为什么 RCT 在医疗领域(药物效果通常不跨个体传播)比在经济/社会政策领域(溢出效应普遍存在)更可靠。

ITT——保护可交换性而非估计治疗效果

ITT(意向治疗分析)是实验设计原则,不是分析方法。其核心承诺是:按随机化分配的组别分析(即使有人没吃药),从而保护随机化带来的可交换性。分析「实际吃药的人」(per-protocol)会破坏随机化——选择依从和不依从的人在某方面系统不同。

但 ITT 估计的是「被分配治疗的效果」(分配效应),而非「治疗本身的效果」——这两个效应在依从性不完美时不同。IV 方法可以用随机分配作为工具变量来估计依从者的真实治疗效果(LATE)。

LATE——「平均治疗效果」的幻象

IV 方法估计的 LATE(局部平均治疗效果)只适用于依从者——即那些「治疗状态完全由工具变量决定」的人。永远依从者和永远不依从者的治疗效果不在 LATE 中。这是一个根本性的限制:IV 的因果证据比 PSM 更可信(处理不可观测混杂),但结论不能推广到全人群——你只能声称「对依从者有效」,不能声称「对所有人有效」。

这暴露了因果推断中内部效度(因果证据强度)和外部效度(可推广性)之间的根本性跷跷板——没有方法能同时最大化两者。

跨域链接

  • → 概念笔记「因果推断方法阵营」:本笔记建立因果识别的必要条件(可交换性),方法阵营笔记覆盖充分条件——在特定假设下,不同方法如何从观测数据中创造类实验条件
  • → 概念笔记「机器学习失败金字塔」:预测→因果→决策三层中,因果是中层——而可交换性(或缺乏)决定了中层是否可跨越
  • → 概念笔记「贝叶斯与频率学派分歧」:可交换性的贝叶斯表述(de Finetti 定理)和频率表述(随机分配)走向不同的技术路径
  • → 桥接笔记「预测因果决策是三个不同技术层」:可交换性是区分「预测问题」和「因果问题」的根本标准——有可交换性才能做因果推断,没有就只能预测
  • → 桥接笔记「信用分配是时序因果推断与强化学习的共同根」:信用分配问题本质上是时序版的可交换性挑战——如何从延迟的奖赏中推断哪些行为真正负责
  • → 桥接笔记「因果推断诊断检验本身是假设检验」:当可交换性需要假设(而非随机分配保障)时,诊断检验成为最后的防线——但这些检验本身面临 p-hacking 风险
  • → 概念笔记「策略互动的数学语法」:SUTVA 是因果推断最脆弱的假设。C1 展示了策略性环境(博弈)中 SUTVA 如何被系统性违反。
  • → 概念笔记「度量选择是元决策」:效应度量选择(RD/RR/OR)和不可折叠性是度量选择的直接体现。
  • → 概念笔记「网络科学从个体交互到集体涌现的结构性规律」:SUTVA 假设在网络干预中系统性失败——网络中的个体交互意味着一个人的处理必然溢出到他人,网络科学提供了分析这种干扰传播的结构性框架,将「SUTVA 违反」从问题转化为可建模的网络效应。
  • → 概念笔记「实验设计与在线对照实验」:随机化实验是建立可交换性的黄金标准——RCT 通过物理随机分配强制创造可交换性,是所有因果推断方法的基准线。实验设计笔记系统化地覆盖了从统计显著性到组织可信度的完整实践体系。
  • → 概念笔记「决策理论三张面孔」:因果推断的输出("X 导致 Y")是决策理论的输入("既然 X 导致 Y,我应该做 X 吗?")——可交换性将数据的预测关联升级为因果知识,而决策理论将因果知识转化为行动选择。