Skip to content
  • IV估计LATE非ATE依从者局限
  • 弱工具变量F小于10比不用更差
  • PSM与IV解决不同的自选择问题
  • RDD估计的是局部效应不能外推全局
  • DID平行趋势假设干预前可检验干预后不可
  • 双重稳健估计二选一正确即一致
  • 时变混杂标准回归失效需G方法
  • ITT保护可交换性而非估计真实依从效应
  • 竞争事件改变效应定义生存分析关键
  • 因果中介分析需更强假设不可混淆为效应修饰
  • SUTVA是因果推断最脆弱假设干扰
  • 效应度量选择取决于受众不是统计偏好
  • 信用分配是时序因果推断难题
  • G公式与G估计时变处理下长期因果效应的两种互补方法
  • 边际结构模型与逆概率加权时变处理下用权重重建可交换性
  • 从SUTVA到干扰网络因果推断溢出效应的识别与估计
  • 传播与同质性的因果混淆社交传染vs选择效应vs共享环境
  • 两阶段随机化处理分配与群体分配的交叉设计解耦直接与间接效应
  • 因果发现从观测数据学习因果图结构何时可能何时不可能
  • Markov等价类与忠实性假设为什么因果发现只学到一族图---

因果推断方法阵营的分歧不在数学——每种方法估计不同的因果量,选错方法的代价是回答了一个你没问的问题

一、每种方法估计的根本不是同一个东西

因果推断初学者最常问的问题是「IV 和 DID 哪个更好?」——这个问题本身是错的。不同方法估计的是不同的因果量,适用于不同的数据结构、假设强度和问题类型。

方法 估计量 适用场景 核心假设(不可检验的用※标注) 外推能力
RCT + ITT ITT 效应(分配效应) 有随机化,但依从性不完美 随机化有效 + SUTVA 受限于试验人群
IV LATE(依从者效应) RCT 依从不完美 + 有工具变量 排他性约束※ + 相关性(F>10)+ 单调性 极低——仅依从者
RDD 断点附近的 LATE 有明确制度阈值(分数线/年龄) 断点处连续※ 极低——仅阈值附近
DID ATT(处理组平均效应) 有面板数据 + 政策自然实验 平行趋势※ + 无同期事件 中等——受限于处理组
PSM ATT(匹配后处理组效应) 有丰富的可观测协变量 条件独立(CIA)※——无不可观测混杂 高——可匹配到总体
IPW ATE(全人群平均效应) 同样需要 CIA 正值性 + CIA※ 高——权重可对标总体
G-formula ATE 或任意干预方案 需要正确建模结局过程 所有模型正确指定※ 高——可模拟反事实
双重稳健 ATE 结局模型或处理模型有一个正确即可 至少一个模型正确

关键洞察:IV 的 LATE 和 RDD 的 LATE 虽然都叫 LATE,但针对不同人群——IV 的 LATE 是「依从者」,RDD 的 LATE 是「断点附近的任何人」。两者不可互换。


二、假设强度阶梯——从最少到最多

所有因果方法共享三个基础假设:一致性(处理定义明确)、正值性(所有个体都有非零概率接受任何处理)、SUTVA(无干扰)。SUTVA 是其中最脆弱的一个——在社交网络、双边市场、流行病学中几乎总是被违反。

在基础假设之上,每个方法叠加额外的识别假设:

基础层(所有方法)
├── 一致性、正值性、SUTVA
├── 随机化有效(RCT、ITT)          ← 通过设计满足
├── 条件独立 CIA(PSM、IPW)        ← 必须论证「观测协变量已足够」
│   └── 不可检验※——这是 PSM/IPW 的阿克琉斯之踵
├── 排他性约束 + 相关性 + 单调性(IV)  ← 必须论证「工具只通过处理影响结局」
│   └── 排他性约束不可检验※——IV 比 PSM 强在能处理不可观测混杂,但代价是
│       你需要讲一个「工具只通过处理影响结局」的故事,而数据永远不能帮你验证
├── 平行趋势(DID)                   ← 可以检验干预前,干预后永远不可验证※
├── 无 M-Y 混杂 + 无 A-M 混杂(中介分析)  ← 假设强度最高,观察性研究中几乎无法满足
└── 结局模型正确 / 处理模型正确(G-formula / 双重稳健)  ← 双重稳健提供冗余安全

实践含义:假设强度不是线性排序——IV 的假设比 PSM 更「少」但更「不可检验」。PSM 的 CIA 假设可以通过测量更多变量来逼近,但 IV 的排他性约束无论测量多少变量都无法验证。


三、内部效度与外部效度的跷跷板

因果推断方法存在根本性的内部效度—外部效度跷跷板

内部效度(高 → 低)
──────────────────────────────→
RCT > RDD > IV > DID > 双重稳健 > G-formula > IPW > PSM
←──────────────────────────────
         外部效度(高 → 低)
  • RDD 在断点附近的因果推断「几乎和 RCT 一样可信」——但结论严格局限于断点附近。分数线 600 分的 RDD 告诉你 600 分附近的学生因奖学金而提高毕业率 15%——你不能说「取消奖学金制度会让所有学生毕业率下降 15%」。
  • PSM/IPW 对观察性数据的依赖意味着假设最脆弱——但一旦假设成立,结论可推广到全人群。
  • IV 夹在中间:可以处理不可观测混杂(比 PSM 强),但 LATE 只适用于依从者(比 RCT 弱)。

实践决策法则:如果你需要为政策决策提供证据(「这个干预值得在全国推广吗?」),你需要高外部效度的方法(PSM/IPW/G-formula),但你必须接受更弱的因果证据。如果你需要为科学结论提供证据(「这个药物有没有因果效应?」),你需要高内部效度的方法(RCT/RDD/强 IV),但你必须接受结论不能外推到全部人群。


四、时间维度——被遗忘的因果推断前沿

标准因果推断隐式假设「处理是一次性的、静态的」。现实不是这样。

4.1 时变混杂与 G 方法

当今天的协变量受昨天处理影响、又混杂今天处理时(如:上次用药 → 本次化验指标 → 本次用药调整),标准回归「控制协变量」会引入过度调整偏倚——因为协变量同时是中介和混杂。

G 方法族(G-formula、IPTW、G-estimation)是唯一能正确处理的框架。但在业界,绝大多数面板数据分析仍然在用标准回归——结果是偏倚的,只是无人检查。

4.2 竞争事件

当「死亡阻止你观察癌症复发」时,「治疗效果」的定义本身就不唯一: - 原因别风险:药物降低癌症死亡的风险(假设患者不会死于其他原因) - 累积发生率:用药后实际死于癌症的比例(竞争事件是现实的一部分) - 次分布风险(Fine-Gray):介于两者之间的净效应

同样的数据,不同的 estimand 给出不同的结论——而且都是「正确」的。选择 Fine-Gray 还是 Cox 不是统计问题,是定义「效果」的语义问题

4.3 信用分配——时序因果推断的 RL 视角

信用分配问题(「第 3 步的行动导致第 10 步的奖励,哪一步的功劳?」)本质上是时序化的反事实问题。强化学习的 TD 学习和 eligibility traces 可以被视为在时序因果推断中处理时变混杂的近似方法——当因果推断的 IV/G-formula 方法过于昂贵时,RL 提供了计算上可行的替代方案。


五、效应度量——不是统计偏好,是受众和政治

因果效应可以用三种度量报告:

度量 公式 受众 陷阱
风险差 (RD) E[Y¹] - E[Y⁰] 政策制定者
风险比 (RR) E[Y¹] / E[Y⁰] 流行病学家 掩盖绝对效应大小
优势比 (OR) odds¹/odds⁰ 统计模型 collapsibility 问题,难以解释

选择度量首先取决于受众——政策制定者需要 RD(「能救多少人?」),流行病学家偏好 RR(「风险降低了多少倍?」)。但有一个更深层的问题:RR 是信息不对称的工具。死亡率从 2% 降到 1%(RR=0.5,读起来很震撼)与从 50% 降到 25%(同样是 RR=0.5),政策含义天差地别——前者实际只多救 1% 的人,后者多救 25%。

实用法则:决策报告必须以 RD 为主线。医药营销喜欢用 RR 说「风险降低 50%」,但卫生技术评估(HTA)必须用 NNT(= 1/RD,需要治疗多少人才能多救一个)来做成本效益决策。如果你只报告 RR 或 OR,你实际上在隐瞒效应的大小。


六、因果方法选择决策框架

                  ┌─── 有随机化? ───┐
                  │ YES              │ NO
                  ▼                  ▼
            依从性完美?        有面板数据 + 政策断点?
           ┌──YES──NO──┐       ┌──YES────────NO──┐
           ▼           ▼       ▼                  ▼
      标准RCT      ITT分析    DID             有制度阈值?
      分析         +IV的      平行趋势            ┌─YES──NO──┐
                  LATE        成立?              ▼          ▼
                             ┌─YES─NO─┐         RDD      有工具变量?
                             ▼       ▼          局部效应   ┌─YES──NO──┐
                            DID   G方法                    ▼          ▼
                            ATT   时变处理                IV       有丰富协变量?
                                 MSM/IPTW              LATE       ┌─YES──NO──┐
                                                                    ▼          ▼
                                                                 PSM/IPW   放弃因果
                                                                 ATT/ATE   认命做预测

何时放弃因果推断:当你的数据既没有随机化、没有面板结构、没有制度阈值、没有可信的工具变量、也没有足够的协变量时——放弃因果推断,做预测建模或探索性关联分析,并诚实地报告「我们不知道这是因果还是关联」。强行用不适用方法得到的「因果结论」比坦诚的「关联分析」更有害。


七、跨域链接

追加——2026-07-03:时变处理的方法阵营(G 公式 / IPW-MSM / G 估计)

本笔记的前四个部分聚焦于静态处理(单次处理、单次结局)的因果方法。但在医学、经济、政策中,处理随时间变化且受过去结局影响——这创造了标准回归无法解决的时变混杂。

时变处理的三个方法阵营

方法 核心思想 优势 劣势
G 公式 蒙特卡洛模拟——在反事实世界中模拟整个协变量和结局轨迹 灵活处理任意动态制度 模型依赖强,计算量大
IPW/MSM 权重重建可交换性——用权重乘积消除时变混杂 简单,仅需处理模型 权重爆炸(\(T>10\) 时通常不可靠)
G 估计 直接建模脉冲函数(blip function)——每时间点多一单位处理的额外效应 双重稳健 实现复杂,软件支持少

时变混杂的致命性

标准回归在时变处理中失败的根本原因:\(L_t\) 既受 \(A_{t-1}\) 影响又影响 \(A_t\) → 控制 \(L_t\) 阻断 \(A_{t-1}\) 的效应,不控制产生混杂 → 没有标准回归能同时解决这两个问题。这就是为什么需要专门的方法阵营。

序贯可交换性——从一次性条件到逐时间点条件

时变场景中,可交换性变为:

\[Y^{\bar{a}} \perp\!\!\!\perp A_t | \bar{A}_{t-1}, \bar{L}_t \quad \forall t\]

即:在每个时间点,给定到该点的全部处理历史和协变量历史,当前处理独立于潜在结局。这是对「可交换性」(关联不等于因果的数学分界线)在时间维度上的推广。

追加——2026-07-03:网络因果推断——当 SUTVA 被系统性违反

本笔记的方法阵营(RCT/IV/DID/RDD/PSM/DID)全部隐含假设 SUTVA——你的处理不影响我的结局。但在社交网络、双边市场、教室和家庭中,SUTVA 被系统性违反。

干扰下的效应分解

\[Y_i = \alpha + \beta_1 A_i + \beta_2 G_i + \epsilon_i\]
  • \(\beta_1\)直接效应——我自己被处理的影响
  • \(\beta_2\)间接效应(溢出)——我邻居被处理对我的影响
  • \(G_i\):邻居中被处理的比例

三效应分解的识别策略

设计 识别能力 成本
个体随机化 混杂的总效应 最低(SUTVA 成立时最优)
群体随机化 纯净的总效应 有效样本 = 群体数(效率最低)
两阶段随机化 直接 + 间接 + 交互效应 需要 4-5 个覆盖率水平 × 足够大的群体

两阶段随机化是目前唯一能同时识别直接效应和间接效应(覆盖率梯度)的设计。

传播 vs 同质性——网络因果的识别噩梦

朋友行为相似有三种可能:(1) 社交传染(你影响了我)、(2) 同质性(相似的人成为朋友,相似的行为是选择的结果)、(3) 共享环境。

Shalizi & Thomas (2011) 证明:在没有参数假设时,传染和同质性在静态观测网络数据中联合不可识别。需要纵向数据、随机化实验或工具变量来区分——这使网络因果推断比标准因果推断的假设强度至少高一个层级。

追加——2026-07-03:因果发现——当因果图本身是未知的

本笔记的方法阵营(IV/DID/RDD 等)全部假设因果图已知。因果发现处理更根本的问题:因果图从哪来?

因果发现的三种方法论

方法 原理 输出 局限
约束方法(PC 算法) 系统性检验条件独立性,构建图的骨架 CPDAG(部分有向图) 学不到 v-结构以外的方向
得分方法(GES) 用 BIC 在 DAG 空间中贪婪搜索 Markov 等价类 DAG 空间超指数(10 变量 = \(4.2×10^{18}\) 个图)
函数因果模型(LiNGAM) 线性非高斯模型——噪声的非高斯性使方向可识别 完整 DAG 需要非高斯假设

Markov 等价类——因果发现的天花板

从纯观测数据中,你永远只能学到 Markov 等价类(一族 DAG),不能学到唯一 DAG。因果链 \(X \rightarrow Y \rightarrow Z\)、反向因果链 \(X \leftarrow Y \leftarrow Z\) 和共同原因 \(X \leftarrow Y \rightarrow Z\) 产生完全相同的条件独立模式——从数据中不可区分

打破等价类需要干预(随机化实验)——一次 do 操作创造 v-结构,使方向可识别。这意味着:因果发现是假设生成工具,不是假设验证工具。它的输出是「图可能是这样的」,不是「图一定是这样的」。

因果发现 vs 因果效应估计——两个不同的任务

因果发现 因果效应估计
输入 数据,无因果图 数据 + 已知因果图
输出 候选因果图集合 因果效应数值
该笔记的覆盖 未覆盖 全面覆盖(IV/DID/RDD/PSM/G方法)

本追加填补了该笔记最大的空白——因果图从哪来、怎么验证、何时可信。 - → 概念笔记「频率推断核心张力」:每种因果方法的假设检验(F>10、平行趋势检验、McCrary 检验)同样面临 p-hacking 和多重比较风险 - → 概念笔记「决策理论三张面孔」:因果方法选择本质上是规定决策——给定数据结构和研究问题,规定应该用哪种方法 - → 桥接启发「信用分配=时序因果推断」:RL 的 TD 学习与因果推断的 G 方法共享「在时序中识别因果」的目标

  • → 桥接笔记「因果推断诊断检验本身是假设检验」:每种因果方法的诊断检验(F>10、平行趋势检验、McCrary 检验)本身就是假设检验——在方法选择后,你还要面对假设检验的所有经典陷阱
  • → 桥接笔记「预测因果决策是三个不同技术层」:方法阵营的选择取决于你在哪个技术层操作——预测层不需要因果识别,因果层必须在假设下创造可交换性,决策层需要因果 + 效用函数
  • → 概念笔记「机器学习失败金字塔」:C3 讨论的三层技术(预测/因果/决策)正是 C2 的核心框架。C3 方法选择决定在哪一层投入资源。
  • → 概念笔记「度量选择是元决策」:RD/RR/OR 效应度量选择不是统计偏好,是受众和决策场景决定的——这本身就是度量选择的典型案例。
  • → 概念笔记「网络科学——从个体交互到集体涌现的结构性规律」:网络因果推断将传统的点对点因果识别扩展到图结构——干扰效应(peer effects)、传播效应(contagion)和网络混杂(homophily confounding)突破了 SUTVA 假设,需要基于图结构的因果识别策略(如 linear-in-means 模型、IV 网络邻居特征)。
  • → 概念笔记「实验设计与在线对照实验——从统计显著性到组织可信度」:随机化实验是因果推断的黄金标准——通过物理随机分配消除所有混杂(观测到的和未观测到的),IV/DID/RDD/PSM 只是在随机化不可行时的替代方案。实验设计定义了因果推断的效度上限。
  • → 概念笔记「自适应实验与多臂老虎机——从固定样本到动态优化」:因果 bandits 将因果识别和在线优化结合——不仅要知道"哪个臂最好",还要知道"这个臂为什么好"(因果归因)。Thompson 采样在 causal bandit 中的扩展(causal Thompson sampling)需要在线估计反事实结果,连接了因果推断和自适应实验两个领域的核心工具。
  • → 桥接笔记「贝叶斯决策理论(从概率到行动)」:贝叶斯因果推断的本质是将贝叶斯决策理论应用于因果估计。