- IV估计LATE非ATE依从者局限
- 弱工具变量F小于10比不用更差
- PSM与IV解决不同的自选择问题
- RDD估计的是局部效应不能外推全局
- DID平行趋势假设干预前可检验干预后不可
- 双重稳健估计二选一正确即一致
- 时变混杂标准回归失效需G方法
- ITT保护可交换性而非估计真实依从效应
- 竞争事件改变效应定义生存分析关键
- 因果中介分析需更强假设不可混淆为效应修饰
- SUTVA是因果推断最脆弱假设干扰
- 效应度量选择取决于受众不是统计偏好
- 信用分配是时序因果推断难题
- G公式与G估计时变处理下长期因果效应的两种互补方法
- 边际结构模型与逆概率加权时变处理下用权重重建可交换性
- 从SUTVA到干扰网络因果推断溢出效应的识别与估计
- 传播与同质性的因果混淆社交传染vs选择效应vs共享环境
- 两阶段随机化处理分配与群体分配的交叉设计解耦直接与间接效应
- 因果发现从观测数据学习因果图结构何时可能何时不可能
- Markov等价类与忠实性假设为什么因果发现只学到一族图---
因果推断方法阵营的分歧不在数学——每种方法估计不同的因果量,选错方法的代价是回答了一个你没问的问题¶
一、每种方法估计的根本不是同一个东西¶
因果推断初学者最常问的问题是「IV 和 DID 哪个更好?」——这个问题本身是错的。不同方法估计的是不同的因果量,适用于不同的数据结构、假设强度和问题类型。
| 方法 | 估计量 | 适用场景 | 核心假设(不可检验的用※标注) | 外推能力 |
|---|---|---|---|---|
| RCT + ITT | ITT 效应(分配效应) | 有随机化,但依从性不完美 | 随机化有效 + SUTVA | 受限于试验人群 |
| IV | LATE(依从者效应) | RCT 依从不完美 + 有工具变量 | 排他性约束※ + 相关性(F>10)+ 单调性 | 极低——仅依从者 |
| RDD | 断点附近的 LATE | 有明确制度阈值(分数线/年龄) | 断点处连续※ | 极低——仅阈值附近 |
| DID | ATT(处理组平均效应) | 有面板数据 + 政策自然实验 | 平行趋势※ + 无同期事件 | 中等——受限于处理组 |
| PSM | ATT(匹配后处理组效应) | 有丰富的可观测协变量 | 条件独立(CIA)※——无不可观测混杂 | 高——可匹配到总体 |
| IPW | ATE(全人群平均效应) | 同样需要 CIA | 正值性 + CIA※ | 高——权重可对标总体 |
| G-formula | ATE 或任意干预方案 | 需要正确建模结局过程 | 所有模型正确指定※ | 高——可模拟反事实 |
| 双重稳健 | ATE | 结局模型或处理模型有一个正确即可 | 至少一个模型正确 | 高 |
关键洞察:IV 的 LATE 和 RDD 的 LATE 虽然都叫 LATE,但针对不同人群——IV 的 LATE 是「依从者」,RDD 的 LATE 是「断点附近的任何人」。两者不可互换。
二、假设强度阶梯——从最少到最多¶
所有因果方法共享三个基础假设:一致性(处理定义明确)、正值性(所有个体都有非零概率接受任何处理)、SUTVA(无干扰)。SUTVA 是其中最脆弱的一个——在社交网络、双边市场、流行病学中几乎总是被违反。
在基础假设之上,每个方法叠加额外的识别假设:
基础层(所有方法)
├── 一致性、正值性、SUTVA
│
├── 随机化有效(RCT、ITT) ← 通过设计满足
│
├── 条件独立 CIA(PSM、IPW) ← 必须论证「观测协变量已足够」
│ └── 不可检验※——这是 PSM/IPW 的阿克琉斯之踵
│
├── 排他性约束 + 相关性 + 单调性(IV) ← 必须论证「工具只通过处理影响结局」
│ └── 排他性约束不可检验※——IV 比 PSM 强在能处理不可观测混杂,但代价是
│ 你需要讲一个「工具只通过处理影响结局」的故事,而数据永远不能帮你验证
│
├── 平行趋势(DID) ← 可以检验干预前,干预后永远不可验证※
│
├── 无 M-Y 混杂 + 无 A-M 混杂(中介分析) ← 假设强度最高,观察性研究中几乎无法满足
│
└── 结局模型正确 / 处理模型正确(G-formula / 双重稳健) ← 双重稳健提供冗余安全
实践含义:假设强度不是线性排序——IV 的假设比 PSM 更「少」但更「不可检验」。PSM 的 CIA 假设可以通过测量更多变量来逼近,但 IV 的排他性约束无论测量多少变量都无法验证。
三、内部效度与外部效度的跷跷板¶
因果推断方法存在根本性的内部效度—外部效度跷跷板:
内部效度(高 → 低)
──────────────────────────────→
RCT > RDD > IV > DID > 双重稳健 > G-formula > IPW > PSM
←──────────────────────────────
外部效度(高 → 低)
- RDD 在断点附近的因果推断「几乎和 RCT 一样可信」——但结论严格局限于断点附近。分数线 600 分的 RDD 告诉你 600 分附近的学生因奖学金而提高毕业率 15%——你不能说「取消奖学金制度会让所有学生毕业率下降 15%」。
- PSM/IPW 对观察性数据的依赖意味着假设最脆弱——但一旦假设成立,结论可推广到全人群。
- IV 夹在中间:可以处理不可观测混杂(比 PSM 强),但 LATE 只适用于依从者(比 RCT 弱)。
实践决策法则:如果你需要为政策决策提供证据(「这个干预值得在全国推广吗?」),你需要高外部效度的方法(PSM/IPW/G-formula),但你必须接受更弱的因果证据。如果你需要为科学结论提供证据(「这个药物有没有因果效应?」),你需要高内部效度的方法(RCT/RDD/强 IV),但你必须接受结论不能外推到全部人群。
四、时间维度——被遗忘的因果推断前沿¶
标准因果推断隐式假设「处理是一次性的、静态的」。现实不是这样。
4.1 时变混杂与 G 方法¶
当今天的协变量受昨天处理影响、又混杂今天处理时(如:上次用药 → 本次化验指标 → 本次用药调整),标准回归「控制协变量」会引入过度调整偏倚——因为协变量同时是中介和混杂。
G 方法族(G-formula、IPTW、G-estimation)是唯一能正确处理的框架。但在业界,绝大多数面板数据分析仍然在用标准回归——结果是偏倚的,只是无人检查。
4.2 竞争事件¶
当「死亡阻止你观察癌症复发」时,「治疗效果」的定义本身就不唯一: - 原因别风险:药物降低癌症死亡的风险(假设患者不会死于其他原因) - 累积发生率:用药后实际死于癌症的比例(竞争事件是现实的一部分) - 次分布风险(Fine-Gray):介于两者之间的净效应
同样的数据,不同的 estimand 给出不同的结论——而且都是「正确」的。选择 Fine-Gray 还是 Cox 不是统计问题,是定义「效果」的语义问题。
4.3 信用分配——时序因果推断的 RL 视角¶
信用分配问题(「第 3 步的行动导致第 10 步的奖励,哪一步的功劳?」)本质上是时序化的反事实问题。强化学习的 TD 学习和 eligibility traces 可以被视为在时序因果推断中处理时变混杂的近似方法——当因果推断的 IV/G-formula 方法过于昂贵时,RL 提供了计算上可行的替代方案。
五、效应度量——不是统计偏好,是受众和政治¶
因果效应可以用三种度量报告:
| 度量 | 公式 | 受众 | 陷阱 |
|---|---|---|---|
| 风险差 (RD) | E[Y¹] - E[Y⁰] | 政策制定者 | 无 |
| 风险比 (RR) | E[Y¹] / E[Y⁰] | 流行病学家 | 掩盖绝对效应大小 |
| 优势比 (OR) | odds¹/odds⁰ | 统计模型 | collapsibility 问题,难以解释 |
选择度量首先取决于受众——政策制定者需要 RD(「能救多少人?」),流行病学家偏好 RR(「风险降低了多少倍?」)。但有一个更深层的问题:RR 是信息不对称的工具。死亡率从 2% 降到 1%(RR=0.5,读起来很震撼)与从 50% 降到 25%(同样是 RR=0.5),政策含义天差地别——前者实际只多救 1% 的人,后者多救 25%。
实用法则:决策报告必须以 RD 为主线。医药营销喜欢用 RR 说「风险降低 50%」,但卫生技术评估(HTA)必须用 NNT(= 1/RD,需要治疗多少人才能多救一个)来做成本效益决策。如果你只报告 RR 或 OR,你实际上在隐瞒效应的大小。
六、因果方法选择决策框架¶
┌─── 有随机化? ───┐
│ YES │ NO
▼ ▼
依从性完美? 有面板数据 + 政策断点?
┌──YES──NO──┐ ┌──YES────────NO──┐
▼ ▼ ▼ ▼
标准RCT ITT分析 DID 有制度阈值?
分析 +IV的 平行趋势 ┌─YES──NO──┐
LATE 成立? ▼ ▼
┌─YES─NO─┐ RDD 有工具变量?
▼ ▼ 局部效应 ┌─YES──NO──┐
DID G方法 ▼ ▼
ATT 时变处理 IV 有丰富协变量?
MSM/IPTW LATE ┌─YES──NO──┐
▼ ▼
PSM/IPW 放弃因果
ATT/ATE 认命做预测
何时放弃因果推断:当你的数据既没有随机化、没有面板结构、没有制度阈值、没有可信的工具变量、也没有足够的协变量时——放弃因果推断,做预测建模或探索性关联分析,并诚实地报告「我们不知道这是因果还是关联」。强行用不适用方法得到的「因果结论」比坦诚的「关联分析」更有害。
七、跨域链接¶
- → 概念笔记「关联不等于因果可交换性是分界线」:方法对比的前提——理解可交换性是所有识别策略的共同目标
- → 概念笔记「贝叶斯与频率学派分歧」:IV 和 G 方法的区别也可从贝叶斯/频率视角理解——贝叶斯方法自动处理不确定性传播
- → 文献笔记「G 公式与 G 估计——时变处理下长期因果效应」:该笔记填补了本概念笔记中「前沿扩展」的核心空白——从静态因果方法扩展到动态处理制度下的因果推断
- → 文献笔记「边际结构模型与 IPW——时变权重重建可交换性」:该笔记补充了 IPW 在时变处理中面临的特殊挑战——权重爆炸和序贯可交换性
- → 文献笔记「从 SUTVA 到干扰——网络因果推断」:SUTVA 的违反是该概念笔记的前提假设——当 SUTVA 不再成立时,传统因果方法全部失效,需要网络因果推断的新方法阵营
- → 文献笔记「因果发现——从观测数据学习因果图」:因果发现是该概念笔记的前置步骤——不知道因果图就不知道用什么方法(IV 需要图找工具变量,DID 需要图确认平行趋势变量),因果发现告诉你从数据中能学到什么图
追加——2026-07-03:时变处理的方法阵营(G 公式 / IPW-MSM / G 估计)¶
本笔记的前四个部分聚焦于静态处理(单次处理、单次结局)的因果方法。但在医学、经济、政策中,处理随时间变化且受过去结局影响——这创造了标准回归无法解决的时变混杂。
时变处理的三个方法阵营¶
| 方法 | 核心思想 | 优势 | 劣势 |
|---|---|---|---|
| G 公式 | 蒙特卡洛模拟——在反事实世界中模拟整个协变量和结局轨迹 | 灵活处理任意动态制度 | 模型依赖强,计算量大 |
| IPW/MSM | 权重重建可交换性——用权重乘积消除时变混杂 | 简单,仅需处理模型 | 权重爆炸(\(T>10\) 时通常不可靠) |
| G 估计 | 直接建模脉冲函数(blip function)——每时间点多一单位处理的额外效应 | 双重稳健 | 实现复杂,软件支持少 |
时变混杂的致命性¶
标准回归在时变处理中失败的根本原因:\(L_t\) 既受 \(A_{t-1}\) 影响又影响 \(A_t\) → 控制 \(L_t\) 阻断 \(A_{t-1}\) 的效应,不控制产生混杂 → 没有标准回归能同时解决这两个问题。这就是为什么需要专门的方法阵营。
序贯可交换性——从一次性条件到逐时间点条件¶
时变场景中,可交换性变为:
即:在每个时间点,给定到该点的全部处理历史和协变量历史,当前处理独立于潜在结局。这是对「可交换性」(关联不等于因果的数学分界线)在时间维度上的推广。
追加——2026-07-03:网络因果推断——当 SUTVA 被系统性违反¶
本笔记的方法阵营(RCT/IV/DID/RDD/PSM/DID)全部隐含假设 SUTVA——你的处理不影响我的结局。但在社交网络、双边市场、教室和家庭中,SUTVA 被系统性违反。
干扰下的效应分解¶
- \(\beta_1\):直接效应——我自己被处理的影响
- \(\beta_2\):间接效应(溢出)——我邻居被处理对我的影响
- \(G_i\):邻居中被处理的比例
三效应分解的识别策略¶
| 设计 | 识别能力 | 成本 |
|---|---|---|
| 个体随机化 | 混杂的总效应 | 最低(SUTVA 成立时最优) |
| 群体随机化 | 纯净的总效应 | 有效样本 = 群体数(效率最低) |
| 两阶段随机化 | 直接 + 间接 + 交互效应 | 需要 4-5 个覆盖率水平 × 足够大的群体 |
两阶段随机化是目前唯一能同时识别直接效应和间接效应(覆盖率梯度)的设计。
传播 vs 同质性——网络因果的识别噩梦¶
朋友行为相似有三种可能:(1) 社交传染(你影响了我)、(2) 同质性(相似的人成为朋友,相似的行为是选择的结果)、(3) 共享环境。
Shalizi & Thomas (2011) 证明:在没有参数假设时,传染和同质性在静态观测网络数据中联合不可识别。需要纵向数据、随机化实验或工具变量来区分——这使网络因果推断比标准因果推断的假设强度至少高一个层级。
追加——2026-07-03:因果发现——当因果图本身是未知的¶
本笔记的方法阵营(IV/DID/RDD 等)全部假设因果图已知。因果发现处理更根本的问题:因果图从哪来?
因果发现的三种方法论¶
| 方法 | 原理 | 输出 | 局限 |
|---|---|---|---|
| 约束方法(PC 算法) | 系统性检验条件独立性,构建图的骨架 | CPDAG(部分有向图) | 学不到 v-结构以外的方向 |
| 得分方法(GES) | 用 BIC 在 DAG 空间中贪婪搜索 | Markov 等价类 | DAG 空间超指数(10 变量 = \(4.2×10^{18}\) 个图) |
| 函数因果模型(LiNGAM) | 线性非高斯模型——噪声的非高斯性使方向可识别 | 完整 DAG | 需要非高斯假设 |
Markov 等价类——因果发现的天花板¶
从纯观测数据中,你永远只能学到 Markov 等价类(一族 DAG),不能学到唯一 DAG。因果链 \(X \rightarrow Y \rightarrow Z\)、反向因果链 \(X \leftarrow Y \leftarrow Z\) 和共同原因 \(X \leftarrow Y \rightarrow Z\) 产生完全相同的条件独立模式——从数据中不可区分。
打破等价类需要干预(随机化实验)——一次 do 操作创造 v-结构,使方向可识别。这意味着:因果发现是假设生成工具,不是假设验证工具。它的输出是「图可能是这样的」,不是「图一定是这样的」。
因果发现 vs 因果效应估计——两个不同的任务¶
| 因果发现 | 因果效应估计 | |
|---|---|---|
| 输入 | 数据,无因果图 | 数据 + 已知因果图 |
| 输出 | 候选因果图集合 | 因果效应数值 |
| 该笔记的覆盖 | 未覆盖 | 全面覆盖(IV/DID/RDD/PSM/G方法) |
本追加填补了该笔记最大的空白——因果图从哪来、怎么验证、何时可信。 - → 概念笔记「频率推断核心张力」:每种因果方法的假设检验(F>10、平行趋势检验、McCrary 检验)同样面临 p-hacking 和多重比较风险 - → 概念笔记「决策理论三张面孔」:因果方法选择本质上是规定决策——给定数据结构和研究问题,规定应该用哪种方法 - → 桥接启发「信用分配=时序因果推断」:RL 的 TD 学习与因果推断的 G 方法共享「在时序中识别因果」的目标
- → 桥接笔记「因果推断诊断检验本身是假设检验」:每种因果方法的诊断检验(F>10、平行趋势检验、McCrary 检验)本身就是假设检验——在方法选择后,你还要面对假设检验的所有经典陷阱
- → 桥接笔记「预测因果决策是三个不同技术层」:方法阵营的选择取决于你在哪个技术层操作——预测层不需要因果识别,因果层必须在假设下创造可交换性,决策层需要因果 + 效用函数
- → 概念笔记「机器学习失败金字塔」:C3 讨论的三层技术(预测/因果/决策)正是 C2 的核心框架。C3 方法选择决定在哪一层投入资源。
- → 概念笔记「度量选择是元决策」:RD/RR/OR 效应度量选择不是统计偏好,是受众和决策场景决定的——这本身就是度量选择的典型案例。
- → 概念笔记「网络科学——从个体交互到集体涌现的结构性规律」:网络因果推断将传统的点对点因果识别扩展到图结构——干扰效应(peer effects)、传播效应(contagion)和网络混杂(homophily confounding)突破了 SUTVA 假设,需要基于图结构的因果识别策略(如 linear-in-means 模型、IV 网络邻居特征)。
- → 概念笔记「实验设计与在线对照实验——从统计显著性到组织可信度」:随机化实验是因果推断的黄金标准——通过物理随机分配消除所有混杂(观测到的和未观测到的),IV/DID/RDD/PSM 只是在随机化不可行时的替代方案。实验设计定义了因果推断的效度上限。
- → 概念笔记「自适应实验与多臂老虎机——从固定样本到动态优化」:因果 bandits 将因果识别和在线优化结合——不仅要知道"哪个臂最好",还要知道"这个臂为什么好"(因果归因)。Thompson 采样在 causal bandit 中的扩展(causal Thompson sampling)需要在线估计反事实结果,连接了因果推断和自适应实验两个领域的核心工具。
- → 桥接笔记「贝叶斯决策理论(从概率到行动)」:贝叶斯因果推断的本质是将贝叶斯决策理论应用于因果估计。