边际结构模型与逆概率加权——时变处理下用权重重建可交换性的方法¶
原文提炼¶
IPW 在时变处理中的特殊挑战:
"In a time-varying setting, standard IPW creates a pseudo-population where treatment at each time point is independent of prior covariates. But the weights can quickly become extreme, leading to unstable estimates."
从静态 IPW 到时变 IPW 的三步跳跃:
| 维度 | 静态 IPW | 时变 IPW |
|---|---|---|
| 权重结构 | $\frac{1}{P(A | L)}$ |
| 伪人群目标 | 一次处理独立于基线协变量 | 每次处理的全部历史独立于时变协变量 |
| 核心问题 | 倾向评分模型误设 | 权重爆炸 + 模型误设 |
时变权重的乘积结构:
\[W_i = \prod_{t=0}^{T} \frac{1}{f(A_{t,i} | \bar{A}_{t-1,i}, \bar{L}_{t,i})}\]
\(T\) 很大时,\(W_i\) 被极端值支配——单个时间点的倾向评分接近 0 就使整个权重爆炸。
稳定权重——对抗权重爆炸的三招¶
| 策略 | 操作 | 代价 |
|---|---|---|
| 稳定权重 | $SW_i = \prod_{t} \frac{f(A_{t,i} | \bar{A}{t-1,i})}{f(A |
| 权重截断 | \(W_i^{\text{trunc}} = \min(W_i, c)\),\(c\) 通常为 99 分位数 | 引入偏倚,但偏倚可控 |
| 平衡检查 | 加权后检查协变量是否在处理组间平衡 | 事后验证,不解决根本问题 |
稳定权重的直觉: - 分子 \(f(A_t | \bar{A}_{t-1})\) 是"过去处理对当前处理的预测" - 分母 \(f(A_t | \bar{A}_{t-1}, \bar{L}_t)\) 是加上协变量的预测 - 比值衡量协变量提供的额外信息——如果协变量与处理无关,比值为 1,权重为 1
MSM 的两阶段框架¶
阶段 1: 权重估计
对每个时间点拟合处理模型:
logit(P(A_t=1|history)) = α₀ + α₁L_t + α₂A_{t-1}
计算稳定权重 SW_i
阶段 2: 加权结局模型
用 SW_i 加权拟合结局模型:
E[Y^d] = β₀ + β₁ · cum_dose(d)
其中 cum_dose(d) 是制度 d 下的累积处理量
因果效应 = β₁
MSM 的核心假设:
- 序贯可交换性:在每个时间点,处理分配独立于未观测的未来结局,给定已观测历史
- 正值性:对任何可能的历史,接受处理的概率 \(P(A_t=1|history)\) 严格在 0 和 1 之间(时变场景中比静态更容易违反)
- 正确模型设定:处理模型和结局模型至少有一个是正确的
为什么时变 IPW 如此脆弱¶
| 因素 | 机制 |
|---|---|
| \(T\) 大时权重乘积链 | 20 个时间点 → 20 个倾向评分的乘积,一个 0.01 就使权重 = 100 |
| 反馈环 | \(A_{t-1} \rightarrow L_t \rightarrow A_t\) 使倾向评分模型必须正确建模反馈结构 |
| 正值性违反随时间累积 | 每个时间点都可能出现某些历史的处理概率接近 0 |
实践警示:\(T > 10\) 时,时变 IPW 通常不可靠。此时 G 公式(蒙特卡洛模拟)更鲁棒。
跨域链接¶
- 因果推断方法阵营——分歧不在数学,每种方法估计不同的因果量:MSM/IPW 是该概念笔记中假定的"已知方法"但未展开的维度——当前笔记讨论了方法选择但未深入时变场景的特殊挑战
- 关联不等于因果——可交换性是分界线:序贯可交换性是该概念的自然延伸——从"一次随机化"到"每一次都随机化",时变场景从一次性可交换变成逐时间点条件可交换
- 信用分配——时序因果推断与强化学习的共同根:IPW 的权重结构与 RL 中的重要性采样权重完全相同——两者都用权重纠正"行为策略"和"目标策略"之间的分布偏移
- G 公式与 G 估计——时变处理下长期因果效应的两种互补方法:IPW/MSM 是 G 公式的互补方法——IPW 对结局模型不需要建模(仅需处理模型),G 公式对处理模型不需要建模(仅需结局和协变量模型)