Skip to content

从 SUTVA 到干扰——网络因果推断如何从"无干扰假设"到"建模干扰本身"

原文提炼

干扰问题是 SUTVA 的两条腿之一

"SUTVA has two parts: (1) well-defined treatments (consistency) and (2) no interference. The second part is systematically violated whenever individuals interact — in social networks, markets, classrooms, and households."

干扰存在时的三效应分解

\[ Y_i = \alpha + \beta_1 A_i + \beta_2 G_i + \epsilon_i \]

其中: - \(\beta_1\)直接效应——个体自身被处理的影响 - \(\beta_2\)间接效应(溢出)——他人被处理对 \(i\) 的影响 - \(G_i = \frac{\sum_{j \in N(i)} A_j}{|N(i)|}\):邻居中被处理的比例

典型溢出模式

场景 正向溢出 负向溢出 因果问题
疫苗 接种者减少传播,保护未接种邻居 个体随机化低估总体效应
教育 好学生提升班级平均水平 好学生在差班被拉低 教室 vs 个体随机化选择
定价 打折抢夺邻近店铺客流 A/B 测试在双边市场被污染
信息干预 信息在社交网络中传播 对照组被"污染"

群体随机化——干扰下的实验设计

核心思想:当个体间存在干扰时,将群体(cluster)而非个体作为随机化单元。

个体随机化:
  [●] [○] [●] [○] [●] [○] [●] [○]  ← 个体随机分配
  问题:处理组和对照组个体互相影响 → SUTVA 违反

群体随机化:
  [● ● ● ●] [○ ○ ○ ○] [● ● ● ●] [○ ○ ○ ○]
  群体 1 处理    群体 2 对照    群体 3 处理    群体 4 对照
  假设:群体间足够独立,干扰只在群体内

群体随机化的代价: - 统计功效下降:有效样本量从 \(n\)(个体数)降为 \(m\)(群体数) - 设计效应(Design Effect)\(DE = 1 + (n_c - 1)\rho\),其中 \(n_c\) 为群体大小,\(\rho\) 为群体内相关性 - \(\rho = 0.01\) 时 100 人的群体,设计效应 = 2 → 需要 2 倍样本量获得相同精度

干扰下的因果识别策略

策略 原理 适用条件
群体随机化 将群体作为单元 群体间独立
两阶段随机化 先随机化群体,再在群体内随机化个体 需要两个随机化层次
网络结构建模 显式建模邻居关系 网络数据可用
部分干扰假设 假设干扰局限于直接邻居 社交距离衰减快
阴性对照 在无干扰区域设置对照组 地理或制度隔离

从规避走向建模

传统因果推断的教学态度:SUTVA 违反则分析无效 → 放弃因果推断。

Hernán & Robins 的新态度(第 18 章):SUTVA 违反是常态,不是异常。与其假装干扰不存在,不如显式建模干扰本身。 这标志着因果推断从"无干扰假设"到"干扰是待估计的参数"的范式转变。

关键公式——从个体因果到群体因果:

\[E[Y^{a,\alpha}] = \beta_0 + \beta_1 a + \beta_2 \alpha\]

其中 \(a\) 为个体处理状态,\(\alpha\) 为群体处理覆盖率。此时的因果问题变成了二维的——需要同时估计个体处理效应 \(\beta_1\) 和群体覆盖率效应 \(\beta_2\)

跨域链接