从 SUTVA 到干扰——网络因果推断如何从"无干扰假设"到"建模干扰本身"¶
原文提炼¶
干扰问题是 SUTVA 的两条腿之一:
"SUTVA has two parts: (1) well-defined treatments (consistency) and (2) no interference. The second part is systematically violated whenever individuals interact — in social networks, markets, classrooms, and households."
干扰存在时的三效应分解:
其中: - \(\beta_1\):直接效应——个体自身被处理的影响 - \(\beta_2\):间接效应(溢出)——他人被处理对 \(i\) 的影响 - \(G_i = \frac{\sum_{j \in N(i)} A_j}{|N(i)|}\):邻居中被处理的比例
典型溢出模式:
| 场景 | 正向溢出 | 负向溢出 | 因果问题 |
|---|---|---|---|
| 疫苗 | 接种者减少传播,保护未接种邻居 | — | 个体随机化低估总体效应 |
| 教育 | 好学生提升班级平均水平 | 好学生在差班被拉低 | 教室 vs 个体随机化选择 |
| 定价 | — | 打折抢夺邻近店铺客流 | A/B 测试在双边市场被污染 |
| 信息干预 | 信息在社交网络中传播 | — | 对照组被"污染" |
群体随机化——干扰下的实验设计¶
核心思想:当个体间存在干扰时,将群体(cluster)而非个体作为随机化单元。
个体随机化:
[●] [○] [●] [○] [●] [○] [●] [○] ← 个体随机分配
问题:处理组和对照组个体互相影响 → SUTVA 违反
群体随机化:
[● ● ● ●] [○ ○ ○ ○] [● ● ● ●] [○ ○ ○ ○]
群体 1 处理 群体 2 对照 群体 3 处理 群体 4 对照
假设:群体间足够独立,干扰只在群体内
群体随机化的代价: - 统计功效下降:有效样本量从 \(n\)(个体数)降为 \(m\)(群体数) - 设计效应(Design Effect):\(DE = 1 + (n_c - 1)\rho\),其中 \(n_c\) 为群体大小,\(\rho\) 为群体内相关性 - \(\rho = 0.01\) 时 100 人的群体,设计效应 = 2 → 需要 2 倍样本量获得相同精度
干扰下的因果识别策略¶
| 策略 | 原理 | 适用条件 |
|---|---|---|
| 群体随机化 | 将群体作为单元 | 群体间独立 |
| 两阶段随机化 | 先随机化群体,再在群体内随机化个体 | 需要两个随机化层次 |
| 网络结构建模 | 显式建模邻居关系 | 网络数据可用 |
| 部分干扰假设 | 假设干扰局限于直接邻居 | 社交距离衰减快 |
| 阴性对照 | 在无干扰区域设置对照组 | 地理或制度隔离 |
从规避走向建模¶
传统因果推断的教学态度:SUTVA 违反则分析无效 → 放弃因果推断。
Hernán & Robins 的新态度(第 18 章):SUTVA 违反是常态,不是异常。与其假装干扰不存在,不如显式建模干扰本身。 这标志着因果推断从"无干扰假设"到"干扰是待估计的参数"的范式转变。
关键公式——从个体因果到群体因果:
其中 \(a\) 为个体处理状态,\(\alpha\) 为群体处理覆盖率。此时的因果问题变成了二维的——需要同时估计个体处理效应 \(\beta_1\) 和群体覆盖率效应 \(\beta_2\)。
跨域链接¶
- 因果推断方法阵营——分歧不在数学,每种方法估计不同的因果量:网络因果推断是该概念笔记的缺失维度——当前的因果方法阵营(RCT/RDD/IV/DID/PSM)全部假设 SUTVA
- 关联不等于因果——可交换性是分界线:干扰下的可交换性变为群体条件可交换性——同一群体内的个体不再可交换,但群体间可以
- 网络科学——从个体交互到集体涌现的结构性规律:网络因果推断是该概念笔记的因果层补充——网络科学讲了结构(拓扑/动态/悖论),缺了对网络中的因果关系如何估计
- 实验设计与在线对照实验——从统计显著性到组织可信度:A/B 测试的 SUTVA 陷阱——双边市场中处理组降价会抢夺对照组流量,这是实践笔记中已提到但未被概念化的 SUTVA 违反