Skip to content
  • 概念笔记「因果推断方法阵营」
  • 概念笔记「决策理论三张面孔」
  • 文献笔记「信用分配是时序因果推断难题」
  • 文献笔记「探索利用困境统一序贯决策抽象」
  • 文献笔记「时变混杂标准回归失效需G方法」 sources:
  • online-shortest-path-thompson
  • thompson-sampling-tutorial-russo
  • 博弈论与网络科学的计算实验从囚徒困境锦标赛到Agent建模---

信用分配问题是时序因果推断与强化学习的共同根——两者都在追问「哪一步的功劳?」

同一个问题,两个领域,两套解法

强化学习的信用分配问题(Credit Assignment Problem)和因果推断的时变处理效应估计(Time-varying Treatment Effect Estimation)在数学上是同一个问题:

在一个序列决策过程中,多个行动先后发生,最终观察到一个结果——如何把最终结果归因于序列中的每个具体行动?

t=0        t=1        t=2        t=3     ...    t=T
│          │          │          │               │
行动₀     行动₁      行动₂      行动₃            结果 Y
│          │          │          │               │
└────────────────────────────────────────────────┘
            每一行动的贡献各是多少?

两个领域对这个问题的解法揭示了不同的哲学取向:

维度 强化学习(RL) 因果推断
核心问题 「如何更新策略以最大化累积奖励?」 「处理 A_t 对结局 Y 的因果效应是多少?」
核心方法 TD 学习、eligibility traces G 方法族(G-formula、IPTW、G-estimation)
关键参数 折扣因子 γ:决定远期奖励的权重 稳定化权重:决定时变混杂调整的稳定性
哲学取向 计算优先:用近似方法快速迭代 识别优先:先确保因果效应可识别,再关心估计精度
典型应用 游戏 AI、机器人控制、实时竞价 药物疗效评估、政策评估、经济面板分析

折扣因子 γ:不只是计算技巧——是时序因果关系的一个假定

RL 的 TD 学习更新规则:

\[V(s_t) \leftarrow V(s_t) + \alpha [r_{t+1} + \gamma V(s_{t+1}) - V(s_t)]\]

折扣因子 γ 决定了「第 t 步的行动在 t+k 步时获得的奖励中占多大功劳」: - γ = 0:只有即时奖励算数(贪心——完全不考虑远期后果) - γ = 1:未来和现在同等重要(远视——第 100 步的奖励和第 1 步等价) - 0 < γ < 1:未来奖励按指数衰减——第 k 步后的奖励只贡献 γ^k 的功劳

在因果推断的视角下,γ 不是一个「调参」——它是你在声明一个因果假设:你假设当前行动的因果效应以指数速率衰减,半衰期为 \(t_{1/2} = \ln(0.5) / \ln(\gamma)\)

  • γ = 0.9 → 半衰期 ≈ 6.6 步:7 步之后,行动的效应只剩不到一半
  • γ = 0.99 → 半衰期 ≈ 69 步
  • γ = 0.999 → 半衰期 ≈ 693 步

在实践中,选择 γ 是一个需要论证的因果假设,而不是一个需要调优的超参数——但 RL 社区几乎从不以因果推断的严谨性来审视 γ 的选择。

时变混杂:两个领域共享的同一个难题

时变处理的核心挑战在因果推断中有一个精确的表述:

L₁ 同时是 A₀ 的后果(中介)和 A₁ 的混杂——标准回归无法同时处理这两个角色,要么引入过度调整偏倚(控制 L₁ 屏蔽了 A₀ → L₁ → Y 的间接效应),要么留下混杂(不控制 L₁ 让 A₁-Y 关系被混杂)。

RL 用 eligibility traces 来处理类似的问题:每个状态-行动对都保留一个「痕迹」(trace),痕迹的衰减速率决定了远期信用分配的权重。TD(λ) 的 λ 参数本质上控制了「行动和奖励之间的时间距离如何衰减因果关系」——这与因果推断中「时变混杂需要 G 方法处理,因为标准回归在时间维度上失效」是同一个问题的不同表述。

关键洞察:RL 的 eligibility traces 和因果推断的 G 方法在数学上不是等价的——但它们解决的是同一个问题:在时序递归的因果结构中,如何将最终结果合理地分解为每个时间点行动的贡献?

G 方法可以被视为「有因果保证的信用分配」

因果推断的 G 方法族提供了一个 RL 所缺乏的东西:因果保证

方法 原理 RL 近似 因果保证
G-formula 模拟「如果每一步都采取特定行动序列」的反事实结局 模型预测控制(MPC) 正确指定所有模型时无偏
IPTW 用逆概率权重消除时变混杂 重要性采样(IS) 正确指定处理模型时无偏
双重稳健 结合 G-formula + IPW 双重鲁棒 IS 至少一个模型正确时一致

RL 的信用分配方法(TD、eligibility traces)最接近 IPTW 的逻辑:它们都用「衰减权重」来分配信用。但 RL 通常不关心因果识别的假设(如是否有时变混杂),而是依赖「数据足够多、探索足够充分」来逼近最优策略。这是工程上可行的——但当奖励信号稀疏、序列很长、或探索受限时,RL 的信用分配可能系统性地错误归因。

实践启示:何时用 RL,何时用因果推断

场景 推荐方法 原因
在线实时决策(广告竞价、推荐系统) RL 因果推断的估计成本太高,RL 的快速迭代更实用
事后政策评估(「这个干预有效吗?」) 因果推断 需要因果保证(反事实识别),不能只靠试错
离线策略优化(「下次怎么改进?」) 因果推断 + RL 用因果方法估计反事实 → 用 RL 优化策略
药物剂量序列优化 因果推断(G 方法) 错误归因的代价太高(患者安全),必须保证因果有效性
A/B 测试的长期效应 因果推断 RL 的信用分配在短期 + 稀疏奖励下容易系统偏倚

一个未完成的桥

信用分配问题暴露了因果推断和强化学习之间一个尚未被充分探索的连接:

  • 因果推断擅长回答「是否」和「多少」:处理 A 导致了结局 Y 吗?效应多大?
  • RL 擅长回答「何时」和「如何」:在当前状态下该采取什么行动?何时应该探索新策略?

一个成熟的「因果 RL」(Causal RL)框架应该能同时: 1. 用因果推断识别「哪些状态-行动对真的有因果效应」(而不只是相关) 2. 用 RL 学习「在哪些状态下优先选择有因果效应的行动」

目前,这个方向仍然是前沿研究——但它指向了「数据驱动决策」的终极形态:在因果保证下做探索和优化

跨域链接

  • 关联不等于因果——可交换性是分界线:信用分配问题在根本上是一个时序可交换性问题——我们能否假设历史奖励的未来分布不变?
  • 博弈论基础——策略互动的数学语法:博弈论中的 Thompson Sampling 和 counterfactual regret minimization 共享 RL 的信用分配基础。
  • 频率推断核心张力——工具禁止直觉理解:RL 的折扣因子 γ 是一个隐式因果假设——关于效应随时间衰减的信念。
  • 机器学习失败金字塔——算法选择是塔尖:RL 是唯一内嵌决策的 ML 范式。信用分配是 RL 与因果推断共享的技术基础。
  • 因果推断方法阵营——分歧不在数学:G 方法族可被视为"有因果保证的信用分配"——两种领域解决同一类时序归因问题。
  • 决策理论三张面孔——规范描述规定:信用分配的结果最终服务于决策——从"哪一步的功劳"到"下一步该做什么"。
  • 度量选择是元决策——选错比没有更危险:RL 的奖励函数设计本质上是度量选择问题——选错奖励信号导致错误信用分配。
  • 自适应实验与多臂老虎机——从固定到动态:Bandit 的探索-利用是信用分配的特例——单步信用分配的简化版本。
  • 贝叶斯决策理论——从概率信念到最优行动:贝叶斯 RL 将信用分配嵌入后验更新的框架中——从信念到行动的统一路径。
  • 预测因果决策是三个不同技术层:信用分配正位于三层模型的因果层与决策层之间——归因后果然后优化行动。\n\n## 追加——网络结构约束下的信用分配(2026-07-02 常青化)\n\n本轮追加将信用分配问题从独立序列扩展到网络结构和博弈论环境。\n\n在线最短路径——结构性分解的信用分配:在线最短路径问题中,观测到路径总延迟后需要将延迟反推给各组成边的延迟。这与因果推断的层级效应估计在数学上同构——将总体效果分解为各处理步骤的贡献。网络结构约束使信用分配变得更容易(共享参数带来信息跨路径流动),但需要更复杂推理(从总和中反推被加数)。\n\n博弈论环境中的交互式信用分配:在多 Agent 环境中(Axelrod 囚徒困境),每个 Agent 除了为自身行动进行信用分配,还需推理「环境变化是我还是对方引起的」。Tit-for-Tat 的有效性源于粗粒度的信用分配(快速判断而非精确估计),在非平稳博弈论环境中可能比精确的 G 方法更实用。\n\n这些追加使信用分配的连接从因果↔RL 扩展为因果↔RL↔博弈论的三角结构。