Skip to content
  • 概念笔记「机器学习失败金字塔」
  • 概念笔记「关联不等于因果」
  • 概念笔记「因果推断方法阵营」
  • 概念笔记「决策理论三张面孔」 sources:
  • 共形预测无分布不确定性量化AngelopoulosBates2022
  • 微软ExP实验平台建设从工程挑战到组织文化变革Kohavi2009
  • twyman法则
  • 探索利用困境统一序贯决策抽象---

预测、因果、决策是三个不同的技术层——混淆它们是数据驱动决策项目最常见的失败模式

三个问题,三种方法,三层保证

任何一个数据驱动决策问题,都隐含地包含了三个层次的问题。这三个层次需要不同的技术、不同的假设、和不同的验证逻辑:

问题层次          回答的问题是              需要的方法          需要的数据特征
─────────────────────────────────────────────────────────────────────
第1层:预测       「会发生什么?」           监督学习             特征与标签的关联
                  「哪些客户会流失?」       分类/回归            相关 = 足够
                  「明天销量多少?」

第2层:因果       「如果我做X,              因果推断             反事实识别
                  会发生什么?」             IV/DID/RDD/IPW       可交换性
                  「打折能留住客户吗?」      双重稳健            相关 ≠ 足够

第3层:决策       「我应该做什么?」          强化学习             奖励信号
                  「给谁打几折?」            运筹优化             反事实 + 效用
                  「预算怎么分配?」          决策分析             因果 + 价值判断

每一层向上,都增加一个根本性需求: - 从预测到因果:你需要回答的不再是「A 和 B 是否同时出现」,而是「A 是否导致了 B」——这需要反事实识别 - 从因果到决策:你需要回答的不再是「是否有因果效应」,而是「哪种因果效应最有价值」——这需要价值函数

最常见的失败模式:把预测当决策

一个典型的数据驱动决策项目循环:

1. 业务问:「怎么能减少客户流失?」
2. 数据团队建了一个流失预测模型 → AUC 0.85
3. 业务根据预测结果给高风险客户发优惠券
4. 流失率没降——因为预测模型告诉你「谁会流失」
   但不告诉你「优惠券能不能阻止流失」

预测模型输出的是 P(流失 | 客户特征),即「给定客户的历史行为,他流失的概率是多少」。但业务决策需要的是 P(流失 | do(发优惠券))——一个因果问题。

预测模型只在「世界不会因你的行动而改变」的假设下等价于决策模型——而这个假设在所有业务决策场景中都不成立。你发了优惠券,客户的行为就改变了,而预测模型从未被训练来回答「行动之后会发生什么」。

因果推断:从预测到决策的桥

因果推断正好坐落在预测和决策之间。它不直接告诉你「应该怎么做」,但告诉你「每种选项的后果是什么」:

选项 因果推断能回答的 因果推断不能回答的
给客户发10元券 相对于不发,流失率降 3% (±1.5%) 这个效果值不值10元?
给客户打电话 相对于发券,流失率降 5% (±2%) 5% vs 3% 哪个更值得?
不管(维持现状) 基准线

因果推断给出了每个行动选项的后果估计——这是决策所需的关键输入,但不是决策本身。将因果估计转化为决策还需要: 1. 价值函数:一个百分点的流失减少值多少钱? 2. 约束条件:总预算、公平性要求、合规限制 3. 风险偏好:你对不确定性的容忍度有多高?(一个「均值有利但方差巨大」的选项和一个「均值一般但稳定」的选项,你选哪个?)

决策理论的位置:价值判断不可委托

决策理论(特别是规定理论)明确了一个核心原则:价值判断不能被数据替代。数据可以告诉你「选项 A 导致结果 X,选项 B 导致结果 Y」,但无法替你决定 X 和 Y 哪个更好——这是你的价值函数,不是数据的属性。

这解释了为什么: - α = 0.05 不是一个统计常数,而是一个决策:选择 α = 0.05 等价于声明「第一类错误(假阳性)的成本是第二类错误(假阴性)的 20 倍」——但这在制药审批和营销 A/B 测试中显然不该是同一个数字 - 效应度量的选择(RD vs RR vs OR)是政治而非统计:医药公司用 RR 说「风险降低 50%」,卫生技术评估必须用 RD 计算 NNT 做成本效益决策——同一个研究、同一个数据、不同的度量给出完全不同的政策含义 - 贴现率暴露了「纯粹技术分析」的神话:高贴现率 = 未来人的福祉不重要——这是价值判断,不是模型输出

实践:如何在项目中不混淆三层

阶段 0:明确你问的是哪一层的问题

在开始任何分析之前,写下你要回答的问题,并标注它属于哪一层:

问题 层次 如果误用预测模型
「上季度哪个渠道 ROI 最高?」 预测/描述 ✅ 预测模型足够
「如果我们停掉渠道 A,收入会跌多少?」 因果 ❌ 预测模型只能告诉你渠道 A 和收入有关联,不能告诉你停掉的后果
「明年的预算应该怎么分配?」 决策 ❌ 预测 + 因果都不足够——还需要约束优化和价值判断

阶段 1:每上升一层,检查你是否具备条件

  • 预测 → 因果:你有可交换性吗?(随机化?面板结构?制度阈值?工具变量?丰富协变量?)——如果都没有,诚实地停留在「预测 + 关联分析」,并声明「我们不知道因果关系」
  • 因果 → 决策:你有明确的价值函数吗?如果业务干系人无法给出「一个百分点的流失减少值多少钱」,那么任何「最优决策」都没有意义——因为最优是相对于价值函数定义的

阶段 2:承认你不知道的部分

最危险的结论不是「我们不知道」,而是「我们在回答第二层的问题,但用了第一层的方法,得到了第三层的结论」——把预测模型的关联当作因果,再把因果当作决策建议。

一个诚实的结论应该是: - 「预测模型发现 A 和 B 相关,但我们不知道 A 是否导致 B」→ 第一层 - 「DID 分析发现政策 X 导致结果变化 Y,但这个结果变化是否值得政策的成本取决于价值判断」→ 第二层 - 「给定价值函数 V,在约束 C 下,最优方案是 Z」→ 第三层

三层都不缺 ≠ 三层都完美。但三层中缺了一层却不知道自己缺了 = 系统性的失败。

跨域链接

  • 博弈论基础——策略互动的数学语法:博弈论在三层模型中同时运作——预测对手行为(预测层)→ 计算自身行动的因果效应(因果层)→ 选择最优策略(决策层)。
  • 度量选择是元决策——选错比没有更危险:三层模型的每一层都有独立的度量选择问题——预测层选 RMSE/AUC,因果层选 ATE/CATE,决策层选利润/效用。
  • 机器学习失败金字塔——算法选择是塔尖:预测层的失败模式——模型过拟合、特征泄漏、评估指标错误——是 ML 失败金字塔的前三层。
  • 关联不等于因果——可交换性是分界线:从预测层升到因果层的核心障碍——可交换性是否成立。
  • 因果推断方法阵营——分歧不在数学:因果层的工具矩阵——IV/DID/RDD/PSM 各解决一类可交换性违反。
  • 决策理论三张面孔——规范描述规定:决策层的理论基础——规定理论解释为什么价值判断不能委托给数据。
  • 频率推断核心张力——工具禁止直觉理解:预测层的统计基础——频率学派的推断工具支撑数据到预测的链路。
  • 贝叶斯与频率学派分歧——不是方法偏好:三层模型中贝叶斯和频率学派的自然分工——预测层频率学派更自然,因果与决策层贝叶斯更自然。
  • 实验设计与在线对照实验——从显著到可信:A/B 测试是因果层的黄金标准方法——随机化消除混杂,但三层模型的框架揭露了 A/B 测试的能力边界(只能回答因果问题,不能回答决策问题)。
  • 自适应实验与多臂老虎机——从固定到动态:Bandit 同时横跨因果层和决策层——探索收集因果信息,利用执行最优决策。
  • 贝叶斯决策理论——从概率信念到最优行动:贝叶斯决策理论是连接因果层和决策层的数学桥梁——后验 \(P(\theta|D)\) × 效用 \(U(a,\theta)\) → 最优行动 \(a^*\)
  • 信用分配是时序因果推断与强化学习的共同根:信用分配横跨三层——TD 学习在预测层,G 方法在因果层,策略优化在决策层。\n\n## 追加——预测与决策间的分布自由桥梁(2026-07-02 常青化)\n\n本轮追加补全了三层模型中最容易断裂的连接:从预测到因果的统计验证。\n\n共形预测——当预测间隔不需要分布假设:传统上,预测层输出的点估计或带正态假设的置信区间是「不可靠的中间品」。共形预测提供了分布自由的预测区间(仅需可交换性),为三层模型创建了更硬的连接:预测层用共形预测输出有限样本有效的预测集,因果层在更干净的预测误差估计上构建效应模型。\n\n微软 ExP——三层模型的工业级验证:Kohavi 2009 论文无意中为三层模型提供了产业界验证——微软实验平台的 Crawl→Walk→Run→Fly 路径对应着组织从混淆预测与决策→分离因果层→整合决策层→三层完整框架的进化。⅔ 创意失败率的数据点揭示了三层混乱的系统性代价——当团队直觉被误用为决策依据时。\n\n这些追加使三层模型具备了分布自由的预测验证(共形预测)和工业级验证路径(微软 ExP)两个关键可操作组件。