- "[[贝叶斯与频率学派分歧在概率的定义]]"
- "[[决策理论三张面孔]]" sources:
- 贝叶斯与频率学派分歧在概率的定义
- 决策理论不只规范和描述二分-存在规定理论
- 贝叶斯因子量化证据强度p值只能拒绝
- 先划分后预处理防止数据泄露
- thompson-sampling-tutorial-russo
- 决策科学Notebooks全集19个端到端行业实战从金融风控到安全ROI tags: [贝叶斯决策理论, 期望效用, 后验决策, VoI, 规范决策] created: 2026-06-29---
贝叶斯决策理论——从概率信念到最优行动,最大化期望效用是规范决策的数学核心¶
表面关联¶
贝叶斯统计量化不确定性(后验分布),决策理论规定行动选择(最大化效用)。两者在概念上相邻但在实践中常被当作独立的学科处理——贝叶斯属于统计系,决策属于商学院。
深层结构¶
贝叶斯决策理论是一个单一的公式,将两个域统一在同一个数学框架中:
解读: - \(P(\theta \mid D)\) = 贝叶斯后验——「在看见数据 D 之后,我对世界状态 θ 的信念」 - \(U(a, \theta)\) = 效用函数——「如果在世界状态 θ 下采取行动 a,我能获得多少价值」 - \(\int U \cdot P \, d\theta\) = 期望效用——加权平均所有可能的世界状态 - \(\arg\max_a\) = 选最优行动
这不是「贝叶斯 + 决策」——这是两者在数学上的必然结合。一旦你接受了「概率是信念程度」(贝叶斯)和「我们应该最大化期望效用」(规范决策),贝叶斯决策理论就必然推导出来。
这条公式解释了 Zettelkasten 中的多个核心概念¶
VoI(信息价值)是贝叶斯决策理论的直接推论:
VoI = 有更多信息后的最优期望效用 − 当前信息下的最优期望效用。这不是一个独立的框架——它是贝叶斯决策理论中「后验更新改善决策」的数学表达。
贝叶斯因子 vs p 值的决策含义:
| 频率学派 (p 值) | 贝叶斯 (贝叶斯因子) | |
|---|---|---|
| 输出 | 「在 H₀ 下看到这些数据的概率」 | 「数据支持 H₁ 多于 H₀ 多少倍」 |
| 决策含义 | α = 0.05 是「控制假阳性率」——一个质量保证规则 | 后验概率 × 损失函数 = 最优行动——一个完整的决策框架 |
| 到行动的路径 | 间接:拒绝 H₀ → 「应该考虑备择」 → 但具体怎么做? | 直接:后验概率 → 期望效用 → 最优行动 |
频率学派没有内置的「从统计推断到行动」的路径——你必须外挂一个决策框架(通常是非正式的「如果 p < 0.05 就接受备择假设」)。贝叶斯将统计推断和决策统一在同一个公式中。
贝叶斯 A/B 测试的决策优势不是「贝叶斯更好」——是「贝叶斯直接支持决策」。频率学派 A/B 测试告诉你「B 是否显著不同于 A」(p 值),但产品经理想知道「上线 B 方案的期望收益是多少?」——后者是贝叶斯决策理论回答的问题:\(E[\text{收益}] = \int (\text{转化率}_B - \text{转化率}_A) \times \text{流量} \times \text{客单价} \, P(\text{参数}|D) \, d\text{参数}\)。
贝叶斯决策理论解释了三张面孔¶
- 规范层面:贝叶斯决策理论定义了「完全理性的人在不确定性下应该如何决策」——它是规范决策的数学核心。
- 描述层面:真实的人不使用贝叶斯决策理论——他们用启发法、受损失厌恶支配、概率权重扭曲。
- 规定层面:可以从贝叶斯决策理论出发,加入「人类的认知限制」(有限计算、有限信息、有限时间)→ 推导出一套规定工具(决策矩阵代替期望效用积分、AHP 代替连续概率分布、事后验尸代替反事实模拟)。
规定决策工具 = 贝叶斯决策理论的有限理性近似。
启发¶
为什么大多数组织的「数据驱动决策」困在描述性分析——不是因为缺乏工具,是因为缺少从概率到行动的数学桥梁。一个团队可以用 Logistic 回归预测流失概率(频率学派),但不知道从「流失概率 23%」到「应该打几折」的路径。贝叶斯决策理论提供了这个路径:\(a^* = \arg\max_{a \in \{\text{不打折}, 9折, 8折, 7折\}} \sum_{\theta} U(a, \theta) \times P(\text{流失}|\theta, D)\)——后验概率 × 行动效用,遍历所有行动,选最好的。
但也解释了为什么不直接用贝叶斯决策理论——完整的贝叶斯决策理论要求:1) 所有参数的后验联合分布(计算代价极高),2) 对所有行动在所有可能世界状态下的完整效用函数(通常没有)。规定工具的存在就是为了在这种信息不完整的情况下做出「足够好」的决策——不是最优,但比什么都不做好得多。
跨域链接¶
- 度量选择是元决策——选错比没有更危险:效用函数的选择本质上是度量选择问题——选错效用函数,贝叶斯决策理论给出"最优但方向错"的行动。
- 机器学习失败金字塔——算法选择是塔尖:从预测到决策的桥梁——ML 模型的输出如何通过贝叶斯决策理论转化为行动。
- 决策理论三张面孔——规范描述规定:贝叶斯决策理论是规范决策的数学核心——规定工具(AHP、决策矩阵)是它的有限理性近似。
- 贝叶斯与频率学派分歧——不是方法偏好:贝叶斯决策理论依赖贝叶斯概率定义——"概率是信念程度"是 \(P(\theta|D)\) 的基础,频率学派无法提供这个输入。
- 频率推断核心张力——工具禁止直觉理解:频率学派没有内置的"从推断到行动"路径——必须外挂决策框架,贝叶斯将两者统一在一个公式中。
- 博弈论基础——策略互动的数学语法:博弈论中的期望效用最大化与贝叶斯决策理论共享同一数学结构——区别仅在多玩家 vs 单玩家。
- 关联不等于因果——可交换性是分界线:贝叶斯决策理论的后验更新依赖可交换性——未来数据与历史数据来自同一分布。
- 自适应实验与多臂老虎机——从固定到动态:Thompson 采样是贝叶斯决策理论在序贯决策中的原生实现——后验采样→最优回应→更新后验。
- 实验设计与在线对照实验——从显著到可信:贝叶斯 A/B 测试相比频率学派 A/B 测试的唯一优势——直接支持决策(期望收益计算),而非仅拒绝零假设。
- 概率分布选择不是数学偏好——编码对数据生成过程的假设:贝叶斯决策理论中先验分布和似然函数的选择——编码了决策者的世界模型假设。
- 信用分配是时序因果推断与强化学习的共同根:贝叶斯 RL 将信用分配嵌入后验更新——从"哪一步的功劳"到"下一步选什么"。
- 预测因果决策是三个不同技术层:贝叶斯决策理论位于三层模型的决策层核心——接收因果层的效应估计,输出最优行动。\n\n## 追加——贝叶斯决策在在线环境中的实时演示(2026-07-02 常青化)\n\n本轮追加将贝叶斯决策理论从数学框架推进到实时决策和实验校准层面。\n\nThompson 采样——贝叶斯决策的实时化:Thompson 采样是贝叶斯决策理论的最小可实现原型:先验 Beta → 观测 Bernoulli → 后验更新 → 从后验随机采样 → 选最优臂。这四步精确复现了贝叶斯决策理论的完整逻辑(信念→观测→更新→行动),但压缩到一个可每秒执行数百次的在线循环。Thompson 采样揭示了贝叶斯决策理论的真正力量:当先验-后验循环足够快时,可同时学习环境并做决策。\n\n决策科学 Notebooks——作对照实验的行为经济学:行为经济学实验(prospect theory 的损失厌恶、time inconsistency、ambiguity aversion)提供了贝叶斯决策理论的「对照版本」——人类如何实际偏离规范决策理论,为构建有界的贝叶斯 Agent 提供校准数据。