Skip to content

博弈论与网络科学的计算实验——从囚徒困境锦标赛到 Agent 建模

一句话总结

axelrod 和 mesa 分别代表了博弈论和网络科学的计算路径——axelrod 通过超过 200 种策略的囚徒困境锦标赛探索了"合作如何在自私个体间涌现",mesa 通过 Agent-Based Modeling 将微观交互规则转化为宏观涌现现象。

工具全景

         ┌────────────────┐     ┌─────────────────────┐
         │   博弈论计算    │     │   网络科学计算       │
         ├────────────────┤     ├─────────────────────┤
策略空间 │ axelrod        │     │ mesa                │
         │ 200+ 囚徒困境  │     │ Agent-Based Modeling│
         │ 策略           │     │ 框架                │
         ├────────────────┤     ├─────────────────────┤
分析层   │ 锦标赛         │     │ 网络拓扑            │
         │ Moran 过程     │     │ (网格/随机/小世界)   │
         │ 种群动态       │     │                     │
         ├────────────────┤     ├─────────────────────┤
涌现层   │ 合作进化       │     │ 信息级联            │
         │ TFT 的稳健性   │     │ 社会规范形成        │
         │                │     │ 谣言传播            │
         └────────────────┘     └─────────────────────┘

逐工具分析

1. axelrod — 囚徒困境策略的达尔文实验室

核心能力: - 200+ 已实现策略:从最简单的 Tit-for-Tat (TFT) 到复杂的基于机器学习的策略 - 锦标赛:所有策略两两对抗,累计总分——谁是最成功的策略? - Moran 过程:种群动态模拟——成功的策略繁殖(复制自己),失败的策略死亡(被替换)。经过多代演化,什么样的策略主导种群? - 结果可视化:payoff 矩阵热力图、策略聚类树状图、种群演化轨迹

策略谱系

策略类别 代表策略 核心思想
合作者 Cooperator 总是合作——容易被剥削
背叛者 Defector 总是背叛——短期获利但长期被孤立
以牙还牙 Tit-for-Tat (TFT) 第一次合作,之后复制对手上一轮行为——Axelrod 1984 锦标赛冠军
宽容版 TFT Generous TFT 偶尔原谅对手的背叛——避免"回声效应"(两个 TFT 互相报复的恶性循环)
怨恨型 Grudger 一旦被背叛,永远背叛——对失误零容忍
探测型 Prober 偶尔试探背叛,看对手反应——像 Bandit 中的探索
统计型 Bayesian/TF2T 基于对手历史行为估计其策略类型——像对手建模
自适应型 Adaptive 基于对手的最近行为动态调整合作概率——强化学习在博弈中的实例

Axelrod 的核心发现: 1. TFT 的"四性":善良(不首先背叛)、报复(对背叛不回合作)、宽容(如果对手重新合作,你也回归合作)、清晰(对手可以推断你的行为规则)——TFT 在 1984 年锦标赛中击败所有更复杂的策略 2. 没有单一最优策略:最优策略取决于环境——如果种群中几乎都是合作者,Defector 最优;如果都是背叛者,TFT 最优。策略的适应度是频率依赖的(frequency-dependent) 3. 合作的涌现不需要中央计划者:即使在自私个体的群体中,如果交互是重复的(未来阴影足够长),合作可以通过自然选择演化

与概念笔记的连接: - → 概念笔记「博弈论基础策略互动的数学语法」:axelrod 是 C1 概念笔记中 9 个原子概念的操作化实验室——你可以实验性地验证纳什均衡、演化稳定策略(ESS)、重复博弈中的 Folk 定理。TFT 在无限重复囚徒困境中是一个子博弈完美均衡 - → 概念笔记「自适应实验与多臂老虎机」:囚徒困境中的策略选择和 Bandit 中的臂选择是同一个问题的不同面——探索(试探对手以了解其策略)vs 利用(基于当前信念选择最优行动)。Prober 策略 = ε-Greedy Bandit - → 概念笔记「决策理论三张面孔」:囚徒困境展示了规范决策理论(个体理性 → 背叛)和描述决策理论(现实中人类在单次囚徒困境中合作率约 40-50%)之间的巨大鸿沟

2. mesa — Agent-Based Modeling 的 Python 框架

核心能力: - Agent 定义:每个 Agent 有自己的状态和行动规则(step 函数) - 空间拓扑:网格(Grid)、连续空间、网络图——Agent 在空间中的位置和移动 - 调度器:随机激活、同步激活、分阶段激活——Agent 以什么顺序行动? - 数据收集:自动记录每个时间步的 Agent 和模型级别变量 - 浏览器可视化:通过 Mesa 的 Web 模块在浏览器中实时观看 ABM 的演化

ABM 的核心设计原则: - 微观→宏观:你只定义 Agent 的微观规则("如果周围有 3 个以上的邻居是合作者,我也合作"),宏观现象(合作集群的形成、灭绝、稳定)是涌现的——你不需要编写"合作集群如何形成"的代码 - 异质性:Agent 可以有不同的参数(风险偏好不同的投资者、影响力不同的社交用户)——这比代表个体(representative agent)模型更真实 - 空间结构:Agent 在空间/网络中的位置决定了它们与谁交互——这引入网络效应和空间相关性

典型 ABM 应用场景: - 信息级联:Agent 根据邻居的公开行为更新私有信念——什么时候"跟风"是理性的?什么时候级联会断裂? - 社会规范演化:惩罚的演化——为什么人们愿意承担成本去惩罚不合作者(利他惩罚),即使惩罚行为本身也是公共品? - 隔离模型 (Schelling):即使是微弱的同质性偏好("我希望周围至少 30% 的邻居和我一样")也会导致完全隔离——种族隔离不一定是种族主义的结果 - 流行病传播 (SIR):在网络上传播的疾病——临界传播率、群体免疫阈值、超级传播者的作用 - 市场动力学:异质性交易者的资产价格形成——基本面交易者 + 趋势追随者 + 噪音交易者 → 价格泡沫和崩盘

与概念笔记的连接: - → 概念笔记「网络科学——从个体交互到集体涌现」:mesa 是网络科学的计算引擎——C10 中讨论的小世界网络、信息级联、SIR 模型、Schelling 隔离模型,都可以在 mesa 中运行和可视化。ABM 将网络科学从数学分析扩展到计算实验 - → 概念笔记「概率分布选择不是数学偏好」:ABM 中的随机性——Agent 的决策通常包含随机成分(ε-贪婪行动选择、以概率 p 突变、以概率 q 被说服)。分布的参数选择决定了涌现的动力学——Agent 行为中的噪音过多 → 无结构涌现,过少 → 锁死在局部均衡 - → 概念笔记「博弈论基础策略互动的数学语法」:ABM 中的策略演化 = 博弈论中的演化博弈——Agent 的支付(payoff)决定了复制(繁殖)或模仿(学习)的倾向。ABM 允许空间结构、异质性和有限理性,这些在解析的博弈论模型中难以处理

核心洞察

1. 复杂性的根源不在 Agent,在交互

一个简单的 Agent 规则("如果邻居中有更多人合作,我也合作")可以在网络上产生极其复杂的宏观模式——合作集群的形成、集群之间的边界移动、集群的合并和分裂。宏观的复杂性是微观交互的涌现属性,不需要复杂的 Agent。

关键参数: - 邻居数量 (k):局部交互 → 合作集群;全局交互 → 均匀混合(mean-field),接近解析模型的预测 - 噪音水平 (ε):小噪音 → 确定性动态(锁死);大噪音 → 随机动态(漂移) - 更新规则:同步更新(所有 Agent 同时决策)→ 可能振荡;异步更新(逐个 Agent 随机激活)→ 更稳定

2. 合作的进化——实验大于理论

理论告诉你:在单次囚徒困境中,背叛是严格占优策略。实验(axelrod 锦标赛)告诉你:当博弈重复且未来不确定时,合作不仅可以存活,还可以繁荣。Rapoport 的 TFT 用 4 行 Python 代码击败了经济学家、心理学家、数学家提交的数百行复杂策略。

TFT 的成功教训:好的策略应该(1)简单——对手能理解你,(2)明确——对手能预测你,(3)善意的——你给合作一个机会,(4)不天真——你不容忍持续的剥削。

3. ABM 是"如果...会怎样?"的科学工具

ABM 不是预测工具(你不会用 ABM 预测下周的股票市场),而是理解工具——它回答"在给定的微观规则下,什么样的宏观模式必然涌现?"这和物理学的"理想实验"(Galileo 的光滑斜面、Maxwell 的 demon)共享同一种科学精神——简化到本质,观察涌现。

跨域链接

  • → 概念笔记「博弈论基础策略互动的数学语法」:axelrod = C1 的计算实验平台——9 个原子概念(纳什均衡、占优策略、重复博弈、演化稳定策略等)都可以在 axelrod 中实验性操作
  • → 概念笔记「网络科学——从个体交互到集体涌现」:mesa = C10 的计算引擎——小世界网络、无标度网络、信息级联、SIR 传播等网络现象通过 ABM 从数学符号转化为可运行的实验
  • → 概念笔记「自适应实验与多臂老虎机」:策略演化 = Bandit + 博弈——Agent 通过与其他 Agent 互动"采样"不同行动的回报,并通过学习/进化"利用"高回报策略。这是多 Agent 强化学习 (MARL) 和演化博弈论的交汇点
  • → 概念笔记「决策理论三张面孔」:axelrod 的策略多样性展示了描述决策理论——不同策略编码了不同的决策启发式(TFT 的"以牙还牙"、Grudger 的"一次不忠百次不用"),这些启发式比规范决策理论("永远背叛")更贴近现实中人类的实际行为
  • → 概念笔记「概率分布选择不是数学偏好」:ABM 中的随机分布(Agent 决策噪音、迁移概率、突变率)决定了系统的分歧点——小噪音产生确定性宏观模式,大噪音产生随机漂移。选对噪音水平 = 选对涌现的粒度
  • → 概念笔记「贝叶斯与频率学派分歧」:信息级联的 ABM——Agent 使用贝叶斯规则从邻居的公开行为中推断隐藏信息(C2 的核心),mesa 将这个贝叶斯推断过程在网络上可视化
  • → 概念笔记「实验设计与在线对照实验」:ABM 以一组假设(微观规则)运行 → "对照组"是改变假设后重新运行 → ABM 在计算实验中实现了 C11 的"反事实"思想——如果 Agent 使用不同的策略/参数,宏观结果会如何?
  • → 桥接笔记「信用分配是时序因果推断与强化学习的共同根」:重复囚徒困境中的"回报归因"——TFT 在被 Defector 背叛后减少合作,本质上是将当前的坏结果(低收益)"归因"于对手上一轮的行动。这是时序信用分配在博弈论中最简单的实例