Skip to content

重复囚徒困境与阿克塞尔罗德锦标赛——直接互惠如何在没有中央权威时自发产生合作

原文提炼

阿克塞尔罗德锦标赛的核心发现

"In a single-round Prisoner's Dilemma, defection strictly dominates. But when the game is repeated indefinitely, cooperation can emerge as an equilibrium strategy — and the simplest strategy, Tit-for-Tat, consistently outperforms far more complex ones."

四个冠军属性(从两届锦标赛 200+ 策略中提炼): 1. 善意(Nice):绝不首先背叛 2. 报复性(Retaliatory):对背叛立即回应背叛 3. 宽容(Forgiving):对方恢复合作后立即恢复合作 4. 清晰(Clear):策略逻辑简单透明,对手能预测

以牙还牙(Tit-for-Tat)的数学基础

在无限次重复囚徒困境中,设贴现因子 \(\delta \in (0,1)\),合作的价值为:

\[\text{合作收益} = \frac{R}{1-\delta} \quad \text{vs} \quad \text{背叛收益} = T + \frac{\delta P}{1-\delta}\]

其中 \(R > \frac{T + \delta P}{1-\delta}\) 是合作成为均衡的条件,\(\delta\) 越大(未来越重要),合作越容易维持。

Axelrod 库的三层架构

层次 内容 对应概念
策略层 200+ 策略(TFT/GTFT/WSLS/...) 博弈策略空间
锦标赛层 循环赛 + 淘汰赛 均衡选择
种群层 Moran 过程 + 生态模拟 演化动力学

其中 Moran 过程模拟有限种群中的策略自然选择——种群中适应度高的策略复制自身替代低适应度策略,是随机演化博弈论的计算实现

三条核心洞见

  1. 简单胜过复杂:TFT 仅需记住上一轮对方的行为,击败了大量需要用长记忆和概率模型的复杂策略。原因:在噪声环境中复杂策略的微调本身引入错误。
  2. 合作不是利他而是开明自利:在重复博弈中合作是理性策略,不需要外在道德约束。只需 \(\delta\) 足够大。
  3. 演化稳定性不等于最优性:TFT 在锦标赛中排名第一,但在演化模拟中后来被更宽容的 Generous-TFT 替代——宽容在噪声环境中更有适应优势。

跨域链接