LLM 作为实验对象——在 GPT-4 上运行独裁者博弈和囚徒困境来研究 AI 的合作行为模式¶
核心操作¶
研究范式:将行为经济学的标准实验工具(Dictator Game、Ultimatum Game、Prisoner's Dilemma)应用于 LLM,通过 prompt 构建实验场景,观察模型的决策模式。
六个经典博弈实验在 LLM 上的映射:
| 博弈 | 人类行为基线 | LLM 研究问题 |
|---|---|---|
| 独裁者博弈 | 大多数独裁者会给出 20-30%(非零) | LLM 是否有公平偏好? |
| 最后通牒博弈 | 低于 30% 的出价常被拒绝(惩罚不公平) | LLM 会为了公平而牺牲自身利益吗? |
| 囚徒困境 | 约 50% 合作,合作率随重复下降 | LLM 在重复博弈中的合作动机是什么? |
| 公共品博弈 | 初始贡献 40-60%,随轮次递减 | LLM 搭便车吗? |
| 信任博弈 | 初始信任度高(~50%),互惠普遍 | LLM 信任陌生人且回报信任吗? |
| 选美竞赛 | 人类平均推理 1-2 层 | LLM 的层级推理深度是多少层? |
Prompt 构建的核心艺术:不是数学参数化(把博弈矩阵塞进 system prompt),而是自然语言场景构建——「你是一个参与者,另一个参与者是 [描述]。你可以选择 A 或 B。如果两个人都选 B,各得 ¥10…」
💡 关键教训¶
LLM 的合作行为高度依赖 prompt phrasing 和 persona——这与人类行为被框架效应影响的模式完全一致。同一个囚徒困境,描述为「经济博弈」vs「社交互动」→ 合作率差异显著。这意味着 LLM 行为经济学实验的「被试效应」不是 bug——它是 LLM 表现出类人认知偏差的证据。
层级推理深度:GPT-4 在选美竞赛(Beauty Contest)中表现出一致的 2-3 层推理深度(「我认为你会选 X,然后我会基于你认为我会选什么来调整」),这与专业经济学家(3-4 层)接近但略低于受过专门训练的人类。GPT-3.5 停留在 1-2 层——推理深度随模型能力提升而增加,提示更大的模型可能表现出更深的反事实推理。
AI 对齐的启示:如果 LLM 在博弈中表现出公平偏好和合作倾向,这些行为是「真实偏好」还是「训练数据中的人类行为模式的模仿」?这个问题的答案直接决定了我们是否可以将 LLM 的合作行为视为可靠的——如果是模仿,换一个 prompt 就可能背叛;如果是涌现的偏好,合作关系就是鲁棒的。研究结论:目前的证据指向「语境依赖的高级模式匹配」而非「稳定的内在偏好」。