HUR 模型——用 Habits-Utility-Rationality 三层整合将 RL 出行推荐从纯优化变成行为感知的个性化引擎¶
核心操作¶
核心问题:标准 RL 路线推荐假设用户是纯理性效用最大化者——但真实的出行选择受习惯(昨天走的路今天还走)、有限理性(损失厌恶、现状偏见)和社会影响支配。
HUR 三层模型:
| 层 | 含义 | RL 中的编码 |
|---|---|---|
| Habits(习惯) | 重复过去选择的惯性 | 过去选过的路线获得惯性加分 → 降低探索率 |
| Utility(效用) | 传统理性权衡 | 时间 × 成本 × 舒适度的加权求和 |
| Rationality(有限理性) | 行为偏差 | 损失厌恶(切换路线的「损失框架」)、现状偏见(默认选项效应)、社会影响(「你邻居比你少排 30% 碳」) |
广义成本函数——RL agent 的学习目标不是最小化时间,是最小化个性化广义成本:
每个用户的 α₁...α₆ 由 RL agent 从历史选择中学习——不是事先设定的,是从用户的真实行为中反向推断的偏好权重。
行为助推引擎——利用 HUR 模型的输出来设计助推: - 损失框架:「不开车你每个月省 €120」(不是「开电车更环保」)——利用损失厌恶 - 社会证明:「你 78% 的邻居上周用了公共交通」——利用社会规范 - 承诺机制:「设一个每周少开 2 天车的目标」——利用一致性偏好
💡 关键教训¶
HUR 模型的核心启示:标准 RL 失败的原因常常不是算法差——是奖励函数假设用户是理性效用最大化者,但习惯和有限理性才是真实行为的主要驱动力。在推荐系统中,建模「不做改变」的惯性比建模「最优选择」更重要——因为大多数用户的默认行为不是最优,而是昨天的选择。
个性化权重学习的陷阱:从用户的历史选择反向推断 α₁...α₆ 假设显示偏好 = 真实偏好——但用户选路线 A 可能是因为不知道路线 B 存在(信息约束),而不是偏好 A。RL agent 会因此强化用户的现有选择,而不是帮助用户发现更好的选择。修正:在推荐中保留 10-20% 的探索率,强制展示用户从未选过但广义成本更低的路线。
助推的伦理边界:损失框架(「不开车一年亏 €1,440」)有效,但如果用户的真实最佳选择确实是开车(例如通勤距离太远、公交不覆盖),助推就是在操纵而非帮助。助推应该增大用户的选择集——展示他们不知道的选项——而不是扭曲已知选项的感知价值。