博弈论基础
介绍策略、收益与均衡等核心概念,通过静态与动态博弈的基本模型说明在相互依赖决策环境下如何推演理性行为结果。
1. 为什么需要博弈论?
在供需和厂商理论中,我们往往假定“单个决策者的行为不会影响整体价格或他人决策”。但在许多重要场景中:
- 寡头企业定价、扩产要看竞争对手反应
- 平台之间打补贴战会互相踩踏
- 政府与市场参与者之间存在监管与规避的互动
这种“我的最优选择取决于对方怎么选”的环境,就是博弈论要处理的问题。
2. 基本要素:参与人、策略、收益
一个最简单的静态(一次性)博弈通常包含:
- 参与人(players):做决策的个体或组织
- 策略(strategies):每个参与人可选择的行动集合
- 收益(payoffs):在给定策略组合下,每个参与人得到的结果(可以用效用或利润表示)
用记号写:
- 参与人集合:
N = {1, 2, ..., n} - 玩家
i的策略集合:S_i - 策略组合:
s = (s_1, ..., s_n) - 玩家
i的收益函数:u_i(s_1, ..., s_n)
在双人、有限策略的静态博弈中,常用支付矩阵来表示。
3. 支付矩阵与囚徒困境
以最经典的“囚徒困境”为例。两个嫌疑人 A、B 分别有两种策略:
- 沉默(S)
- 招供(C)
收益矩阵(数字越大表示越好,或者服刑年限越少):
| B: S | B: C | |
|---|---|---|
| A: S | (2, 2) | (0, 3) |
| A: C | (3, 0) | (1, 1) |
解释:
- 双方都沉默:各得 2(中等刑期)
- 一方招供、另一方沉默:招供者得 3(轻判),沉默者得 0(重判)
- 双方都招供:各得 1(普通刑期)
直觉上:
- 共同沉默 (S, S) 的总收益最高(2 + 2 = 4),对双方都更好
- 但在理性、彼此无法沟通且只关心自身收益的条件下,(C, C) 会成为稳定结果
这就是博弈论中的纳什均衡所刻画的现象。
4. 最佳回应与纳什均衡
4.1 最佳回应(Best Response)
给定其他玩家的策略 s_{-i},玩家 i 的最佳回应集合定义为:
$ BR_i(s_{-i}) = { s_i \in S_i \mid u_i(s_i, s_{-i}) \ge u_i(s'i, s{-i}), \forall s'_i \in S_i } $
即:在其他人策略固定的情况下,使玩家 i 的收益最大化的所有策略。
4.2 纳什均衡(Nash Equilibrium)
一个策略组合 s^* = (s_1^*, ..., s_n^*) 是纳什均衡,若对每个玩家 i 都有:
$ u_i(s_i^, s_{-i}^) \ge u_i(s_i, s_{-i}^*), \quad \forall s_i \in S_i $
也就是:
在均衡点上,给定其他人的策略,没有任何一个玩家能通过单方面改变自己的策略来提高收益。
换句话说,均衡是“互为最佳回应”的策略组合。
4.3 囚徒困境中的纳什均衡
回到囚徒困境:
- 若对方选择沉默(S),自己选择招供(C)可以从 2 提高到 3 → C 是更好的回应
- 若对方选择招供(C),自己选择招供(C)可以从 0 提高到 1 → C 也是更好的回应
因此:
- 对 A 来说,C 是支配 S 的优势策略(dominant strategy)
- 对 B 同理
结果:(C, C) 成为唯一的纳什均衡,即使它在帕累托意义上劣于 (S, S)。
5. 静态博弈的其他经典例子(直观)
协调博弈(coordination game)
- 如两家企业选择兼容的技术标准,大家更希望选同一个
- 可能存在多个均衡,如何达成“好”均衡涉及预期与信号
“胆小鬼”博弈(Chicken game)
- 双方都强硬会导致最坏结果,任一方让步则另一方占优
- 用于描述价格战、边界冲突中的“谁先眨眼”问题
这些例子说明:纳什均衡可能不唯一,也可能并非总是“最好”的社会结果。
6. 动态博弈与子博弈精炼均衡(简要)
很多现实互动具有时间结构:一方先行动,另一方后行动。比如:
- 先进入者设定高产能,潜在竞争者决定是否进入
- 政府先制定监管框架,企业再决定合规还是规避
这类情形可用动态博弈(extensive form game)表示,其求解通常使用:
6.1 逆向归纳法(Backward Induction)
从博弈的最后一步开始,依次向前推:
- 假设在每个终点节点,玩家只关心自身收益,会选出对自己最有利的行动
- 把这些结果“回填”到上一级节点,作为后续反应的预期
- 如此向前推,得到起点处每个玩家的最优策略
6.2 子博弈精炼纳什均衡
某些静态纳什均衡在动态结构下不合理(依赖于不可信的威胁)。
子博弈精炼纳什均衡(Subgame Perfect Nash Equilibrium, SPNE)要求:
策略组合在博弈树的每一个子博弈中都是纳什均衡。
这剔除了依赖“不可信威胁”的均衡,在分析进入阻止、惩罚策略等问题时尤为重要。
7. 与产业组织和政策分析的联系
博弈论为理解企业与政策行为提供了统一视角:
- 寡头定价与产量竞争:古诺、伯特兰模型解释价格战和合谋的条件
- 进入阻止与进入威胁:大规模前期投资可以构成“承诺”,影响潜在进入者判断
- 拍卖与投标:不同拍卖规则对应不同的激励与均衡结果
- 监管与合规:罚款力度、检查概率等如何影响企业违法与合规的决策
在本知识库的后续章节中,寡头结构、平台竞争以及部分金融市场行为都可以借助博弈论框架来理解。
8. 小结
本篇提供了博弈论的入门语言:
- 用“参与人—策略—收益”的结构描述相互依赖的决策环境
- 用“最佳回应—纳什均衡—子博弈精炼均衡”刻画稳定结果
- 通过囚徒困境等例子展示个体理性如何与集体最优发生张力
掌握这些基础概念后,你可以在后续的市场结构、产业组织和政策分析中,把任何“各方在互相揣摩又彼此影响”的场景抽象为一个博弈,从而更系统地推演可能的结果。