为什么两家便利店开在正对面却不约而同卖一样贵?为什么OPEC成员国总是偷偷超产?为什么“拼多多砍一刀”能裂变出几亿用户?这些看似无关的现象背后,是同一个分析框架——博弈论。

图1 复旦大学2026年硕士研究生招生考试自命题科目考试大纲725经济学专业基础
正文
博弈论是什么
博弈论是研究多个决策主体之间策略互动行为的数学理论。通俗地说,当你做决策时,不仅要考虑自己的选择,还要考虑对手会怎么反应,而对手的反应又会反过来影响你的收益。这种“你中有我、我中有你”的决策场景,就是博弈论的研究对象。
博弈的基本要素
一个完整的博弈由五个核心要素构成:
参与者:博弈中有哪些决策主体。可以是个人、企业、国家,甚至是动物或机器。
策略:每个参与者在博弈过程中可采取的行动方案。策略可以是简单的“合作或背叛”,也可以是复杂的价格、产量、广告投放等连续变量。
收益:参与者在每种策略组合下获得的结果,通常用效用、利润、市场份额等数值表示。收益矩阵是展示收益结构的常用工具。
信息:参与者在决策时知道些什么。完全信息意味着大家都了解所有参与者的策略和收益;不完全信息则意味着有人掌握私有信息。
均衡:博弈的最终结果——每个参与者都选择了最优策略后达到的稳定状态,没有人愿意单方面改变。
博弈的分类
合作博弈与非合作博弈:区别在于参与者之间是否存在有约束力的协议。非合作博弈是博弈论的主流,研究的是在没有强制协议的情况下理性人如何行动。
静态博弈与动态博弈:静态博弈中参与者同时行动(或虽不同时但后行动者不知道先行动者的选择),动态博弈中存在先后顺序且后行动者可观察到先行动者的选择。
零和博弈与非零和博弈:零和博弈中一方的所得恰好是另一方的所失(利益总和为零);非零和博弈中存在双赢或双输的可能。
占优策略
占优策略是指无论对手选择什么策略,该参与者选择某个策略所获得的收益都优于选择其他任何策略。当一个参与者拥有占优策略时,理性的他会毫不犹豫地选择它,完全不需要猜测对手的行为。
占优策略均衡
当所有参与者都拥有占优策略且都选择了自己的占优策略时,就达到了占优策略均衡。这是博弈论中最强、最稳定的均衡概念——因为每个人不管别人怎么做,选这个策略都是最好的。
(一)囚徒困境:个人理性导致集体灾难
经典故事
两个嫌疑人因共同犯罪被捕,被分开关押,无法串供。检察官分别对他们提出同样的交易:如果一人坦白而另一人沉默,坦白者立即释放,沉默者判刑10年;如果两人都坦白,各判8年;如果两人都沉默,各判1年(因证据不足)。
收益矩阵(年数,负值越大越坏) 囚徒B:沉默 囚徒B:坦白
囚徒A:沉默 A=-1, B=-1 A=-10, B=0
囚徒A:坦白 A=0, B=-10 A=-8, B=-8
分析过程
从囚徒A的角度看:如果B沉默,A坦白则获释(0年),A沉默则判1年——坦白更好;如果B坦白,A坦白则判8年,A沉默则判10年——坦白更好。所以“坦白”是A的占优策略。B的推理完全相同。于是两人都选择坦白,各判8年——这个结果(-8, -8)远差于两人都沉默的(-1, -1)。
核心启示
囚徒困境揭示了:在缺乏合作机制的情况下,个人理性可能导致集体非理性——每个人追求自己的最大利益,却把所有人都推向了更糟糕的结果。这一洞见深刻揭示了“看不见的手”的局限性,说明仅靠自利行为并不总能实现社会福利最大化。
现实中的囚徒困境
价格战:两家航空公司如果在同一航线上都维持高价,双方都能赚取高利润。但每家都有偷偷降价的诱惑——如果对手不降价,降价方可以抢走大部分乘客;如果对手也降价,不跟进者会被淘汰。结果双方都降价,利润都变薄。
广告竞赛:如果所有药企都不做广告,研发费用可以投入更多。但只要有一家开始做广告,其他家不跟进就会失去市场份额,最终大家都巨额投放广告,效果相互抵消,成本却居高不下。
公共资源过度使用:每个渔民都知道如果大家都少捕鱼,鱼类资源可持续恢复,长远对大家有利。但每个渔民也清楚:自己多捕一条就多赚一条,而资源耗竭的代价由所有人共同承担。于是每个人多捕,最终导致渔业枯竭——这就是“公地悲剧”。
军备竞赛:各国都明白裁军对大家都有利,但每个国家都担心别国不裁军,于是谁也不敢先裁,最终军费开支持续攀升。
(二)纳什均衡:没有后悔的稳定状态
什么是纳什均衡
纳什均衡是博弈论中最重要的均衡概念,由美国数学家约翰·纳什提出。它描述了一种状态:在给定其他参与者策略的条件下,每个参与者都选择了自己的最优策略,没有任何人有动机单方面偏离当前选择。
用一句话说:纳什均衡就是“谁先变谁吃亏”的状态——每一个参与者都在别人的策略下做了自己能做的最好的选择,所以没有人后悔。
囚徒困境中的纳什均衡
在囚徒困境中,(坦白,坦白)就是一个纳什均衡:给定B坦白,A坦白判8年、沉默判10年,A不会单方面改变;同理B也不会单方面改变。虽然(沉默,沉默)对两人都更好,但它不是纳什均衡——因为给定对方沉默,你单方面坦白就可以从判1年变成释放,你一定会变。
重要区分:纳什均衡不一定是帕累托最优的。囚徒困境就是典型例子——均衡结果(都坦白)对双方都不利,但它是稳定的。
寻找纳什均衡的方法
在收益矩阵中,最常用的方法是“划线法”:对每个参与者,在给定对手每个策略下找到自己的最优收益并在对应格子中划线。如果某个格子中所有参与者的收益下方都被划了线,该格子就是纳什均衡。
(三)重复博弈与走出囚徒困境
囚徒困境虽然看起来令人悲观,但在现实中并非无解。最重要的解决机制是重复博弈——如果博弈不是只进行一次,而是无限次或不确定次数地重复,合作就可能出现。
针锋相对策略:在重复博弈中,最简单的促成合作的策略是“以牙还牙”(Tit-for-Tat):第一轮选择合作,之后每一轮都复制对手上一轮的选择。这个策略在计算机锦标赛中多次夺冠,因为它既善良(不首先背叛)、又报复(对背叛进行惩罚)、还宽容(对手一旦回归合作就原谅)。
促进合作的条件:(1)博弈重复次数足够多或不确定;(2)参与者足够有耐心,看重未来收益;(3)背叛能被及时发现并受到惩罚;(4)参与者数量较少,便于监督和执行。
现实中的应用
国际贸易协定、石油输出国组织(OPEC)的产量配额、企业间的联合研发协议等,本质上都是在通过重复博弈机制来维持合作,避免陷入“背叛-背叛”的囚徒困境。
(四)其他经典博弈模型
智猪博弈:大猪和小猪共用一个食槽,踩踏板出食需要成本。如果大猪去踩,小猪可以坐享其成先吃大半;如果小猪去踩,大猪也能吃完大半。最终均衡是大猪反复踩踏板,小猪搭便车——解释了“大企业承担创新成本、小企业模仿跟进”的现象。
懦夫博弈:两个少年开车对撞,谁先转向谁就是“懦夫”。双方都希望对方转向而自己逞英雄,但如果都不转向则同归于尽。这个博弈与冷战时期的核威慑高度相似。
结尾
博弈论提供了一个强大而优雅的框架,帮助我们理解从商业竞争、国际关系到日常社交中的各种互动行为。它最深刻的信息也最简洁:你的最优选择取决于他人的选择——理解这一点,你就能在策略世界里看得更远、想得更深。
【27考研辅导课程推荐】:27考研集训课程,VIP领学计划,27考研VIP全科定制套餐(公共课VIP+专业课1对1) , 这些课程中都会配有内部讲义以及辅导书和资料,同时会有教研教辅双师模式对大家进行教学以及督学,并配有24小时答疑和模拟测试等,可直接咨询在线客服老师领取大额优惠券。
热门下载
资料下载
院校解析
真题解析
考研数学
考研英语
考研政治
考研备考