我不想把博弈论学成一门“算纳什均衡”的课。
那当然重要,但如果最后只剩下 payoff matrix、mixed strategy、Bayesian Nash equilibrium,那它对我的用处会很有限。真正有用的是另一件事:博弈论能把很多混乱的人类行为翻译成结构。
谁有行动空间?谁先动?谁能承诺?谁只是在 cheap talk?谁的信息不完整?谁的激励和嘴上说的不一致?为什么一个看起来很蠢的行为,在另一个 payoff 结构里是理性的?
这才是我想学的东西。
博弈论解决的不是“怎么赢”,而是“局面长什么样”
我现在更愿意这样定义博弈论:
博弈论是一套看见相互依赖决策的语言。
普通决策论问:我面对环境,应该怎么选?
博弈论多问了一层:环境里也有别人在选,而且他们在预测我怎么选。
这一下就变复杂了。不是因为数学变复杂,而是因为世界突然有了镜子。
我怎么做
取决于你怎么做
而你怎么做
取决于你以为我会怎么做
很多现实问题卡住,不是因为缺信息,而是因为我们把互动系统当成单人优化题。
比如工作沟通。你以为问题是“我要不要更努力证明自己”,但局面可能是一个 signaling game:你每一次额外努力,都在向对方发送“我可以无限 absorb 成本”的信号。于是对方的 best response 不是珍惜你,而是继续加压。
比如 agent 产品。你以为问题是“agent 要不要多通知用户”,但局面可能是 repeated game:一次误报会改变用户未来对所有通知的信任;通知不是单次事件,它在训练对方的策略。
比如开源维护。你以为问题是“这个 PR 技术上对不对”,但局面里还有 reviewer attention、maintainer risk、contribution reputation、issue clarity。你的 patch 不是独立物体,它是一个动作,会改变别人愿不愿意花时间看你。
这就是博弈论有用的地方:它逼我把“人性问题”拆成激励、信息、顺序、承诺、重复互动。
第一条主线:Schelling,比 Nash 更接近现实世界
如果只能先读一本,我会先读 Thomas Schelling 的 The Strategy of Conflict,而不是从教材开始。
不是因为 Schelling 更严谨。恰好相反,他的力量在于他研究的是那些最不干净的局面:谈判、威慑、有限战争、敲诈、默认协调、tacit bargaining。Google Books 的简介里有一句很准:这些局面里既有共同利益,也有冲突。
这比“纯竞争”更接近日常。
大多数真实关系都不是零和:公司和员工、用户和产品、maintainer 和 contributor、恋人、朋友、国家之间,通常都有一部分共同利益,也有一部分利益冲突。难点不是“打败对方”,而是如何在互相依赖里改变对方的预期。
Schelling 最有用的几个 lens:
commitment 承诺:我如何让某个行动变得可信?
threat 威胁:什么样的惩罚对方会信?
focal point 焦点:没有沟通时,大家会自然聚到哪里?
brinkmanship 边缘策略:如何通过制造风险改变对方行为?
tacit bargain 默认谈判:没有明说的协调如何发生?
对我最有用的是 commitment。
很多时候,问题不是“我想不想做 X”,而是“别人信不信我会做 X”。可信承诺经常需要主动限制自己的自由度。
这件事有点反直觉。直觉上,自由度越多越强。但博弈论里,能随时退让的人,威胁不可信;能随时改口的人,承诺不可信;能无限加班的人,边界不可信。
所以有些“看起来变弱”的动作,其实是在制造可信度。
不秒回消息
不接模糊需求
不免费 absorb scope creep
把审批点写进流程
把 agent 外部动作做成 held draft
这些不是情绪化边界。它们是机制设计:让对方的 best response 变得更健康。
第二条主线:Yale 的课适合建立骨架
Yale Game Theory with Ben Polak 适合当主线课。
它的好处是完整,而且例子非常生活化。playlist 里从前几讲的“put yourself into other people’s shoes”、iterative deletion、median voter theorem,到 Nash equilibrium、mixed strategies,再到 evolutionary stability、sequential games、backward induction、repeated games、asymmetric information、signaling、auctions。
这条线基本就是从静态局面走向真实世界:
normal form games
-> dominated strategies
-> Nash equilibrium
-> mixed strategies
-> evolutionary stability
-> sequential games
-> backward induction
-> repeated games
-> asymmetric information
-> signaling / auctions
我会把它当成“概念地图”,而不是视频课打卡。
对我来说,最值得优先吃掉的是四块:
- dominated strategy:哪些选择无论如何都不该留在桌上。
- Nash equilibrium:大家互相 best response 后,系统会卡在哪里。
- backward induction:从未来反推现在,尤其适合看威胁和承诺。
- repeated games:一次互动里的理性,放到长期关系里可能变成蠢。
第四点最重要。
很多人际和工作问题,用 single-shot game 看会误判。一次争执里“赢”可能是理性的;重复互动里,它可能摧毁未来合作。一次通知里“宁可多报”看起来安全;长期看,它会训练用户忽略你。一次 PR 里把 scope 做满看起来加分;长期看,它可能让 reviewer 对你产生“这个人每次都带来大 diff”的预期。
重复博弈把短期胜利变成长期状态训练。
这个 lens 对 agent 产品尤其有用。用户不是每次从零开始评价 agent。agent 每一次打扰、每一次 hallucination、每一次自信但错的总结,都在更新用户的策略。
所以 AX 不是 UI polish,它是 repeated game design。
第三条主线:Model Thinking 用来防止单模型上头
Model Thinking 不只是博弈论课,但它可能是最适合打底的课。
Coursera 页面上那句很对:think with models 的人会比不用模型的人表现更好,而用很多模型的人会比只用一个模型的人表现更好。
这正好防止博弈论学习里的一个坑:学会一个模型后,到处套。
看到合作就囚徒困境,看到竞争就零和,看到信号就 signaling,看到演化就 ESS。这样会变成概念 cosplay。
更好的用法是把模型当镜头,不当结论。
segregation model 看局部偏好如何聚合成宏观分离
threshold model 看小变化如何跨过 tipping point
network model 看位置如何改变影响力
game theory model 看互动策略如何互相塑形
agent-based model 看简单规则如何生成复杂行为
对我自己的学习来说,Model Thinking 的价值是提醒我:不要急着问“这是不是囚徒困境”。先问:
这个局面里,最重要的变量是什么?
是信息不对称?
是行动顺序?
是网络结构?
是阈值?
是重复互动?
是承诺不可置信?
模型不是答案。模型是压缩现实的方式。
压缩错了,推理越严谨越危险。
第四条主线:演化博弈论解释“为什么策略会留下来”
Stanford 的 Behavioral Evolution 很适合接在普通博弈论后面。
Sapolsky 在这讲里先拆掉一个很常见但错误的直觉:动物不是“为了物种利益”行动。看起来像为群体牺牲的行为,很多时候可以从基因复制、亲缘关系、互惠合作里解释。
这讲里有三个 building blocks:
individual selection 自己繁殖,留下更多基因副本
kin selection 帮助亲属,因为共享基因
reciprocal altruism 非亲属合作,但需要记忆、识别、未来互动
这对理解合作非常有用。
合作不是“大家都善良”。合作需要结构。
亲缘选择靠 shared genes。互惠利他靠 repeated interaction、个体识别、记忆、惩罚搭便车者的能力。也就是说,合作不是道德奇迹,而是一组条件的产物。
这可以直接迁移到人类系统和软件系统:
能否再次相遇?
能否识别对方?
能否记住历史?
能否惩罚背叛?
能否奖励合作?
如果这些条件不存在,就不要期待稳定合作。
开源社区也是这样。一次性 drive-by PR 很难产生深度互信;长期贡献者会获得更多解释空间,不是因为 maintainer 更善良,而是因为 repeated interaction 让 reputation 成为状态变量。
agent 系统也一样。如果 agent 没有可靠记忆、没有可追溯行为、没有身份连续性,人类就无法和它形成稳定合作。每次互动都像陌生人局,信任永远归零。
这就是为什么 provenance 和 memory 不是附属功能。它们是合作能够演化出来的条件。
第五条主线:Game Theory 101 适合补形式化细节
Game Theory 101 更像短讲工具箱。
你给的这集是 Bayesian games 里的 ex ante dominance 和 interim dominance。它的重点不是“又多两个术语”,而是信息时点改变了策略对象。
还没知道自己类型时,你是在给 player 制定完整 contingent plan。已经知道自己类型后,你是在给某个 type 做选择。
ex ante 事前:还没知道自己是哪种 type
interim 事中:已经知道自己的 type
这个 distinction 很好用。
因为现实里很多计划也是这样:
事前:如果我累了怎么办?如果 reviewer 不回怎么办?如果 agent 卡住怎么办?
事中:我现在确实累了 / reviewer 确实没回 / agent 确实卡住了,该怎么办?
事前策略更像 policy。事中策略更像 local action。
一个系统如果只在事中做决定,就会被当前情绪和局部信息牵着走。一个好的 policy 应该在事前定义好:什么情况下继续,什么情况下暂停,什么情况下升级,什么情况下 stop loss。
这对我尤其有用。因为我很容易进入“事中无限求解”模式:已经累了,还在重新计算要不要继续;已经 scope creep 了,还在重新计算要不要多做一点;agent 已经跑偏了,还在重新计算要不要再给它一次机会。
更好的做法是提前写策略。
如果一个任务超过 90 分钟没有新证据,就停。
如果 PR diff 超过原 scope,就切第二个 PR。
如果 agent 第二次同类错误,就不要继续 prompt,改检查工具链。
如果学习材料让我连续 20 分钟只是在收藏链接,就写一段输出。
这不是自律鸡血。这是 ex ante policy,防止 interim self 被现场吞掉。
这些书分别适合干什么
我会这样分工,而不是按“经典程度”硬啃。
The Strategy of Conflict
Schelling。优先级最高。
读它是为了学会看 commitment、threat、focal point、tacit bargaining。它最适合处理“既合作又冲突”的局面。
现实里这种局面最多。
Thinking Strategically / The Art of Strategy
Dixit 和 Nalebuff。
更适合入门,把博弈论翻译成商业、政治、日常决策里的例子。它的价值不是深,而是帮你建立“哦,这也是博弈”的识别能力。
Strategies and Games: Theory and Practice
Prajit Dutta。
这本更像严肃教材。适合在 Yale 课之后用来补 formalism,尤其是如果想把概念变成能推导的东西。
Evolutionary Dynamics
Martin Nowak。
适合接演化博弈、合作、复制动态。它会更数学,但主题很诱人:生命里的策略不是一次性算出来的,而是在复制、变异、选择里动态变化。
Co-opetition
Nalebuff。
适合商业策略。重点是“竞争”和“合作”不是反义词。很多局面里,你先和别人一起把 pie 做大,再决定怎么分 pie。
这对平台、生态、开源尤其有用。
Good Strategy Bad Strategy
Rumelt 严格来说不是博弈论,但很应该放进来。
因为博弈论容易让人沉迷 clever move,而 Rumelt 会把你拉回战略基本功:诊断、指导方针、连贯行动。没有 diagnosis 的 strategy,只是愿望清单。
这本可以当解毒剂。
我真正想偷走的东西
学完这条线,我想留下的不是公式,而是一组问题。
1. 这是单人优化,还是互动策略?
如果对方会根据我的动作改变动作,就不要用单人优化脑子。
2. 这是一次性局,还是重复局?
一次性最优可能会污染长期关系。尤其是信任、通知、review、合作。
3. 谁掌握私有信息?谁在猜谁的类型?
很多冲突不是偏好冲突,而是类型不明。对方不知道你是“偶尔强硬”还是“永远会让步”;你也不知道对方是“真的没资源”还是“试探边界”。
4. 哪些承诺可信,哪些只是话?
能被轻易撤回的承诺不是承诺。没有成本的威胁不是威胁。
5. 当前 equilibrium 是怎么被训练出来的?
很多坏状态不是突然发生的,是被一轮轮 best response 训练出来的。
如果我每次都 absorb scope,那系统就会学会给我 scope。
如果 agent 每次不确定还硬答,用户就会学会不信它。
如果产品每次都把 raw activity 推给人,人就会学会忽略所有 activity。
6. 我能改 payoff,还是只能改 action?
这是最关键的问题。
普通努力是在旧 payoff 里选更好的 action。真正的策略是改 payoff:改规则、改顺序、改默认值、改可见信息、改审批点、改退出成本。
很多时候,不要更努力地玩烂游戏。
改游戏。
一个适合我的学习顺序
我不会从头到尾刷完所有材料。那太像收藏癖了。
我会这样走:
1. 读 Schelling:先建立现实感
2. 看 Yale 前 12 讲:建立 normal form / Nash / mixed / evolution 骨架
3. 穿插 Model Thinking:防止单模型上头
4. 看 Stanford Behavioral Evolution:理解合作的结构条件
5. 用 Game Theory 101 补短概念:Bayesian games、dominance、signaling
6. 再决定要不要啃 Dutta / Nowak 的 formalism
每学一个概念,只做一件事:写一个自己的例子。
不要摘抄定义。
credible threat -> 我如何设计 stop-loss,让“我会停”可信?
focal point -> 一个产品默认值如何让用户不用沟通也能协调?
repeated game -> agent 通知策略如何训练用户信任?
Bayesian type -> reviewer 如何从我的 PR 历史推断我是可靠 contributor?
reciprocal altruism -> 开源合作为什么需要身份、记忆和未来互动?
如果一个概念不能迁移到我自己的问题上,就先不算学会。
资源索引
课程和视频:
- Yale: Game Theory with Ben Polak
- Stanford: Behavioral Evolution
- Game Theory 101: Ex Ante and Interim Dominance
- Coursera: Model Thinking
- Coursera: Stanford Game Theory
- Andrew Gilpin
书:
- Thomas Schelling, The Strategy of Conflict
- Avinash K. Dixit, Susan Skeath, David H. Reiley, Games of Strategy
- Avinash K. Dixit, Competitive Strategy, Options, and Games
- Martin Nowak, Evolutionary Dynamics: Exploring the Equations of Life
- Avinash K. Dixit and Barry Nalebuff, Thinking Strategically
- Barry Nalebuff and Adam Brandenburger, Co-opetition
- Richard Rumelt, Good Strategy Bad Strategy
- Prajit Dutta, Strategies and Games: Theory and Practice
- Avinash K. Dixit and Barry Nalebuff, The Art of Strategy
最后的压缩
博弈论对我有用,不是因为它让我更会赢。
它让我更快识别:我是不是正在把一个互动系统,当成个人努力问题。
如果是,那继续努力通常只会把坏 equilibrium 训练得更稳。
真正的策略不是在旧局里更拼。
真正的策略是看见局,然后改局。