不是消化情绪,而是消化教训,
他把镜像局的每一步操作,复盘了七遍,
每一遍,都找到新的问题,
第一遍,发现交换时机错误,应该晚一轮,
第二遍,发现千感对锁定盲牌的估计,精度不够,他估计了"5到7",实际是6,范围太大,
第三遍,发现自己忽略了一个基本原则,在完全信息对称的赌局中,任何主动操作,都会打破平衡,而打破平衡,不一定对自己有利,
第四遍,发现周遥的策略,比他的更高明,
周遥,自始至终,没有做任何主动操作,
她全程跟随镜像,被动,
在被动中,她保持了信息对称,没有给沈夜任何额外信息,
反而是沈夜,每一次主动操作,都在暴露自己的意图,
被动,赢了,
这,违反直觉,
但在镜像局这种特殊赛制中,被动,就是最优策略,
除非,你能确保主动操作的收益,大于暴露信息的代价,
算技,在这三天里,进化了,
从"能算",变成了"知道什么时候不算",
三天后,
顾长明,又安排了一场赌局,
密室层二号密室,
赛制,博弈论赌局,
沈夜第一次听到这个名称,
规则,
基于"囚徒困境"设计的多轮选择游戏,
一、每轮,双方同时做选择,"合作"或"背叛",
二、收益矩阵,
双方合作,各得20万,
双方背叛,各得5万,
一方合作一方背叛,合作方得0,背叛方得40万,
三、总共十轮,
四、累计收益高者,赢,
五、特殊规则,每人有两次"窥探"机会,在选择前,可以花10万,"窥探"对手本轮的选择,
经典的,囚徒困境,
沈夜对这个模型,不陌生,
大学博弈论课,他拿过满分,
单次囚徒困境,纳什均衡,是双方都背叛,
因为不管对方怎么选,背叛,都是个人最优策略,
但,多轮重复囚徒困境,纳什均衡,不再是"永远背叛",
因为,在重复博弈中,合作,能建立信任,
信任,带来长期收益,超过短期背叛的收益,
著名的"以牙还牙"策略,
第一轮合作,
之后每轮,重复对方上一轮的选择,
即,你合作我就合作,你背叛我就背叛,
这是,重复囚徒困境中,收益最高的策略之一,
但,有一个问题,
十轮,是有限的,
有限重复博弈,和无限重复博弈,完全不同,
在无限博弈中,合作可以持续,因为未来的惩罚足以震慑背叛,
在有限博弈中,最后一轮,一定会背叛,因为没有未来的惩罚,
而倒推,
既然最后一轮一定背叛,那倒数第二轮的合作也失去了意义,也会背叛,
继续倒推,每一轮,都没有合作的理由,
逻辑上,十轮有限博弈,纳什均衡,是,每轮都背叛,
但,实际上,没有人会这样做,
因为,"窥探"的存在,改变了博弈结构,
窥探,花10万