第139章 博弈论赌局
    镜像局的失败,沈夜用了三天消化,

    

    不是消化情绪,而是消化教训,

    

    他把镜像局的每一步操作,复盘了七遍,

    

    每一遍,都找到新的问题,

    

    第一遍,发现交换时机错误,应该晚一轮,

    

    第二遍,发现千感对锁定盲牌的估计,精度不够,他估计了"5到7",实际是6,范围太大,

    

    第三遍,发现自己忽略了一个基本原则,在完全信息对称的赌局中,任何主动操作,都会打破平衡,而打破平衡,不一定对自己有利,

    

    第四遍,发现周遥的策略,比他的更高明,

    

    周遥,自始至终,没有做任何主动操作,

    

    她全程跟随镜像,被动,

    

    在被动中,她保持了信息对称,没有给沈夜任何额外信息,

    

    反而是沈夜,每一次主动操作,都在暴露自己的意图,

    

    被动,赢了,

    

    这,违反直觉,

    

    但在镜像局这种特殊赛制中,被动,就是最优策略,

    

    除非,你能确保主动操作的收益,大于暴露信息的代价,

    

    算技,在这三天里,进化了,

    

    从"能算",变成了"知道什么时候不算",

    

    三天后,

    

    顾长明,又安排了一场赌局,

    

    密室层二号密室,

    

    赛制,博弈论赌局,

    

    沈夜第一次听到这个名称,

    

    规则,

    

    基于"囚徒困境"设计的多轮选择游戏,

    

    一、每轮,双方同时做选择,"合作"或"背叛",

    

    二、收益矩阵,

    

    双方合作,各得20万,

    双方背叛,各得5万,

    一方合作一方背叛,合作方得0,背叛方得40万,

    

    三、总共十轮,

    

    四、累计收益高者,赢,

    

    五、特殊规则,每人有两次"窥探"机会,在选择前,可以花10万,"窥探"对手本轮的选择,

    

    经典的,囚徒困境,

    

    沈夜对这个模型,不陌生,

    

    大学博弈论课,他拿过满分,

    

    单次囚徒困境,纳什均衡,是双方都背叛,

    

    因为不管对方怎么选,背叛,都是个人最优策略,

    

    但,多轮重复囚徒困境,纳什均衡,不再是"永远背叛",

    

    因为,在重复博弈中,合作,能建立信任,

    

    信任,带来长期收益,超过短期背叛的收益,

    

    著名的"以牙还牙"策略,

    

    第一轮合作,

    之后每轮,重复对方上一轮的选择,

    

    即,你合作我就合作,你背叛我就背叛,

    

    这是,重复囚徒困境中,收益最高的策略之一,

    

    但,有一个问题,

    

    十轮,是有限的,

    

    有限重复博弈,和无限重复博弈,完全不同,

    

    在无限博弈中,合作可以持续,因为未来的惩罚足以震慑背叛,

    

    在有限博弈中,最后一轮,一定会背叛,因为没有未来的惩罚,

    

    而倒推,

    

    既然最后一轮一定背叛,那倒数第二轮的合作也失去了意义,也会背叛,

    

    继续倒推,每一轮,都没有合作的理由,

    

    逻辑上,十轮有限博弈,纳什均衡,是,每轮都背叛,

    

    但,实际上,没有人会这样做,

    

    因为,"窥探"的存在,改变了博弈结构,

    

    窥探,花10万

本章未完,请点击下一页继续阅读>>