博弈
博弈案例
案例一:
“博弈论中有很多有趣而富于哲理的案例,一报还一报就是其中的一个。它那种善意、宽容、强硬、简单明了的合作策略无论对个人还是对组织的行为方式都有很大的指导意义。”
在博弈论中有一个经典案例--囚徒困境,非常耐人回味。
"囚徒困境"说的是两个囚犯的故事。这两个囚徒一起做坏事,结果被警察发现抓了起来,分别关在两个独立的不能互通信息的牢房里进行审讯。在这种情形下,两个囚犯都可以做出自己的选择:或者供出他的同伙(即与警察合作,从而背叛他的同伙),或者保持沉默(也就是与他的同伙合作,而不是与警察作)。这两个囚犯都知道,如果他俩都能保持沉默的话,就都会被释放,因为只要他们拒不承认,警方无法给他们定罪。但警方也明白这一点,所以他们就给了这两个囚犯一点儿刺激:如果他们中的一个人背叛,即告发他的同伙,那么他就可以被无罪释放,同时还可以得到一笔奖金。而他的同伙就会被按照最重的罪来判决,并且为了加重惩罚,还要对他施以罚款,作为对告发者的奖赏。当然,如果这两个囚犯互相背叛的话,两个人都会被按照最重的罪来判决,谁也不会得到奖赏。
那么,这两个囚犯该怎么办呢?是选择互相合作还是互相背叛?从表面上看,他们应该互相合作,保持沉默,因为这样他们俩都能得到最好的结果:自由。但他们不得不仔细考虑对方可能采取什么选择。A犯不是个傻子,他马上意识到,他根本无法相信他的同伙不会向警方提供对他不利的证据,然后带着一笔丰厚的奖赏出狱而去,让他独自坐牢。这种想法的诱惑力实在太大了。但他也意识到,他的同伙也不是傻子,也会这样来设想他。所以A犯的结论是,唯一理性的选择就是背叛同伙,把一切都告诉警方,因为如果他的同伙笨得只会保持沉默,那么他就会是那个带奖出狱的幸运者了。而如果他的同伙也根据这个逻辑向警方交代了,那么,A犯反正也得服刑,起码他不必在这之上再被罚款。所以其结果就是,这两个囚犯按照不顾一切的逻辑得到了最糟糕的报应:坐牢。
当然,在现实世界里,信任与合作很少达到如此两难的境地。谈判、人际关系、强制性的合同和其他许多因素左右了当事人的决定。但囚徒的两难境地确实抓住了不信任和需要相互防范背叛这种真实的一面。让我们看看冷战时期两个超级大国将自己锁定在一场40年的军备竞赛中,其结果对双方都毫无益处。还有各国的贸易保护主义的永恒倾向。
但是,无论在自然界还是在人类社会,"合作"都是一种随处可见的现象。那么,问题就出现了:到底是何种机制促使生物体或者人类进行相互合作呢?
这个问题的答案大部分归功于美国密西根大学一位叫做罗伯特&S226;爱克斯罗德的人。爱克斯罗德是一个政治科学家,对合作的问题久有研究兴趣。为了进行关于合作的研究,他组织了一场计算机竞赛。这个竞赛的思路非常简单:任何想参加这个计算机竞赛的人都扮演"囚徒困境"案例中一个囚犯的角色。他们把自己的策略编入计算机程序,然后他们的程序会被成双成对地融入不同的组合。分好组以后,参与者就开始玩"囚徒困境"的游戏。他们每个人都要在合作与背叛之间做出选择。
但这里与"囚徒困境"案例中有个不同之处:他们不只玩一遍这个游戏,而是一遍一遍地玩上200次。这就是博弈论专家所谓的"重复的囚徒困境",它更逼真地反映了具有经常而长期性的人际关系。而且,这种重复的游戏允许程序在做出合作或背叛的抉择时参考对手程序前几次的选择。如果两个程序只玩过一个回合,则背叛显然就是唯一理性的选择。但如果两个程序已经交手过多次,则双方就建立了各自的历史档案,用以记录与对手的交往情况。同时,它们各自也通过多次的交手树立了或好或差的声誉。虽然如此,对方的程序下一步将会如何举动却仍然极难确定。实际上,这也是该竞赛的组织者爱克斯罗德希望从这个竞赛中了解的事情之一。一个程序总是不管对手作何种举动都采取合作的态度吗?或者,它能总是采取背叛行动吗?它是否应该对对手的举动回之以更为复杂的举措?如果是,那会是怎么样的举措呢?
事实上,竞赛的第一个回合交上来的14个程序中包含了各种复杂的策略。但使爱克斯罗德和其他人深为吃惊的是,竞赛的桂冠属于其中最简单的策略:一报还一报(TIT FOR TAT)。这是多伦多大学心理学家阿纳托&S226;拉帕波特提交上来的策略。一报还一报的策略是这样的:它总是以合作开局,但从此以后就采取以其人之道还治其人之身的策略。也就是说,一报还一报的策略实行了胡萝卜加大棒的原则。它永远不先背叛对方,从这个意义上来说它是"善意的"。它会在下一轮中对对手的前一次合作给予回报(哪怕以前这个对手曾经背叛过它),从这个意义上来说它是"宽容的"。但它会采取背叛的行动来惩罚对手前一次的背叛,从这个意义上来说它又是"强硬的"。而且,它的策略极为简单,对手程序一望便知其用意何在,从这个意义来说它又是"简单明了的"。
案例二:
1?囚徒博弈与我国应试教育的困境
囚徒困境可以用来说明许多现象。我国目前的应试教育就是一个囚徒困境。
囚徒博弈是完全信息下的静态博弈,两个小偷各种策略组合下的支付是他们之间的“公共知识”(我们在下一章中将讨论什么是“公共知识”)。
我们上面已经分析了囚徒对局下各个策略下的结果或支付,以及它的均衡。它的均衡是双方均选择“招认”的策略。
可以这么说,最近10多年来,我国基础教育的问题是如何摆脱应试教育的困境问题。目前给中小学生“减负”不仅是学生家长的呼声,也是教育专家和教育管理部门的呼声,也可以说是全社会的呼声。教育管理部门这几年做了一系列的工作,但收效甚微,并没有从根本上解决问题。学校不断给学生增加负担是目前教育的实际状况。
大家普遍认为应试教育是扼杀学生的创造性,无论是专家还是家长,都在呼吁改变应试教育的模式。但是无论是专家,还是意识到教育问题的普通老百姓以及没有意识到教育问题的老百姓,其小孩都在接受着这种教育。
在现有的教育体制下,学生(或学生家长)有两个可选择的策略:“减负”和“增负”。学生的精力是有限的,如果选择“减负”策略,意味着学生有更多的时间学习课本以外的东西,这样学生的素质得到提高,因此,“减负”策略往往与素质教育联系在一起;而如果选择“增负”策略,则意味着学生花大量的时间做大量的习题,以“学透”、“学精”课本规定的东西,此时,学生没有时间学习课本以外的没有规定的内容。“减负”的结果是学生的全面发展;而“增负”的结果是学生获得高的分数。
在这样的博弈结构下,学生(或学生家长)如何选择呢?每个学生这样想:其他人采取的是“增负”教育策略的话,如果我采取“减负”教育策略,我的考试分数不如他人,在求学方面我会落后,接受不了好的教育,在未来求职时我也赶不上他人。在他人采取“增负”的策略下,我也应当采取“增负”策略。如果其他人采取的是“减负”策略,我应当采取什么策略呢?还是应当采取“增负”策略!因为,如果其他人采取的是“减负”策略的话,如果我采取的是“增负”策略,我的考试分数会比其他人高,我会上好的学校,在未来的职业竞争中我会处于优势。因此,无论其他人采取的是什么策略,我采取“增负”策略都是最好的。当每个学生都这样想的时候,全社会便进入了应试教育这样一个囚徒困境之中。
如果我国现有的考试制度没有改变,现在假设所有的学生都选择“减负”策略,即除了做少量的巩固性的作业外,不补课、不做其他的练习题,情况会是什么样子?
假设这种状态会出现,我们说,这种状态会很快消失,而立即会出现所有学生都进入“增负”的这样一个状态。可以说,均选择“减负”策略的状态是不稳定的,而“增负”的状态是稳定的均衡。原因就是,目前的教育的博弈结构规定了各种行动或行为的收益或好处:获得高分的会进入好的初中、高中,进入好的初中、高中的学生可以考高分进入好的大学。在这个博弈中,对于教师来说,学生的升学率高意味着其成绩大、奖金高,对自己的学生采取“增负”策略,对于自己而言是占优策略。
我国基础教育的博弈与囚徒困境有共同的结构,大家均选择“增负”策略构成基础教育博弈的纳什均衡。纳什均衡是一个稳定的博弈结果,这也是为什么我国目前的应试教育难以改变的原因。
2.斗鸡博弈与古巴的导弹危机
试想有两只公鸡遇到一起,每只公鸡有两个行动选择:一是退下来,一是进攻。如果一方退下来,而对方没有退下来,对方获得胜利,这只公鸡则很丢面子;如果对方也退下来,双方则打个平手;如果自己没退下来,而对方退下来,自己则胜利,对方则失败;如果两只公鸡都前进,那么则两败俱伤。因此,对每只公鸡来说,最好的结果是,对方退下来,而自己不退。支付矩阵如下:
鸡乙鸡甲前进后退前进(-2,-2)(1,-1)后退(-1,1)(-1,-1)
上表中的数字的意思是:两者如果均选择“前进”,结果是两败俱伤,两者均获得-2的支付;如果一方“前进”,另外一方“后退”,前进的公鸡获得1的支付,赢得了面子,而后退的公鸡获得-1的支付,输掉了面子,但没有两者均“前进”受到的损失大;两者均“后退”,两者均输掉了面子,获得-1的支付。当然表中的数字只是相对的值。
这个博弈有两个纳什均衡:一方前进,另一方后退。但关键是谁进谁退?一博弈,如果有惟一的纳什均衡点,那么这个博弈是可预测的,即这个纳什均衡点就是事先知道的惟一的博弈结果。但是如果一博弈有两个或两个以上的纳什均衡点,则任何人无法预测出一个结果来。因此,我们无法预测斗鸡博弈的结果,即不能知道谁进谁退,谁输谁赢。
用这个博弈来解释20世纪60年代初发生在美苏两个超级大国之间的一场导弹危机,是最合适不过的了。
二战结束后,形成了对峙的两个超级大国,美国和苏联。这两个超级大国是两个核心,在其周围有各自的盟友,它们一起组成了两大敌对的阵营。1962年赫鲁晓夫偷偷地将导弹运送到加勒比海上的岛国古巴,卡斯特罗政权是苏联这个超级大国的盟友,是美国的敌人。苏联的目的是将导弹部署在美国的眼皮底下,以对付美国。然而苏联的行动被美国的U-2飞机侦察到了,美国发现古巴建立了导弹发射场。此事震动美国,肯尼迪总统指责苏联,并发出严重警告,而苏联方面矢口否认。美国决定对古巴进行军事封锁,派遣了舰艇、空军及航空母舰,并集结了登陆部队。美国进入戒备状态,,美苏之间的战争一触即发。
面对美国的反应,苏联面临着是将导弹撤回国还是坚持部署在古巴的选择?而对于美国,则面临着是挑起战争还是容忍苏联的挑衅行为的选择?也就是说,这两只“大公鸡”均在考虑采取进的策略还是退的策略?
战争的结果当然是两败俱伤,而任何一方退下来(而对方不退)则是不光彩的事。结果是苏联将导弹从古巴撤了下来,做了丢面子的“撤退的鸡”。美国坚持了自己的策略,做了
“不退的鸡”。当然,为了给苏联一点面子,同时也担心苏联坚持不退而发生美苏战争——这是美国不愿意看到的,美国象征性地从土耳其撤离了一些导弹。古巴导弹危机是冷战期间美苏两霸之间发生的最严重的一次危机。
这就是美国与苏联在古巴导弹上的博弈结果。对于苏联来说,退下来的结果是丢了面子,但总比战争要好;对美国而言,既保全了面子,又没有发生战争。这就是这两只“大公鸡”博弈的结果。
3.骑虎难下博弈与美苏武器竞赛
我们经常碰到的一类博弈是,行动者进也不是,退也不是。笔者将这样的博弈称为骑虎难下博弈。
有一个拍卖,其规则是:轮流出价,谁出得最高,谁就将得到该物品,但是出价少的人不仅得不到该物品,并且要按他所叫的价付给拍卖方。
假定有两人竞价争夺价值100元的物品,只要双方开始叫价,在这个博弈中双方就进入了骑虎难下的状态。因为,每个人都这样想,如果我退出,我将失去我出的钱,若不退出,我将有可能得到这价值100元的物品,但是,随着出价的增加,他的损失也可能越大。每个人面临着两难:是继续叫价还是退出?
你会说,这个拍卖的规则不合理,在实际中这样的拍卖不会出现。当然这只是一个模型,但我们经常会看到此类型的博弈案例。这个博弈有一个纳付均衡:第一个出价人叫出100元的竞标价,另外一个人不出价(因为在对方叫出100元的价格后,他继续叫价将是不理性的),出价100元的参与人得到该物品。
在冷战期间,美苏为争夺霸权拼命发展武器,无论是原子弹、氢弹等核武器的研制,还是如隐形战斗机这样的常规武器的研制,双方均不甘落后。20世纪80年代,里根在位时准备启动“星球大战”计划,此举意味着两个超级大国的武器竞赛将进一步升级。美苏之间的武器竞赛就相当于拍卖中轮番出价,双方均不断出更高的价,如果一方没有出最高的价钱,退了下来,即没有继续竞赛下去,那么意味着它在军备上的投入没有效果,而对方将赢得整个局面。但如果继续竞赛下去,一旦支撑不住,损失也就越大。
1991年苏联的垮台在一定程度上是军备竞赛的结果。苏联将整个力量放在军备竞赛上,而民用建设无法跟上,国力不济,最终退下阵来。里根的“星球大战”计划其目的就是要拖垮苏联。
一旦进入骑虎难下的博弈,及早退出是明智之举,然而当局者往往做不到,这就是所谓当局者迷。这种骑虎难下的博弈经常出现在国家之间,也出现在企业或组织之间,当然个人之间也经常碰到。20世纪60年代,美国介入越南就是一个骑虎难下博弈。赌红了眼的赌徒输了钱还要继续赌下去以希望返本,也是骑虎难下博弈,其实,赌徒进入赌场开始赌博时,他已经进入了骑虎难下的状态,因为,赌场从概率上讲是肯定赢的。从理论上讲,赌徒与赌场之间的博弈如果是多次的,那么赌徒肯定输的,因为赌徒的“资源”与赌场的“资源”相比实在太小了。如果你的资源与赌场的资源相比很大,那么赌场有可能输的;如果你的资源无限大,只要赌徒有非0的赢的可能性,那么赌徒肯定会赢的。因此,像葡京这样的赌场要设定赌博数额的限制。
博弈论专家将这里的骑虎难下博弈称为协和谬误。20世纪60年代,英国和法国政府联合投资开发大型超音速客机,即协和飞机。该种飞机机身大、设计豪华并且速度快。但是,英法政府发现:继续投资开发这样的机型,花费会急剧增加,但是这样的设计定位能否适应市场还不知道;而停止研制将使以前的投资付诸东流。随着研制工作的深入,他们更是无法作出停止研制工作的决定。协和飞机最终研制成功,但因飞机的缺陷(如耗油大、噪音大、污染严重等等),它不适合市场,最终被市场淘汰,英法政府为此蒙受很大的损失。在这个研制过程中,如果英法政府能及早放弃飞机的开发工作,会使损失减少,但他们没能做到。
4.警察与小偷的故事——混合策略问题
纳什在《n人博弈的均衡点》这篇论文中,给出了均衡存在的简单证明,纳什说,在n个人的博弈中至少存在着一个均衡,在这点上双方均不愿意先改变策略。这里的均衡点有可能是混合策略点。人们称它为纳什定理。
什么是混合策略?
警察部门负责一城市中某一区的治安。警察要对该区的A、B两地进行巡逻。假定该区有一群小偷,要实施偷盗。警察要防止小偷的偷盗,但因为设备有限,只有一部警车,因此,警察只能一次在一个地方巡逻。而对于小偷而言,他们也只能去一个地方。假定A地需要保护的财产价值为2万元,B地的财产价值为1万元。若警察在某地进行巡逻,而小偷也选择了去该地,因警察在场,小偷无法偷盗该地的财物;若警察没有去某地巡逻而小偷选择了去该地,则小偷偷盗成功。警察怎么巡逻才能使效果最好?
一个明显的做法是,警察对A地进行巡逻,小偷去B地,这样,警察可以保住2万元的财产不被偷窃,小偷的收益为1万元。但是这种做法是警察的最好做法吗?有没有对这种策略改进的措施?
我们可以将警察与小偷之间的这个支付写成如下的支付矩阵。警察巡逻某地,偷盗者在该地无法实施偷盗,假定此时小偷的得益为0(没有收益),此时警察的得益为3(保住3万元)。
这个博弈也是常和博弈,它没有纯策略纳什均衡点,而有混合策略均衡点。这个混合策略均衡点下的策略选择是每个参与者的最优(混合)策略选择。
由此可见:纯策略是参与者一次性选取的,并且坚持他选取的策略;而混合策略是参与者在各种备选策略中采取随机选取的。在博弈中,参与者可以改变他的策略,而使得他的策略选取满足一定的概率。
当博弈是零和博弈与常和博弈时,即一方所得是另外一方的所失时,此时只有混合策略均衡。对于任何一方来说,此时不可能有纯策略的占优策略。
5?《三国演义》中的空城计与信息不对称的博弈
如果我们用博弈论的眼光看《三国演义》,三国演义完全是一部记载着许多博弈案例的著作。当然,罗贯中不可能用“博弈”一词。如果我们用一词来概括《三国演义》,这个词就是“计”。计,即计策或策略也。用计,即用策略赢对方。用计算敌,不仅要自己选择恰当的计策,而且要算准对方用什么计策,这不就是博弈?现在让我们看《三国演义》中著名的空城计博弈。
诸葛亮误用马谡,致使街亭失守。司马懿引大军十五万蜂拥而来。当时孔明身边别无大将,只有一班文官,五千军士,已分一半先运粮草去了,只剩二千五百军士在城中。众官听得这个消息,尽皆失色。孔明登城望之,果然尘土冲天,魏兵分两路杀来。孔明传令众将旌旗尽皆藏匿,诸军各收城铺。打开城门,每一门用二十军士,扮作百姓,洒扫街道。而孔明乃披鹤氅,戴纶巾,引二小童携琴一张,于城上敌楼前凭栏而坐,焚香操琴。司马懿自飞马上远远望之,见诸葛亮焚香操琴,笑容可掬。司马懿顿然怀疑其中有诈,立即叫后军作前军,前军作后军,急速退去。司马懿之子司马昭问:“莫非诸葛亮无军,故作此态,父亲何故便退兵?”司马懿说:“亮平生谨慎,不曾弄险。今大开城门,必有埋伏。我兵若进,中其计也。”孔明见魏军退去,抚掌而笑,众官无不骇然。诸葛亮说,司马懿“料吾生平谨慎,必不弄险;见如此模样,疑有伏兵,所以退去。吾非行险,盖因不得已而用之”,我兵只有二千五百,若弃城而去,必为之所擒。
这就是为后人广为传颂的空城计。这是一个信息不对称的博弈。
这里,司马懿不知道自己和对方在不同行动策略下的支付,而诸葛亮是知道的,他们对博弈结构的了解是不对称的,诸葛亮拥有比司马懿更多的信息,当然有。这种信息的不对称完全是诸葛亮“制造出来的”。因此这是一个信息不对称的博弈。
在这里,孔明可以选择的策略是“弃城”或“守城”。无论是“弃”还是“守”,只要司马懿明确知道他自己的支付,那么孔明均要被其所擒。孔明惟一的办法就是不让司马懿知道他自己的策略结果。他的空城计是降低司马懿进攻的可能收益,使得司马懿认为,后退比进攻要好。
司马懿孔明进攻后退守城(被擒,大胜)(逃脱,不胜不败)弃城(被擒,大胜)(逃脱,不胜不败)
在信息不充分的情况下,博弈参与者不是使自己的支付或效用最大,而是使自己的“期望支付(或效用)”最大。比如:如果让你在“有50%的可能获得100元”与“有10%的可能获得200元”两者之间进行选择,你当然选前者,因为前者的“期望所得”为:50%×100=50元,而后者为:10%×200元=20元。理性的人是选择前者的。
在孔明—司马懿的博弈中,孔明了解双方的局势,制造空城假象的目的就是让司马懿感到进攻有较大的失败的可能。如果我们用概率论的术语来说,诸葛亮的做法是加大司马懿对进攻失败的主观概率。此时,在司马懿看来,进攻失败的可能性较大,而退兵的期望效用大于进攻的期望效用。即:司马懿认为进攻的期望效用低于退兵的效用。诸葛亮惟有通过这个办法,才能让司马懿退兵。
司马懿想,诸葛亮一生谨慎,不做险事,只有设定埋伏才可能如此镇定自若,焚香操琴。此时,司马懿觉得“退”比“进攻”更合理,或者说期望效用更大。于是后军变前军,前军变后军,后退而去。结果是诸葛亮得以逃脱。
司马懿对局势的判断不是没有道理的,他对诸葛亮的判断是基于以前的认识,这就是“归纳法”。
空城计博弈是不完全信息博弈,我们说过《三国演义》是一本博弈实战教材,在该书中有完全信息博弈实例吗?当然,曹操与诸葛亮的华容道博弈就是一个完全信息博弈。
曹操亲领八十万大军进攻东吴,孙权和刘备联合破曹,曹军大败。曹操引兵而逃。经过一路厮杀,来到一处,军士报:前方有两条道路,请问丞相走哪条路?曹操问:哪条路近?军士说:大路稍平,却远五十余里。小路投华容道,却近五十多里。曹操令人上山观望,回报:小路山边有数处狼烟,大路并无动静。曹操叫走华容道。诸将问:烽烟起处必有军马,何故反走这条路?曹操说:岂不闻兵书有云:“实则虚之,虚则实之”。诸葛亮多谋,故使人于山僻放烟,使我军不敢从这条路走,他却伏兵于大路等着。吾已料定,偏不教中他计。诸将皆曰:丞相妙算,人不可及。遂曹兵走华容道。但关羽依着诸葛亮的妙计在华容道等着曹操,于是关羽上演了一场“只为当初恩义重,放开金锁走蛟龙”的捉放曹的义举。逃过华容道大难,曹操只剩二十七骑!
在曹操与诸葛亮之间的这一华容道博弈中,曹操的策略是在走华容道还是走大路之间进行选择,而诸葛亮派关羽埋伏时,要在埋伏在大路还是埋伏在通往华容道的小路之间进行选择。
华容道博弈曹操诸葛亮华容道大路——0.1华容道(捉住曹操,被捉)(白等,逃脱)大路(白等,逃脱)(捉住曹操,被捉)
这个博弈如同猜硬币的游戏一样,是一“零和博弈”所谓“零和博弈”是指双方的得益之和为一常数零,一方所得增加,另一方所得便减少。而“变和博弈”是指博弈双方的所得之和为一变数。,它没有纳什均衡点。双方对博弈有完全的信息,但双方无法知道对方的策略选择,而只能进行猜测。曹操要选择走诸葛亮的军队不在的路,这是他的最优的结果。而诸葛亮的最优结果是埋伏在曹操要走的路上。
诸葛亮制造埋伏在大路的假象,其实则派关羽埋伏在小路。这里关键是谁能真正猜到对方的策略,谁就是赢家。诸葛亮胜曹操一筹。这个博弈不存在纯策略纳什均衡点,博弈结果是:曹操选择了走华容道,结果被抓;关羽在华容道守候,抓住了曹操。
案例一:
“博弈论中有很多有趣而富于哲理的案例,一报还一报就是其中的一个。它那种善意、宽容、强硬、简单明了的合作策略无论对个人还是对组织的行为方式都有很大的指导意义。”
在博弈论中有一个经典案例--囚徒困境,非常耐人回味。
"囚徒困境"说的是两个囚犯的故事。这两个囚徒一起做坏事,结果被警察发现抓了起来,分别关在两个独立的不能互通信息的牢房里进行审讯。在这种情形下,两个囚犯都可以做出自己的选择:或者供出他的同伙(即与警察合作,从而背叛他的同伙),或者保持沉默(也就是与他的同伙合作,而不是与警察作)。这两个囚犯都知道,如果他俩都能保持沉默的话,就都会被释放,因为只要他们拒不承认,警方无法给他们定罪。但警方也明白这一点,所以他们就给了这两个囚犯一点儿刺激:如果他们中的一个人背叛,即告发他的同伙,那么他就可以被无罪释放,同时还可以得到一笔奖金。而他的同伙就会被按照最重的罪来判决,并且为了加重惩罚,还要对他施以罚款,作为对告发者的奖赏。当然,如果这两个囚犯互相背叛的话,两个人都会被按照最重的罪来判决,谁也不会得到奖赏。
那么,这两个囚犯该怎么办呢?是选择互相合作还是互相背叛?从表面上看,他们应该互相合作,保持沉默,因为这样他们俩都能得到最好的结果:自由。但他们不得不仔细考虑对方可能采取什么选择。A犯不是个傻子,他马上意识到,他根本无法相信他的同伙不会向警方提供对他不利的证据,然后带着一笔丰厚的奖赏出狱而去,让他独自坐牢。这种想法的诱惑力实在太大了。但他也意识到,他的同伙也不是傻子,也会这样来设想他。所以A犯的结论是,唯一理性的选择就是背叛同伙,把一切都告诉警方,因为如果他的同伙笨得只会保持沉默,那么他就会是那个带奖出狱的幸运者了。而如果他的同伙也根据这个逻辑向警方交代了,那么,A犯反正也得服刑,起码他不必在这之上再被罚款。所以其结果就是,这两个囚犯按照不顾一切的逻辑得到了最糟糕的报应:坐牢。
当然,在现实世界里,信任与合作很少达到如此两难的境地。谈判、人际关系、强制性的合同和其他许多因素左右了当事人的决定。但囚徒的两难境地确实抓住了不信任和需要相互防范背叛这种真实的一面。让我们看看冷战时期两个超级大国将自己锁定在一场40年的军备竞赛中,其结果对双方都毫无益处。还有各国的贸易保护主义的永恒倾向。
但是,无论在自然界还是在人类社会,"合作"都是一种随处可见的现象。那么,问题就出现了:到底是何种机制促使生物体或者人类进行相互合作呢?
这个问题的答案大部分归功于美国密西根大学一位叫做罗伯特&S226;爱克斯罗德的人。爱克斯罗德是一个政治科学家,对合作的问题久有研究兴趣。为了进行关于合作的研究,他组织了一场计算机竞赛。这个竞赛的思路非常简单:任何想参加这个计算机竞赛的人都扮演"囚徒困境"案例中一个囚犯的角色。他们把自己的策略编入计算机程序,然后他们的程序会被成双成对地融入不同的组合。分好组以后,参与者就开始玩"囚徒困境"的游戏。他们每个人都要在合作与背叛之间做出选择。
但这里与"囚徒困境"案例中有个不同之处:他们不只玩一遍这个游戏,而是一遍一遍地玩上200次。这就是博弈论专家所谓的"重复的囚徒困境",它更逼真地反映了具有经常而长期性的人际关系。而且,这种重复的游戏允许程序在做出合作或背叛的抉择时参考对手程序前几次的选择。如果两个程序只玩过一个回合,则背叛显然就是唯一理性的选择。但如果两个程序已经交手过多次,则双方就建立了各自的历史档案,用以记录与对手的交往情况。同时,它们各自也通过多次的交手树立了或好或差的声誉。虽然如此,对方的程序下一步将会如何举动却仍然极难确定。实际上,这也是该竞赛的组织者爱克斯罗德希望从这个竞赛中了解的事情之一。一个程序总是不管对手作何种举动都采取合作的态度吗?或者,它能总是采取背叛行动吗?它是否应该对对手的举动回之以更为复杂的举措?如果是,那会是怎么样的举措呢?
事实上,竞赛的第一个回合交上来的14个程序中包含了各种复杂的策略。但使爱克斯罗德和其他人深为吃惊的是,竞赛的桂冠属于其中最简单的策略:一报还一报(TIT FOR TAT)。这是多伦多大学心理学家阿纳托&S226;拉帕波特提交上来的策略。一报还一报的策略是这样的:它总是以合作开局,但从此以后就采取以其人之道还治其人之身的策略。也就是说,一报还一报的策略实行了胡萝卜加大棒的原则。它永远不先背叛对方,从这个意义上来说它是"善意的"。它会在下一轮中对对手的前一次合作给予回报(哪怕以前这个对手曾经背叛过它),从这个意义上来说它是"宽容的"。但它会采取背叛的行动来惩罚对手前一次的背叛,从这个意义上来说它又是"强硬的"。而且,它的策略极为简单,对手程序一望便知其用意何在,从这个意义来说它又是"简单明了的"。
案例二:
1?囚徒博弈与我国应试教育的困境
囚徒困境可以用来说明许多现象。我国目前的应试教育就是一个囚徒困境。
囚徒博弈是完全信息下的静态博弈,两个小偷各种策略组合下的支付是他们之间的“公共知识”(我们在下一章中将讨论什么是“公共知识”)。
我们上面已经分析了囚徒对局下各个策略下的结果或支付,以及它的均衡。它的均衡是双方均选择“招认”的策略。
可以这么说,最近10多年来,我国基础教育的问题是如何摆脱应试教育的困境问题。目前给中小学生“减负”不仅是学生家长的呼声,也是教育专家和教育管理部门的呼声,也可以说是全社会的呼声。教育管理部门这几年做了一系列的工作,但收效甚微,并没有从根本上解决问题。学校不断给学生增加负担是目前教育的实际状况。
大家普遍认为应试教育是扼杀学生的创造性,无论是专家还是家长,都在呼吁改变应试教育的模式。但是无论是专家,还是意识到教育问题的普通老百姓以及没有意识到教育问题的老百姓,其小孩都在接受着这种教育。
在现有的教育体制下,学生(或学生家长)有两个可选择的策略:“减负”和“增负”。学生的精力是有限的,如果选择“减负”策略,意味着学生有更多的时间学习课本以外的东西,这样学生的素质得到提高,因此,“减负”策略往往与素质教育联系在一起;而如果选择“增负”策略,则意味着学生花大量的时间做大量的习题,以“学透”、“学精”课本规定的东西,此时,学生没有时间学习课本以外的没有规定的内容。“减负”的结果是学生的全面发展;而“增负”的结果是学生获得高的分数。
在这样的博弈结构下,学生(或学生家长)如何选择呢?每个学生这样想:其他人采取的是“增负”教育策略的话,如果我采取“减负”教育策略,我的考试分数不如他人,在求学方面我会落后,接受不了好的教育,在未来求职时我也赶不上他人。在他人采取“增负”的策略下,我也应当采取“增负”策略。如果其他人采取的是“减负”策略,我应当采取什么策略呢?还是应当采取“增负”策略!因为,如果其他人采取的是“减负”策略的话,如果我采取的是“增负”策略,我的考试分数会比其他人高,我会上好的学校,在未来的职业竞争中我会处于优势。因此,无论其他人采取的是什么策略,我采取“增负”策略都是最好的。当每个学生都这样想的时候,全社会便进入了应试教育这样一个囚徒困境之中。
如果我国现有的考试制度没有改变,现在假设所有的学生都选择“减负”策略,即除了做少量的巩固性的作业外,不补课、不做其他的练习题,情况会是什么样子?
假设这种状态会出现,我们说,这种状态会很快消失,而立即会出现所有学生都进入“增负”的这样一个状态。可以说,均选择“减负”策略的状态是不稳定的,而“增负”的状态是稳定的均衡。原因就是,目前的教育的博弈结构规定了各种行动或行为的收益或好处:获得高分的会进入好的初中、高中,进入好的初中、高中的学生可以考高分进入好的大学。在这个博弈中,对于教师来说,学生的升学率高意味着其成绩大、奖金高,对自己的学生采取“增负”策略,对于自己而言是占优策略。
我国基础教育的博弈与囚徒困境有共同的结构,大家均选择“增负”策略构成基础教育博弈的纳什均衡。纳什均衡是一个稳定的博弈结果,这也是为什么我国目前的应试教育难以改变的原因。
2.斗鸡博弈与古巴的导弹危机
试想有两只公鸡遇到一起,每只公鸡有两个行动选择:一是退下来,一是进攻。如果一方退下来,而对方没有退下来,对方获得胜利,这只公鸡则很丢面子;如果对方也退下来,双方则打个平手;如果自己没退下来,而对方退下来,自己则胜利,对方则失败;如果两只公鸡都前进,那么则两败俱伤。因此,对每只公鸡来说,最好的结果是,对方退下来,而自己不退。支付矩阵如下:
鸡乙鸡甲前进后退前进(-2,-2)(1,-1)后退(-1,1)(-1,-1)
上表中的数字的意思是:两者如果均选择“前进”,结果是两败俱伤,两者均获得-2的支付;如果一方“前进”,另外一方“后退”,前进的公鸡获得1的支付,赢得了面子,而后退的公鸡获得-1的支付,输掉了面子,但没有两者均“前进”受到的损失大;两者均“后退”,两者均输掉了面子,获得-1的支付。当然表中的数字只是相对的值。
这个博弈有两个纳什均衡:一方前进,另一方后退。但关键是谁进谁退?一博弈,如果有惟一的纳什均衡点,那么这个博弈是可预测的,即这个纳什均衡点就是事先知道的惟一的博弈结果。但是如果一博弈有两个或两个以上的纳什均衡点,则任何人无法预测出一个结果来。因此,我们无法预测斗鸡博弈的结果,即不能知道谁进谁退,谁输谁赢。
用这个博弈来解释20世纪60年代初发生在美苏两个超级大国之间的一场导弹危机,是最合适不过的了。
二战结束后,形成了对峙的两个超级大国,美国和苏联。这两个超级大国是两个核心,在其周围有各自的盟友,它们一起组成了两大敌对的阵营。1962年赫鲁晓夫偷偷地将导弹运送到加勒比海上的岛国古巴,卡斯特罗政权是苏联这个超级大国的盟友,是美国的敌人。苏联的目的是将导弹部署在美国的眼皮底下,以对付美国。然而苏联的行动被美国的U-2飞机侦察到了,美国发现古巴建立了导弹发射场。此事震动美国,肯尼迪总统指责苏联,并发出严重警告,而苏联方面矢口否认。美国决定对古巴进行军事封锁,派遣了舰艇、空军及航空母舰,并集结了登陆部队。美国进入戒备状态,,美苏之间的战争一触即发。
面对美国的反应,苏联面临着是将导弹撤回国还是坚持部署在古巴的选择?而对于美国,则面临着是挑起战争还是容忍苏联的挑衅行为的选择?也就是说,这两只“大公鸡”均在考虑采取进的策略还是退的策略?
战争的结果当然是两败俱伤,而任何一方退下来(而对方不退)则是不光彩的事。结果是苏联将导弹从古巴撤了下来,做了丢面子的“撤退的鸡”。美国坚持了自己的策略,做了
“不退的鸡”。当然,为了给苏联一点面子,同时也担心苏联坚持不退而发生美苏战争——这是美国不愿意看到的,美国象征性地从土耳其撤离了一些导弹。古巴导弹危机是冷战期间美苏两霸之间发生的最严重的一次危机。
这就是美国与苏联在古巴导弹上的博弈结果。对于苏联来说,退下来的结果是丢了面子,但总比战争要好;对美国而言,既保全了面子,又没有发生战争。这就是这两只“大公鸡”博弈的结果。
3.骑虎难下博弈与美苏武器竞赛
我们经常碰到的一类博弈是,行动者进也不是,退也不是。笔者将这样的博弈称为骑虎难下博弈。
有一个拍卖,其规则是:轮流出价,谁出得最高,谁就将得到该物品,但是出价少的人不仅得不到该物品,并且要按他所叫的价付给拍卖方。
假定有两人竞价争夺价值100元的物品,只要双方开始叫价,在这个博弈中双方就进入了骑虎难下的状态。因为,每个人都这样想,如果我退出,我将失去我出的钱,若不退出,我将有可能得到这价值100元的物品,但是,随着出价的增加,他的损失也可能越大。每个人面临着两难:是继续叫价还是退出?
你会说,这个拍卖的规则不合理,在实际中这样的拍卖不会出现。当然这只是一个模型,但我们经常会看到此类型的博弈案例。这个博弈有一个纳付均衡:第一个出价人叫出100元的竞标价,另外一个人不出价(因为在对方叫出100元的价格后,他继续叫价将是不理性的),出价100元的参与人得到该物品。
在冷战期间,美苏为争夺霸权拼命发展武器,无论是原子弹、氢弹等核武器的研制,还是如隐形战斗机这样的常规武器的研制,双方均不甘落后。20世纪80年代,里根在位时准备启动“星球大战”计划,此举意味着两个超级大国的武器竞赛将进一步升级。美苏之间的武器竞赛就相当于拍卖中轮番出价,双方均不断出更高的价,如果一方没有出最高的价钱,退了下来,即没有继续竞赛下去,那么意味着它在军备上的投入没有效果,而对方将赢得整个局面。但如果继续竞赛下去,一旦支撑不住,损失也就越大。
1991年苏联的垮台在一定程度上是军备竞赛的结果。苏联将整个力量放在军备竞赛上,而民用建设无法跟上,国力不济,最终退下阵来。里根的“星球大战”计划其目的就是要拖垮苏联。
一旦进入骑虎难下的博弈,及早退出是明智之举,然而当局者往往做不到,这就是所谓当局者迷。这种骑虎难下的博弈经常出现在国家之间,也出现在企业或组织之间,当然个人之间也经常碰到。20世纪60年代,美国介入越南就是一个骑虎难下博弈。赌红了眼的赌徒输了钱还要继续赌下去以希望返本,也是骑虎难下博弈,其实,赌徒进入赌场开始赌博时,他已经进入了骑虎难下的状态,因为,赌场从概率上讲是肯定赢的。从理论上讲,赌徒与赌场之间的博弈如果是多次的,那么赌徒肯定输的,因为赌徒的“资源”与赌场的“资源”相比实在太小了。如果你的资源与赌场的资源相比很大,那么赌场有可能输的;如果你的资源无限大,只要赌徒有非0的赢的可能性,那么赌徒肯定会赢的。因此,像葡京这样的赌场要设定赌博数额的限制。
博弈论专家将这里的骑虎难下博弈称为协和谬误。20世纪60年代,英国和法国政府联合投资开发大型超音速客机,即协和飞机。该种飞机机身大、设计豪华并且速度快。但是,英法政府发现:继续投资开发这样的机型,花费会急剧增加,但是这样的设计定位能否适应市场还不知道;而停止研制将使以前的投资付诸东流。随着研制工作的深入,他们更是无法作出停止研制工作的决定。协和飞机最终研制成功,但因飞机的缺陷(如耗油大、噪音大、污染严重等等),它不适合市场,最终被市场淘汰,英法政府为此蒙受很大的损失。在这个研制过程中,如果英法政府能及早放弃飞机的开发工作,会使损失减少,但他们没能做到。
4.警察与小偷的故事——混合策略问题
纳什在《n人博弈的均衡点》这篇论文中,给出了均衡存在的简单证明,纳什说,在n个人的博弈中至少存在着一个均衡,在这点上双方均不愿意先改变策略。这里的均衡点有可能是混合策略点。人们称它为纳什定理。
什么是混合策略?
警察部门负责一城市中某一区的治安。警察要对该区的A、B两地进行巡逻。假定该区有一群小偷,要实施偷盗。警察要防止小偷的偷盗,但因为设备有限,只有一部警车,因此,警察只能一次在一个地方巡逻。而对于小偷而言,他们也只能去一个地方。假定A地需要保护的财产价值为2万元,B地的财产价值为1万元。若警察在某地进行巡逻,而小偷也选择了去该地,因警察在场,小偷无法偷盗该地的财物;若警察没有去某地巡逻而小偷选择了去该地,则小偷偷盗成功。警察怎么巡逻才能使效果最好?
一个明显的做法是,警察对A地进行巡逻,小偷去B地,这样,警察可以保住2万元的财产不被偷窃,小偷的收益为1万元。但是这种做法是警察的最好做法吗?有没有对这种策略改进的措施?
我们可以将警察与小偷之间的这个支付写成如下的支付矩阵。警察巡逻某地,偷盗者在该地无法实施偷盗,假定此时小偷的得益为0(没有收益),此时警察的得益为3(保住3万元)。
这个博弈也是常和博弈,它没有纯策略纳什均衡点,而有混合策略均衡点。这个混合策略均衡点下的策略选择是每个参与者的最优(混合)策略选择。
由此可见:纯策略是参与者一次性选取的,并且坚持他选取的策略;而混合策略是参与者在各种备选策略中采取随机选取的。在博弈中,参与者可以改变他的策略,而使得他的策略选取满足一定的概率。
当博弈是零和博弈与常和博弈时,即一方所得是另外一方的所失时,此时只有混合策略均衡。对于任何一方来说,此时不可能有纯策略的占优策略。
5?《三国演义》中的空城计与信息不对称的博弈
如果我们用博弈论的眼光看《三国演义》,三国演义完全是一部记载着许多博弈案例的著作。当然,罗贯中不可能用“博弈”一词。如果我们用一词来概括《三国演义》,这个词就是“计”。计,即计策或策略也。用计,即用策略赢对方。用计算敌,不仅要自己选择恰当的计策,而且要算准对方用什么计策,这不就是博弈?现在让我们看《三国演义》中著名的空城计博弈。
诸葛亮误用马谡,致使街亭失守。司马懿引大军十五万蜂拥而来。当时孔明身边别无大将,只有一班文官,五千军士,已分一半先运粮草去了,只剩二千五百军士在城中。众官听得这个消息,尽皆失色。孔明登城望之,果然尘土冲天,魏兵分两路杀来。孔明传令众将旌旗尽皆藏匿,诸军各收城铺。打开城门,每一门用二十军士,扮作百姓,洒扫街道。而孔明乃披鹤氅,戴纶巾,引二小童携琴一张,于城上敌楼前凭栏而坐,焚香操琴。司马懿自飞马上远远望之,见诸葛亮焚香操琴,笑容可掬。司马懿顿然怀疑其中有诈,立即叫后军作前军,前军作后军,急速退去。司马懿之子司马昭问:“莫非诸葛亮无军,故作此态,父亲何故便退兵?”司马懿说:“亮平生谨慎,不曾弄险。今大开城门,必有埋伏。我兵若进,中其计也。”孔明见魏军退去,抚掌而笑,众官无不骇然。诸葛亮说,司马懿“料吾生平谨慎,必不弄险;见如此模样,疑有伏兵,所以退去。吾非行险,盖因不得已而用之”,我兵只有二千五百,若弃城而去,必为之所擒。
这就是为后人广为传颂的空城计。这是一个信息不对称的博弈。
这里,司马懿不知道自己和对方在不同行动策略下的支付,而诸葛亮是知道的,他们对博弈结构的了解是不对称的,诸葛亮拥有比司马懿更多的信息,当然有。这种信息的不对称完全是诸葛亮“制造出来的”。因此这是一个信息不对称的博弈。
在这里,孔明可以选择的策略是“弃城”或“守城”。无论是“弃”还是“守”,只要司马懿明确知道他自己的支付,那么孔明均要被其所擒。孔明惟一的办法就是不让司马懿知道他自己的策略结果。他的空城计是降低司马懿进攻的可能收益,使得司马懿认为,后退比进攻要好。
司马懿孔明进攻后退守城(被擒,大胜)(逃脱,不胜不败)弃城(被擒,大胜)(逃脱,不胜不败)
在信息不充分的情况下,博弈参与者不是使自己的支付或效用最大,而是使自己的“期望支付(或效用)”最大。比如:如果让你在“有50%的可能获得100元”与“有10%的可能获得200元”两者之间进行选择,你当然选前者,因为前者的“期望所得”为:50%×100=50元,而后者为:10%×200元=20元。理性的人是选择前者的。
在孔明—司马懿的博弈中,孔明了解双方的局势,制造空城假象的目的就是让司马懿感到进攻有较大的失败的可能。如果我们用概率论的术语来说,诸葛亮的做法是加大司马懿对进攻失败的主观概率。此时,在司马懿看来,进攻失败的可能性较大,而退兵的期望效用大于进攻的期望效用。即:司马懿认为进攻的期望效用低于退兵的效用。诸葛亮惟有通过这个办法,才能让司马懿退兵。
司马懿想,诸葛亮一生谨慎,不做险事,只有设定埋伏才可能如此镇定自若,焚香操琴。此时,司马懿觉得“退”比“进攻”更合理,或者说期望效用更大。于是后军变前军,前军变后军,后退而去。结果是诸葛亮得以逃脱。
司马懿对局势的判断不是没有道理的,他对诸葛亮的判断是基于以前的认识,这就是“归纳法”。
空城计博弈是不完全信息博弈,我们说过《三国演义》是一本博弈实战教材,在该书中有完全信息博弈实例吗?当然,曹操与诸葛亮的华容道博弈就是一个完全信息博弈。
曹操亲领八十万大军进攻东吴,孙权和刘备联合破曹,曹军大败。曹操引兵而逃。经过一路厮杀,来到一处,军士报:前方有两条道路,请问丞相走哪条路?曹操问:哪条路近?军士说:大路稍平,却远五十余里。小路投华容道,却近五十多里。曹操令人上山观望,回报:小路山边有数处狼烟,大路并无动静。曹操叫走华容道。诸将问:烽烟起处必有军马,何故反走这条路?曹操说:岂不闻兵书有云:“实则虚之,虚则实之”。诸葛亮多谋,故使人于山僻放烟,使我军不敢从这条路走,他却伏兵于大路等着。吾已料定,偏不教中他计。诸将皆曰:丞相妙算,人不可及。遂曹兵走华容道。但关羽依着诸葛亮的妙计在华容道等着曹操,于是关羽上演了一场“只为当初恩义重,放开金锁走蛟龙”的捉放曹的义举。逃过华容道大难,曹操只剩二十七骑!
在曹操与诸葛亮之间的这一华容道博弈中,曹操的策略是在走华容道还是走大路之间进行选择,而诸葛亮派关羽埋伏时,要在埋伏在大路还是埋伏在通往华容道的小路之间进行选择。
华容道博弈曹操诸葛亮华容道大路——0.1华容道(捉住曹操,被捉)(白等,逃脱)大路(白等,逃脱)(捉住曹操,被捉)
这个博弈如同猜硬币的游戏一样,是一“零和博弈”所谓“零和博弈”是指双方的得益之和为一常数零,一方所得增加,另一方所得便减少。而“变和博弈”是指博弈双方的所得之和为一变数。,它没有纳什均衡点。双方对博弈有完全的信息,但双方无法知道对方的策略选择,而只能进行猜测。曹操要选择走诸葛亮的军队不在的路,这是他的最优的结果。而诸葛亮的最优结果是埋伏在曹操要走的路上。
诸葛亮制造埋伏在大路的假象,其实则派关羽埋伏在小路。这里关键是谁能真正猜到对方的策略,谁就是赢家。诸葛亮胜曹操一筹。这个博弈不存在纯策略纳什均衡点,博弈结果是:曹操选择了走华容道,结果被抓;关羽在华容道守候,抓住了曹操。
TA的首页


