效。人类在生死压力下会做出非理性选择,但AI不会。如果对面是AI,他们一定会采取最优策略。”
“所以我们要比最优策略更优。”谢知野说,“或者,诱导AI犯错。”
“诱导AI犯错需要制造它模型之外的变量。”江述接话,“但我们对AI的决策模型一无所知。”
“那就第一轮试探。”徐景深总结,“收集数据,建立对手模型。”
五分钟倒计时结束。
主持人的声音响起:“第一轮博弈:囚徒困境变体。”
房间中央的桌面上方浮现出全息投影,显示第一轮规则:
【第一轮:信任投票】
【规则:】
【1. 每队三人各自秘密投票,选择“合作”或“背叛”】
【2. 投票结束后,根据双方队伍的投票组合计算收益】
【收益表:】
【若红队选择合作的人数 ≥ 蓝队选择合作的人数:红队每人获得200筹码,蓝队每人失去200筹码】
【若红队选择合作的人数 < 蓝队选择合作的人数:红队每人失去200筹码,蓝队每人获得200筹码】
【特殊:若双方选择合作的人数相同,则所有玩家失去100筹码】
【投票时间:3分钟】
【讨论时间:2分钟(仅限队内)】
规则显示完毕的瞬间,江述的扶手屏幕上出现了投票界面:两个选项,“合作”和“背叛”,下方有三分钟倒计时。
“经典的囚徒困境变体,但变成了团队对抗。”徐景深立刻分析,“通常的囚徒困境是个人利益与集体利益冲突,这里变成了团队利益与对手团队的对抗。”
谢知野盯着收益表:“关键是对手会怎么选。如果我们全选合作,对手也全选合作,双方合作人数相同(3=3),那么我们都损失100。如果我们全选背叛,对手也全选背叛,合作人数都是0,也相同,还是都损失100。”
“所以必须预测对手的选择,并做出比他们更多合作或少合作的决定。”江述说,“但这是第一轮,没有任何数据。”
“如果对面是AI,”徐景深思考,“AI的第一轮策略通常是保守的。可能会选择全背叛,因为这是最稳妥的不输策略——最坏情况是双方都背叛,各输100,但不会出
本章未完,请点击下一页继续阅读!