MIT 等团队开发 Ataraxos,在 Stratego 上以 15-1-4 击败世界最强人类选手
This game-playing AI is the new champ at Stratego
MIT、卡内基梅隆大学、纽约大学和斯坦福大学的研究者开发出 AI 系统 Ataraxos,在隐藏信息的棋盘战争游戏 Stratego 中以 15-1-4 击败世界最强人类选手,并在世界锦标赛顶级选手中取得 39-2 战绩,论文发表于 Nature。
论文给出隐藏信息博弈中训练效率与决策时规划的具体做法,可迁移到谈判、网络安全等现实场景。
一种擅长处理隐藏信息的高难度博弈的新型 AI 系统,未来或许能帮助人类决策者在军事演习等复杂情境中选出理想策略,从而智胜对手。
借助机器学习的进展,来自麻省理工学院、卡内基梅隆大学、纽约大学和斯坦福大学的研究人员开发出一种 AI,以较大优势击败了棋盘战争游戏 Stratego 的顶尖人类玩家——这是此前任何 AI 系统都未能做到的。
Stratego 是一种双方信息不完整的双人游戏,对手棋子的身份始终隐藏,常被用作测试强大 AI 模型战略思维能力的基准。
为了构建该模型,研究人员将高效的训练算法与专为隐藏信息环境下的审慎决策而定制的新技术相结合。
该 AI 系统在 Stratego 上的表现优于次优模型,同时训练成本远更低、算力需求也小得多。该系统还在规则和设计各异的其他策略游戏中胜过顶尖人类玩家,表明它可以泛化应用于多种场景。
该 AI 系统可被改造用于帮助人类解决许多带有隐藏信息的现实问题,例如商业谈判或网络安全。
“在现实中你会遇到的那种信息不完整的任务里,你往往没有条件去穷举所有可能性。可能性实在太多了。拥有通用且能可证明地如此出色地完成这一挑战性任务的 AI 算法,是向前迈出的一大步,”Gabriele Farina 说。他是电气工程与计算机科学系(EECS)助理教授、信息与决策系统实验室(LIDS)首席研究员,也是这篇关于该 AI 系统的论文的资深作者。
与他共同撰写该论文的还有第一作者、卡内基梅隆大学研究生 Samuel Sokota;纽约大学助理教授 Eugene Vinitsky;卡内基梅隆大学教授 Zico Kolter;斯坦福大学研究生 Hengyuan Hu;以及麻省理工学院 EECS 研究生 Zhiyuan Fan。这项研究今日发表于 Nature。
隐藏信息
这个世界充满了信息不完整的问题。
在这些互动中,一些参与方掌握着其他方所没有的信息。例如,金融市场中的交易者可能不知道他人交易背后的理由,而军队很可能并不完全掌握敌方位置。
在存在隐藏信息的情况下,各方所做的决策,以及他们选择不做的决策,彼此交织,使得确定下一步最佳行动变得极其困难。
“你越是虚张声势,对手就越会预料到,每次虚张声势的价值也就越低。如何对此进行推理并不显而易见,”Sokota 解释道。“这与国际象棋之类的场景非常不同,在国际象棋中,无论你下过多少次,最佳着法仍然是最佳着法。”
Stratego 常被用来模拟信息不完整的情境。在这款类似军棋的棋盘战争游戏中,玩家在己方一侧布置 40 枚棋子,然后让棋子穿过棋盘去夺取对手的军旗。
但在棋子相撞之前,所有棋子的身份都保持秘密,随后级别较低的棋子会被淘汰。
可能的棋子配置数量超过10的66次方——比国际象棋的数量呈指数级增长——这使得AI系统极难在Stratego中表现出色。
过去的努力,如谷歌的DeepMind,依赖于计算需求高且成本高昂的复杂操作。但即使训练成本高达数百万美元,这些模型仍不足以击败顶尖的人类Stratego玩家。
“在Stratego中,可能存在大量你不得不应对的宇宙爆炸。为像扑克这样的游戏开发的AI技术在这种设定下绝对无法扩展,”Farina说。
麻省理工学院的研究人员着手开发一个完整的AI系统,能够以更低的成本实现超人表现,他们将其命名为Ataraxos(一个希腊词,用来描述一个不受打扰或无忧无虑的人)。
双管齐下的方法
为了构建Ataraxos,研究人员使用了一种称为自对弈强化学习的技术来训练模型。该模型与自己多次对弈,以学习如何在Stratego中出色表现的强大“蓝图策略”。
他们设计了特别高效的算法,使Ataraxos比先前方法学习得更快,同时确保它不会陷入试图预测每一个可能移动的困境。这降低了训练成本并提升了性能。
“我们的系统达到了严格高于DeepNash(DeepMind的系统)的棋力,同时使用的训练样本不到其百分之一,自对弈游戏不到其三十分之一,表明效率有了巨大提升,”Farina说。
在游戏过程中,Ataraxos使用蓝图策略作为起点来设置棋盘,并在每一轮游戏中开始思考其下一步移动。
但在行动之前,它使用一种称为决策时规划的技术实时优化其选择。该系统采用一个生成模型,使用概率来估计对手隐藏棋子的可能身份,然后在选择下一步移动之前评估未来的选择。
“我们不是盲目猜测,而是使用决策时规划来找到棋盘最可能的状态。使用这个生成模型使我们能够真正聚焦于我们面对的特定棋盘和对手,”Farina说。
这种创新性地将生成模型用于决策时规划,是使Ataraxos实现超人表现的关键缺失部分。
Ataraxos以15-1-4的创纪录比分击败了世界上最强的Stratego玩家,并在Stratego世界锦标赛上对顶尖人类玩家取得了39-2的战绩。“Ataraxos擅长以人类无法做到的方式计算风险。如果人类最有价值的棋子暴露了,可能会开始惊慌失措,但机器人可以出奇地镇定。它不会过度纠正并泄露自己的秘密,”Farina说。
研究人员还将Ataraxos适应于其他不完全信息游戏,包括Barrage Stratego(一种节奏更快、棋子更少的变体)、Hanabi(一种多人合作的纸牌游戏)和斗地主(一种两名玩家合作对抗第三名的游戏)。
该系统在每个实例中都实现了超人表现,展示了这种方法的通用性。
未来,研究人员希望将可解释性措施融入Ataraxos,以便系统能够以人类可以理解的方式解释其决策。
“人类必须对是否采纳推荐拥有最终决定权,因此在采用之前,我们需要一种审计模型决策的方法。我们还有很长的路要走,但我希望这些算法能够成为未来更多工作的基础,”Farina 说。
这项研究部分由美国海军研究办公室、纽约大学土木与城市工程系、C2SMART 中心、美国国家科学基金会以及 Schmidt Sciences AI2050 早期职业奖学金资助。
来源:MIT News · AI · news.mit.edu