从1997年深蓝击败卡斯帕罗夫,到2016年AlphaGo战胜李世石,再到扑克机器人长期压制职业选手,人工智能已在诸多经典博弈游戏中证明实力。然而,军棋(Stratego)曾是计算机难以逾越的堡垒,即便是拥有雄厚资源的DeepMind也未能构建出能稳定击败顶尖人类的模型。

如今,这一僵局被打破。来自卡内基梅隆大学、麻省理工学院、纽约大学和斯坦福大学的联合研究团队开发了名为Ataraxos的AI系统。该系统以15胜1负4平的战绩,击败了被誉为史上最强的军棋玩家皮姆·尼梅伊尔(Pim Niemeijer)。值得注意的是,该模型的训练成本极低,仅使用了16块GPU,花费仅数千美元。

不完全信息博弈的挑战

军棋的复杂性源于其独特的机制。每位玩家拥有40枚代表不同军衔(从司令到间谍)的棋子,以及炸弹和军旗,胜利条件是夺取对方军旗。对手虽知晓棋子位置,却无法得知其具体身份,仅在两子交战时才会揭晓结果:弱者被淘汰,胜者身份暴露。这种机制使军棋成为典型的不完全信息博弈。

尽管计算机早已攻克扑克等不完全信息游戏,但军棋的难度在于其隐藏信息量巨大且随时间逐步展开。纽约大学研究人员、论文共同作者尤金·维尼茨基(Eugene Vinitsky)指出:“军棋的独特之处在于,它包含海量的隐藏信息,且这些信息是在极长的时间尺度上逐步揭示的。”