卡内基梅隆大学、麻省理工学院、纽约大学和斯坦福大学的研究人员共同开发了名为 Ataraxos 的人工智能系统,成功攻克经典棋类游戏《战略》(Stratego)。在与四届世界冠军皮姆·尼迈耶(Pim Niemeijer)的对决中,Ataraxos 取得了15胜1负4平的压倒性战绩。

引入信念模型,突破隐藏信息瓶颈

Ataraxos 的核心突破在于引入了一个用于估算敌方隐藏棋子身份的“信念模型”(Belief Model)。这一辅助神经网络使系统能够基于对手移动模式推测隐藏棋子位置,从而采样出合理的假设场景并模拟候选走法,而非在庞大的隐藏信息空间中盲目穷举。Farina 表示,这种每一步移动前的“前瞻性思考”是此前 DeepMind 认为在《战略》游戏中难以实现的技术难点,也是 Ataraxos 区别于2022年推出的 DeepNash 的关键所在。

在训练机制上,Ataraxos 同样采用自我对弈,累计进行了1.63亿局比赛。通过强化获胜走法、抑制失败走法的基础逻辑,系统不断优化策略。针对隐藏信息易导致算法陷入循环的问题,研究团队在训练初期采取大胆的策略调整,后期则转为谨慎微调。

算力效率显著提升,成果登《自然》

在资源效率方面,Ataraxos 展现了极高的性价比。DeepNash 曾在谷歌1,024块专用芯片上训练两至三个月,按2025年价格估算,成本高达300万至450万美元。相比之下,Ataraxos 仅使用16块GPU运行一周,并额外动用4块GPU训练四天信念模型。主要作者 Samuel Sokota 和 Farina 通过编写能在GPU上每秒运行数百万步的模拟器,实现了这一高效能。

数据显示,Ataraxos 的对局数量比 DeepNash 少约34倍,学习速度更快,最终实力却更强。Farina 坦言,学术界难以获得成片GPU集群,这一高效方案更具现实意义。目前,相关研究成果已发表在《自然》(Nature)期刊上。