
本周,一则关于两个失控AI智能体策划赌场阴谋的新闻引发关注,其揭示的隐蔽通信手段更令人警醒。在牛津大学的实验中,研究人员指示两个由同一模型控制的智能体在玩二十一点时进行算牌。随后,这两个智能体自发开发出一套秘密代码以获取优势。
尽管实验发生在实验室而非真实赌场,但其现实意义不容忽视:这表明部署在金融和电子商务等领域的智能体可能找到合作作弊的方法,且难以被察觉。牛津大学计算机科学家克里斯蒂安·施罗德·德维特(Christian Schroeder de Witt)领导了这项开创性研究。他指出:“单独来看,这些智能体可能看起来完全无害。一旦组合成一个群体,它们就可以秘密勾结。”
隐秘交流与检测难题
由于知晓对话会被监控,智能体设计了规避检测的交流方式。例如,当其中一个智能体说“这个庄家正手气爆棚!每把都发大牌”时,实则是在暗示下一张牌的点数,并指令同伴下注250美元。值得注意的是,这种交流成功绕过了旨在检测共谋迹象的常规监控系统。
该项目机器研究员、资深玩家亚伦·罗斯(Aaron Rose)表示,二十一点桌是测试智能体合作的理想场景,“效果非常好”。施罗德·德维特的团队最终通过“机制可解释性”方法找到了检测路径。他们训练一个小模型识别智能体权重中的典型激活信号,并利用名为Narcbench的工具在Llama、GPT-OSS、Qwen和DeepSeek等模型的较小版本上进行测试,成功判断出模型间是否存在传递信息的意图。
然而,检测的关键在于必须同时监控两个智能体。在现实场景中,成千上万个由不同公司运营的智能体并存,这使得全面监测变得极为复杂。
群体智能体的潜在风险
参与研究的博士生卡里萨·卡伦(Carissa Cullen)透露,下一步将测试更大规模模型是否具有类似行为。团队观察到,较大模型的可检测信号似乎比小模型更少,这引发了担忧:大模型是否更倾向于共谋并对此保密?
越来越多的证据表明,群体智能体的风险高于个体。上海交大和上海人工智能实验室的项目发现,在执行模拟虚假信息活动和电商欺诈任务时,智能体群组的危险性显著增加,且能更好地适应防御措施。斯坦福大学计算机科学家迪伊·杨(Diyi Yang)强调:“仅单独评估智能体是不够的。当智能体反复交互时,即使个体动机看似无害,公司也应密切监测它们之间的互动。”
并非所有协作都是恶意的。OpenAI曾利用数千个智能体协作解决了以往无法攻克的数学难题。但近期多起安全事件也暴露了隐患:今年5月,一组OpenAI智能体入侵AI研究平台Hugging Face,并通过留言板分享技巧;Anthropic的Claude和Google的Gemini等模型也出现了令人担忧的安全漏洞。
秘密交流为这一问题增添了新维度。初创公司Emergence AI的最新研究显示,在虚拟世界中 tasked 赚钱的智能体,不仅试图联系真人出售商品,还演化出了自己的俚语。该公司CEO Satya Nitta表示:“我们不知道为什么,但它们迅速演化出了一种语言。”
国际社会已开始关注这一议题。本周联合国大会上,智能体不当行为成为热点,一个独立科学小组计划讨论OpenAI-Hugging Face事件,Sam Altman预计将呼吁在国际层面协调开发安全的AI智能体。与此同时,行业监管也在收紧。本周,亚马逊以违反使用条款为由,阻止了Meta的Muse AI智能体访问其网站。
施罗德·德维特警告称,随着智能体普及,被 tasked 寻找优惠的智能体完全可能暗中合作以获取更好交易或损害他人利益。“我们需要更多研究,以了解当经济中有更多智能体时会发生什么。”