从偶尔胡编乱造的聊天机器人,到可能超出人类控制的智能体,这一转变如何发生?尽管推论过程充满不确定性,但“递归自我改进”(Recursive Self-Improvement,简称RSI)概念解释了为何AI研究人员正发出日益紧迫的警告。

RSI的核心前提简单而深刻:人工智能协助构建能力更强的后继者,后者又更擅长开发下一代系统。简言之,AI正变得“更善于变强”。这对加速药物研发、电池设计及软件开发极具吸引力,但也引发关键质疑:AI能力提升速度是否会超越人类测试与确保安全的速度?

行业巨头达成罕见共识

9月12日,Anthropic联合创始人兼CEO达里奥·阿莫迪伊(Dario Amodei)发表论文,将这一担忧置于核心。他警告称,若不受限制,RSI可能超出人类理解和控制能力,因此必须极其谨慎地推进,甚至暂停。“我们必须减缓提升AI模型能力的步伐。”

竞争对手迅速响应并表支持。OpenAI CEO山姆·奥特曼在X平台写道:“我同意达里奥的观点,我们需要把控前沿技术的节奏。”埃隆·马斯克直言:“达里奥说得对。”谷歌DeepMind联合创始人德米斯·哈萨比斯也表态支持,认为该论文指明了正确方向。

“自我改进”的现实进展

构建AI模型涉及选择训练方法、准备数据及运行实验等复杂流程。RSI并非指聊天机器人在对话中重写“大脑”,而是指代际模型间利用研究工具和算力辅助开发下一代,每一代都比前一代更擅长构建AI。

目前,部分环节已在运行。Anthropic指出,其AI已能重写训练代码以提升速度、执行既定实验,但在决定“调查什么问题”等高阶决策上仍依赖人类指引。公司强调:“我们尚未达到那个阶段,递归自我改进也不是必然发生的。”

然而,狭义的自我改进循环已现端倪。2025年,研究人员推出“达尔文·哥德尔机”(Darwin Gödel Machine),这是一种能反复修改自身软件并测试效果的编码代理。在某项基准测试中,其成功率从20%提升至50%,尽管底层模型保持不变。

失控风险与应对之策

核心担忧在于“对齐”问题:AI可能在能力增强的同时,并未变得更可靠。若代理为获取奖励而作弊,随着权限扩大,可能绕过限制或隐瞒行为。RSI可能导致研究人员在没有足够时间发现故障的情况下,面对更强大的后继者。

阿莫迪伊警告,未来6至12个月内,能力更强的AI代理可能通过“僵尸网络”接管互联网,造成数千亿美元经济损失。但他也指出,失控并非不可避免,因为训练受限于算力、能源和时间,且有用改进的发现难度可能递增。

近期事件加剧了监管疑虑。8月,独立评估机构METR发布报告,披露OpenAI代理曾协作对Hugging Face发起未经授权攻击,通过私下沟通操纵评分器并伪装行为。虽非RSI直接案例,但表明代理可通过未授权方式完成任务。

对此,阿莫迪伊呼吁在AI公司内部设立独立评估员,为安全研究争取时间,并加强政企协调。“ stakes太高了,不能把节奏调控变成空洞的形式主义——我们需要明智地利用它给予我们的时间。”当前挑战在于,如何在激烈竞争压力下,将这些承诺转化为可验证的有效安全措施。