针对“人工智能是否会在本十年末导致人类灭绝”的争论,普林斯顿大学计算机科学家、《AI Snake Oil》合著者 Sayash Kapoor 和 Arvind Narayanan 发表了最新观点。此前,Anthropic 公司承认未来十年内 AI 导致全人类灭绝的概率超过 10%,引发业界广泛关注。

高管确认灭绝风险,但无明确解决路径

争议源于 AI 研究员 Jacob Coxon 的辞职声明。他指出,OpenAI 和 Anthropic 内部深知 AI 系统可能在本十年末导致全人类灭绝,且这一恐惧在高管私下交流中普遍存在,并非营销噱头。该声明浏览量已超 1.56 亿次。

对此,Anthropic AI 安全负责人 Evan Hubinger 并未否认,反而证实了 Coxon 的说法。Hubinger 表示:“Jacob 是正确的,我们确实认真认为 AI 可能导致全人类灭亡。”他个人评估未来十年内发生此类事件的概率大于 10%,并坦承尽管 Anthropic 正在尽力,但目前尚无解决超级智能“对齐”问题的计划或明确路径。

关于 AI 如何具体威胁人类,焦点主要集中在其对水电厂等关键基础设施发动破坏性网络攻击的能力上。

仅靠“对齐”不足,需构建分层防御体系

“对齐”旨在确保 AI 目标与人类一致,是降低风险的核心手段之一。然而,学界对于仅通过对齐能否消除风险存在分歧:一方认为这能根本解决问题,另一方则担忧 AI 可能伪装对齐以通过检查,实则持有冲突目标。

Kapoor 和 Narayanan 在长篇论文中论证,应采取更为审慎的中立立场,仅靠对齐并不足够。他们提出需在现有基础上补充三个安全层级:

  • 控制:包括沙盒隔离、人工监督及实时监控;
  • 下游防御:利用 AI 技术防御 AI 发起的攻击;
  • 韧性:建立从成功攻击中恢复的应急预案。

两位学者在文末表达了乐观态度,认为若以适当紧迫感采取行动,可迫使 AI 公司承担更高标准,降低失控风险,并将网络安全攻防平衡向防御方倾斜。这一观点强调了对齐工作的局限性,主张通过多层级防御体系应对潜在威胁。