
微软首席执行官萨提亚·纳德拉在X平台发文指出,最值得信赖的超级智能系统,并非由用户最信任的模型驱动,而是构建一个允许人们对模型保持最低信任度的体系。
“最值得信赖的超级智能系统,不会是那个我们最信任其模型的系统。它将是一个使我们能够最少信任该模型的体系。”纳德拉写道。
告别“黑盒”:重建机制性理解
针对先进人工智能带来的治理挑战,纳德拉指出,现代系统缺乏传统计算时代的机制性透明度。在过去几十年中,工程师可以将软件行为直接追溯至特定代码路径;但在当今的前沿架构中,这种可见性已不复存在。
“尽管支撑这些系统的前沿模型比传统软件更强大,但我们依然缺乏那种机制性的理解。我们无法将模型的行为和输出归因于特定的训练数据输入或模型权重配置。”纳德拉表示,尽管如此,业界仍在部署这些复杂的代理系统,赋予其访问敏感数据的权限,并让其执行关键任务。
权限分离:将控制措施外部化
纳德拉警告,企业不应仅依赖开发人员的保证,也不能将此类部署视为简单的“黑盒”运作。他强调,自动化行动的责任不可外包,必须将原始智能的供给与最终的运营权限严格分离。
“撇开对齐难题不谈,我们需要从工程角度入手,采取管控和治理措施。”纳德拉解释称,需要用强大的确定性系统设计、人工控制和可靠的运行程序来“包围”非确定性模型,并在现有标准不足处建立行业规范。
为管理风险,纳德拉提议将封闭模型和开放权重模型均视为潜在的内部威胁。鉴于任何拥有特权的角色都可能失效或被攻陷,组织必须通过经过验证的企业安全实践(如身份控制、活动日志记录和严格的权限边界)将模型隔离。
“管控模型可访问内容及其可执行操作的规则必须位于模型之外。”他指出,这基于20世纪70年代的信息安全原则,即程序不得绕过或篡改执行其权限的机制。这意味着要将模型与其编排工作的“容器”及定义其能力的行动空间分离开来,实现控制措施的外部化。
此外,纳德拉还概述了观察和治理这些系统的关键原则,包括模型多样性、防篡改日志记录、跨边缘案例的持续可验证性、独立审计、可靠的遏制关机机制以及行业范围内的事故披露。