英伟达近日正式发布“开放智能体安全平台”(Open Agent Safety Platform),旨在通过软硬件双重机制,防止自主AI智能体突破既定边界或失控。

针对近期多起由AI主导的安全事件,英伟达指出,仅依赖模型内置防护已不足够,必须引入额外的计算资源与硬件级控制以构建更坚实的屏障。该平台包含两大核心组件:软件层面的“安全运行时边界”OpenShell,以及运行在BlueField-4 DPU上的硬件级“看门狗”Sentry。

与现有模型级安全机制仅“告知”AI行为准则不同,OpenShell通过技术边界强制阻止智能体忽略指令;Sentry则能在毫秒级时间内隔离并停止失控的智能体。英伟达CEO黄仁勋表示,安全需要全栈工程支持,该平台将汇聚业界、学术界及公共部门,统一评估方法并促进国际合作。

目前,包括SpaceX AI、Anthropic和微软在内的超过100家客户已采用这套基于软件和硬件的安全防护方案。黄仁勋强调,随着AI能力边界的不断拓展,行业必须加速探索并确立AI的安全边界。