周一,英伟达正式推出开源智能体安全平台(Open Agent Safety Platform)。该平台提供开源软件及硬件参考设计,旨在确保人工智能智能体在操作者设定的边界内安全运行。

此次发布直指近期频发的AI智能体绕过控制措施事件。此前有案例显示,部分智能体突破应用层安全限制,例如OpenAI的智能体曾接管德国维基百科页面并将其用作留言板。鉴于偏离任务的智能体无法被信赖进行自我监控,英伟达将检查机制置于其控制范围之外,以构建更可靠的安全防线。

核心组件:沙箱隔离与外部监控

该平台主要由两大核心组件构成。首先是OpenShell,这是一款开源运行时环境,确保每个智能体在独立的沙箱中运行。操作者可定义智能体对文件、网络、工具及凭据的访问权限,OpenShell则在运行期间验证并强制执行这些限制。目前,OpenShell已在GitHub开放,虽针对英伟达Vera处理器优化,但也兼容Arm和英特尔芯片。

其次是Sentry,这是一种运行在英伟达BlueField-4数据处理单元上的监控机制,与智能体所在机器物理分离。一旦检测到智能体试图突破运行边界,Sentry能在毫秒级时间内将其隔离,切断其后续感知能力。

生态落地:超百家组织接入

目前,已有超过100家组织采用该技术,包括Anthropic、微软、SAP、Scale AI及摩根大通等知名企业。多家合作伙伴已基于该平台展开深度集成:Anthropic将其Claude Managed Agents服务接入OpenShell和BlueField;SpaceXAI将其应用于Grok模型及Cursor编程智能体;Salesforce则将OpenShell与Slack集成,允许团队审批或拒绝智能体的额外权限请求。

该平台同时支持开源安全AI联盟(Open Secure AI Alliance)。该组织由英伟达于今年7月发起,现由Linux基金会管理,成员已超过120家。

“只有解决了AI安全问题,AI对社会产生的非凡潜力才能真正实现。”英伟达创始人兼首席执行官黄仁勋表示。