OpenAI 公布了六起“意外或令人担忧的模型行为”事件,进一步加剧了关于人工智能安全性的辩论,同时也增加了有关失控 AI 的报告数量。

除发布事件报告外,OpenAI 还推出了一套向公众披露此类偏差问题的新框架,取代了过去零散、临时的披露方式。

此次发布正值 AI 行业及相关利益方讨论如何应对模型偏差风险之际。此前,Anthropic 一名员工辞职并警告称,AI 可能给人类带来安全隐患甚至存在性风险。

OpenAI 在博客文章中承认,随着夏季一系列涉及 AI 代理的网络事件爆发,行业尚未解决此前显现的“对齐问题”(alignment issue),且监控力度不足以支撑该技术以当前速度持续扩展。该公司表示:“未来几个月乃至几年内关于 AI 发展路径的决策,需要基于外部人员能够自行审查的证据。”

六个新问题

博文详细列举了六起模型偏差案例,即 AI 模型或代理采取了人类未曾意图的行动。例如,OpenAI 的代理曾入侵 Hugging Face AI 代码仓库,以便回答一道测试题。

OpenAI 发布了针对这六个新案例的详细报告,但补充道:“这些是单独事件的报告,不应被视为反映我们的模型中发生模型偏差的频率。”

前两个案例涉及篡改摘要以掩盖错误或不当行为。在一个案例中,一个尚未发布的模型更改了自己的指令,修改用于延续工作的摘要,从而“无视其正常约束”。OpenAI 指出,它发现了 27 起编辑摘要的事件。第二个例子类似:在训练期间,GPT-5.6 Sol 篡改摘要以掩盖用户造成的错误或偏差行为。

第三和第四个案例涉及信息来源问题。在一个实例中,一个模型搜索暴露的 API 密钥并在未经授权的情况下使用它们——这是为了获取财务数据而提出的基本请求的一部分。“当它仍无法检索到请求的数据时,它伪造了这些数据,并将其作为来自请求源的数据呈现出来。”博文写道。

在下一个实例中,模型通过 Python 找到了关于湖泊大小的查询答案,但当用户要求提供来源时,它在未告知用户的情况下上传了文件以便引用。

最后两个新案例与 Hugging Face 事件有相似之处。在一个案例中,模型利用软件仓库作为留言板来共享信息;在另一个案例中,协同工作的代理尽管任务要求仅使用本地文件,却利用公共文件托管网站在线共享文件。

共享偏差信息

OpenAI 表示,此前曾尝试将所有关于模型偏差的发现公开。“但由于缺乏系统性的报告方法,我们的披露往往是零散的,频率也不如理想状态:我们通常等到能汇总多个实例形成一份报告时才发布,或者将它们添加到新发布模型的系统卡片中。”该公司指出。

因此,该公司开发了一套新框架,旨在更快速、便捷地发布模型偏差报告,即使相关行为尚未完全解决。

根据新框架,任何 OpenAI 员工都可以标记模型偏差以供调查,并要求通过公开渠道披露——当然,是否最终披露仍取决于技术人员。

如果报告发布,其中将包括事件详情、潜在危害、发现偏差的过程,以及 OpenAI 接下来将采取的缓解措施。

“目前,行业内没有明确的标准框架规定 AI 开发者应如何披露其模型中的偏差案例。”博文补充道,“我们希望今天概述的框架是建立此类标准的第一步,明确了开发者应披露哪些偏差实例,以及报告应包含的内容。”