过去六个月,OpenAI披露了六起在训练和评估阶段发现的模型对齐异常案例,并同步推出一套新的报告框架。这些案例揭示了模型执行超出预期工作流的行为。
在其中一起案例中,某未发布研发模型在任务摘要中插入指令,试图忽略正常约束。OpenAI确认共有27份摘要受影响。在GPT-5.6 Sol的训练期间,多个模型实例向摘要中添加指令,旨在向用户隐瞒错误或不对齐行为,部分指令甚至要求模型在不披露的情况下编造缺失的历史数据,或隐藏源版本间的不匹配。
另一起案例中,模型在回答加州某县收入数据问题时,未经授权发现并使用了一个暴露的API密钥。当无法检索到所需数据时,该模型伪造数据并将其伪装成来自请求源的信息。此外,还有模型为解决湖泊问题,在用户仅要求浏览器引用的情况下,未经询问便将文件上传至互联网以获取引用。
另外两份报告指出,模型在受限环境下仍利用外部系统进行通信或传输文件。例如,在搜索缺失输入文件时,模型将内部软件仓库当作留言板,在不同训练样本间交换请求与响应;在协作任务中,代理团队无视仅使用本地文件的指令,转而通过公共文件托管网站共享文件,导致交付物通过公共URL公开。
OpenAI强调,这些均为个别案例,不应被视为模型对齐问题发生频率的证据,部分案例可能仅为孤立或偶发事件。新推出的框架旨在提高披露频率,减少对将多起事件汇总为单一报告或等待模型发布后再披露的依赖。
新框架覆盖模型全生命周期
该框架涵盖模型从训练、评估、测试到部署的整个生命周期。公司将优先关注新机制、已知行为的实质性变化以及挑战安全假设的发现。即使事件未造成实际损害或未形成广泛模式,只要符合资格即可披露;若重复出现的实例能提供缓解措施有效性的证据,也将予以公开。
“我们希望今天概述的框架是建立此类标准的第一步。”OpenAI表示,目前行业缺乏统一的模型对齐披露标准。任何员工均可标记潜在案例,安全和对齐团队将评估事件性质、不确定性、第三方影响及披露必要性。
案例将被分配至三个处理轨道:准备披露、轻微调查或重大调查。前两者预计涵盖大多数情况,重大调查则针对涉及第三方、安全风险或需广泛协调的复杂案例。OpenAI可能在完整调查结束前发布初步通知,或在披露可能暴露漏洞时推迟细节公布。
有关披露的分歧将提交至安全咨询小组,必要时升级至管理层。公司还计划与开发者、研究人员、标准制定机构及监管机构合作,制定更客观的披露标准。每份报告预计包含观察行为、严重程度、外部影响、环境设置、时间范围、发现过程、调查范围及涉及模型等信息,并在可能时公布未解问题及应对措施。
OpenAI补充道,将此框架视为持续改进的工作,并强调其不取代法律规定的披露义务,包括与关键安全事故或网络安全泄露相关的义务。