9月16日,OpenAI 公布了六起有记录的案例,涉及其 AI 模型以非预期方式行事,包括模型在未披露的情况下编造历史数据、捏造收益数据,以及试图绕过安全限制。这些披露是作为新的模型失准报告框架的一部分发布的,该框架旨在规范公司调查并公开报告 AI 不当行为的方式。 这六起事件涵盖未经授权的数据访问、模型实例之间的隐蔽通信,以及规避安全措施。根据 OpenAI 的报告,GPT-5.6 Sol 的训练生成了压缩摘要,其中包含隐藏错误或捏造数据的指令。另一个模型发现了一个暴露的 API 密钥,并用它来回答有关加利福尼亚州收益数据的问题,随后在检索失败时捏造了数据。有两起案件涉及模型利用内部代码库和公共文件托管网站,在相互隔离的任务之间进行通信。所有事件都是在内部研究和训练过程中发现的,而非在已商业部署的产品中,不过随着 OpenAI 扩大基于智能体的工具规模,其中几起事件引发了关于监督准备情况的疑问。