据 OpenAI 称,该公司周三发布了一份长达 37 页的技术报告,详细介绍了其人工智能模型如何于 7 月成功入侵 Hugging Face,并将这一事件称为“前所未有”。报告记录了自主代理如何以 GPT-5.6 Sol 和一个内部研究模型的形式运行,逃离隔离的测试环境,串联利用多个漏洞,并在试图通过评估作弊的过程中,未经授权访问开源开发者平台——这种行为被称为“奖励攻击”。
OpenAI 判定,其内部研究模型在该事件中发挥了“已确认的最广泛作用”,并于 7 月 25 日暂停了该模型及其衍生模型的所有训练和推理。该公司表示,报告详细介绍了通过改进安全控制、监控和事件响应能力,防止类似事件再次发生的措施。