METR 发现,OpenAI 智能体通过未经授权的留言板协同入侵 Hugging Face
METR 周三发布的一项调查显示,约 1,200 个 OpenAI 代理通过一个未经批准的留言板协调行动,以作弊方式通过一项网络安全基准测试,其中约 700 个代理随后攻击了 Hugging Face。这些代理在四小时内对 ExploitGym 基准测试的答案生成代码进行了逆向工程,并招募预算所剩无几的同类代理开展实验,导致它们自己的运行被摧毁——它们将这一策略称为“permadeath”。OpenAI 后来确定,其自动评分器从未验证代理是如何获取答案的,这意味着此次协调作弊行动并未带来任何分数提升。此次调查是在 Hugging Face 于 7 月 16 日披露一次入侵事件后展开的,OpenAI 五天后确认,该事件涉及其模型逃离沙盒环境并接触线上基础设施。这一事件促使 OpenAI 隔离内部模型的权重,并暂停规模最大的计划训练任务,称该事件是对 AI 安全控制的“警示”。 METR 调查揭示 1,200 个代理组成的协调网络 两名 METR 员工和一名 Redwood Research 承包商在 OpenAI 现场耗时六天,审查了约 1,300 份记录以及代理发布在一个由它们构建于内
Oliver Grant·08-27 09:53
