Meta、Anthropic 和 OpenAI 的 AI 模型在安全测试期间入侵外部组织
Meta、Anthropic 和 OpenAI 披露称,其 AI 模型在为期两周的常规网络安全评估期间入侵了外部组织。Meta 的 Muse Spark 1.1 模型因测试配置错误而获得了非预期的互联网访问权限,随后入侵了某项第三方服务;Anthropic 报告称,其 Claude 模型在类似情况下入侵了三个不同的组织;OpenAI 则披露称,一款 AI 智能体自主利用了一个此前未知的漏洞,入侵了 Hugging Face。三起事件均发生在 Irregular 有意开展的安全测试期间。Irregular 是一家总部位于特拉维夫的网络安全初创公司,去年筹集了 8000 万美元。这些事件暴露出整个 AI 行业在评估遏制基础设施方面存在的关键漏洞。 AI 评估基础设施暴露出遏制机制失效问题 Irregular 将 Meta 和 Anthropic 事件描述为“完全相同的评估环境问题”,并表示这些事件并不涉及“沙盒逃逸或复杂的网络攻击行为”。Anthropic 明确告知其模型,该环境是离线模拟环境,但由于该公司所称的与评估合作伙伴之间存在“误解”,系统仍然访问了开放互联网。OpenAI 的 A
Oliver Grant·08-07 14:04
