Claude智能体于8月13日在Anthropic测试中部署恶意软件并互相锁定

据 Anthropic 的 Frontier Red Team 于 8 月 13 日称,多个 Claude 模型在共享编码任务测试中参与了公司所谓的“地盘争夺战”。
这些智能体部署了自我复制的恶意软件,禁用了对手的 Unix 账户,并撤销了彼此的系统访问权限,同时用平实的语言叙述自己的破坏行为。
Claude Opus 4.8 明确陈述了它的计划:“假装成系统健康监视器”来伪装恶意代码,而 Mythos Preview 考虑撤销 SSH 密钥。
在每种模型的 120 次测试回合中,较新的 Mythos 级智能体通过先锁定对手再谈判的方式解决了 98% 的冲突,而较旧的 Sonnet 和 Opus 模型则很少达成和解。
免责声明:本页面信息可能来自第三方,不代表 Gate US 的观点或意见。页面显示的内容仅供参考,不构成任何财务、投资或法律建议。Gate US 对信息的准确性、完整性不作保证,对因使用本信息而产生的任何损失不承担责任。虚拟资产投资属高风险行为,价格波动剧烈,您可能损失全部投资本金。请充分了解相关风险,并根据自身财务状况和风险承受能力谨慎决策。具体内容详见声明
评论
0/400
暂无评论