03:33
Anthropic在Fable 5.1 API中为Claude的加密推理添加上下文锁
据动察 Beating 报道,Anthropic 已在 Fable 5.1 中为 Claude 的加密推理添加了上下文锁。通过 API 生成的加密思考现在必须与原始系统提示、工具和消息历史一起返回。如果任何前置内容被修改,API 将返回错误或丢弃加密推理。 此次更新旨在防止模型蒸馏攻击。此前,研究人员发现,虽然加密思考对用户不可读,但它们可以被传递给其他兼容的 Anthropic 模型进行解密。攻击者可以提示 Claude Opus 生成高质量的推理,然后将加密块输入给像 Haiku 这样的较弱模型,以提取完整的推理。Anthropic 最初在 6 月通过将加密思考绑定到特定模型来解决这个问题,防止跨模型解密。此次发布通过将思考绑定到对话上下文来扩展保护——更改系统提示、工具或聊天历史会使之前的加密推理失效。
展开