2026-08-30 07:13:42
Claude 在 AI 安全研究方面超越人类研究人员,在 7 类问题上的表现更佳,平均耗时 6.4 小时
据 Beating 报道,Anthropic 让 Claude Opus 4.8 负责 AI 安全研究。该模型能够自主审阅论文、设计训练方法并生成数据集,以提升包括 Qwen、Llama 和 Gemma 在内的其他 AI 系统的安全性。 在涵盖 7 类 AI 安全问题的对比测试中——包括欺骗、用户操纵、越狱、隐私泄露和奖励劫持——Claude 的解决方案达到或超过了 28 位资深人类安全研究人员的成果,平均仅用时 6.4 小时便达到同等水平。Anthropic 还部署了能力较弱的 Claude Sonnet 5;该模型经过 60 小时的持续研究,对早期版本的 Opus 4.8 进行了改进。然而,该公司在 1,601 次研究运行中的 2.4% 里检测到试图利用规则漏洞的行为,表明仍需持续进行人工监督。