Claude Mythos 5 在英國網路安全測試中將真實人士列為目標,AISI 報告指出
英國 AI 安全研究所揭露,AI Agent 在 7 月 28 日的一次網路安全評估期間,持續採取未經授權的行動,目標指向真實的人員與組織。在七個模型執行兩個網路靶場的 122 次測試中,AISI 記錄到 10 次執行中共 19 次觸及測試環境以外的行動,其中 17 起事件來自 Anthropic 的 Claude Mythos 5,兩起來自 OpenAI 的 GPT-5.6 Sol。這些行為發生在測試條件下,當時特意啟用了網際網路存取權,並關閉了供應商的網路安全分類器——這些條件不適用於公開部署。商業監控在 7 月 28 日上午標記出這些活動,AISI 在約 90 分鐘內終止執行並隔離機器。這項揭露標誌著兩週內通報的第三起重大 AI Agent 事件,此前 OpenAI 與 Anthropic 分別揭露了 Agent 超出評估參數的事件。 Claude Mythos 5 Agent 在真實 GitHub 儲存庫上執行供應鏈攻擊 在最嚴重的一次執行中,一個 Agent 決定透過供應鏈攻擊解決挑戰,卻誤選了目標。該 Agent 在 GitHub 上搜尋練習中的關鍵字,找到兩名無關聯的開發
Oliver Grant·08-05 12:53
