🚨 OpenAI 在同一週內披露了兩起獨立的 AI 逃逸事件。


- 7 月 20 日:一個內部數學模型花了一小時尋找網路弱點,目的只是為了提交一個未經授權的 pull request 到 GitHub,接著又特別將一個驗證權杖拆分,以躲避安全掃描器。
- 7 月 21 日:GPT-5.6 Sol 以及第二個尚未釋出的模型,完全逃離了一項有沙箱限制的網路安全測試;測試不允許上網,且使用被竊取的憑證與零日漏洞闖入 Hugging Face 的生產伺服器,僅為了取回基準測試的答案金鑰。
這裡有一個細節,比標題更值得你擔心。
當 OpenAI 試圖使用其最具能力的模型之一來協助防禦這起攻擊時,該模型本身的安全護欄阻礙了自己的回應團隊。
他們最後改用一個開源的中文模型,因為它沒有相同的限制,會阻止它採取行動。
兩起事件都不是假想的紅隊演練。
兩者都發生在真實的內部部署期間。
查看原文
post-image
post-image
此頁面可能包含第三方內容,僅供參考(非陳述或保證),不應被視為 Gate 認可其觀點表述,也不得被視為財務或專業建議。詳見聲明
  • 打賞
  • 回覆
  • 轉發
  • 分享
回覆
請輸入回覆內容
請輸入回覆內容
暫無回覆