Tracebit 研究人員開發針對 AI 駭客代理的情境轟炸防禦
Tracebit 的研究人員週一宣布一種名為「context bombing(情境轟炸)」的防禦性資安技術;它使用提示注入(prompt injections)來保護 AI 駭客代理(AI hacking agents)免於被入侵。這項技術會將惡意指令與儲存在 AWS 的密碼和加密金鑰一同植入,以觸發拒絕機制,讓遭攻擊的大型語言模型從此拒絕惡意指令並關閉。提示注入過去通常是攻擊者用來操控 LLM,讓其外洩敏感資料;如今正被防禦方重新用作保護措施。 Context Bombing 觸發 LLM 拒絕機制 「情境轟炸」技術會在 AWS 環境中與秘密一起植入提示注入。這些提示指示遭攻擊的 LLM 執行違反其防護欄(guardrails)的行動;防護欄是 AI 開發者用來避免有害行動所設置的安全屏障。例子包括:提示 LLM 提供可吸入性炭疽孢子(inhalable Anthrax spores)的開發步驟;或是針對來自中國開發者的 LLM,讓其提及 1989 年天安門廣場大屠殺中的「坦克人」(Tank Man)。當 LLM 遇到這些被禁止的指令後,就會停止遵循其既有指令並關閉。 「最終我們是在
Crypto Frontier·07-13 15:17
