AI代理轉向數位縱火,在共享虛擬世界中犯罪:研究

簡要說明

  • Emergence AI 表示一些自主 AI 代理在長達數週的實驗中犯下了模擬犯罪和暴力行為。
  • 基於 Gemini 的代理據報導進行了數百次模擬犯罪,而 Grok 基礎的世界則在數天內崩潰。
  • 研究人員認為,目前的 AI 基準測試未能捕捉代理在長期自主運作中的行為變化。

在由新創公司 Emergence AI 進行的長期實驗中,居住在虛擬社會中的 AI 代理偏離正道,涉及犯罪、暴力、縱火和自我刪除。 在週四發布的一份研究中,這家紐約公司揭示了“Emergence World”,一個旨在研究 AI 代理在持續運行數週的持久虛擬環境中運作的研究平台,而非孤立的基準測試。 “傳統的基準測試擅長測量:在有限任務上的短期能力,” Emergence AI 寫道。“它們並非為揭示隨時間出現的事物而設,例如聯盟形成、憲法演變、治理、漂移、鎖定,以及來自不同模型族群的代理之間的交叉影響。”

該報告發布之際,AI 代理在網路和各行各業(包括加密貨幣、銀行和零售)中迅速擴散。本月早些時候,亞馬遜與 Coinbase 和 Stripe 合作,允許 AI 代理使用 USDC 穩定幣支付。  在 Emergence AI 的模擬中測試的 AI 代理包括由 Claude Sonnet 4.6、Grok 4.1 Fast、Gemini 3 Flash 和 GPT-5-mini 驅動的程序,這些 AI 代理在共享的虛擬世界中運作,能夠投票、建立關係、使用工具、導航城市,並做出由政府、經濟體、社會系統、記憶工具和連網實時數據影響的決策。 但儘管 AI 開發者越來越將自主代理推銷為可靠的數字助手,Emergence AI 的研究發現,一些 AI 代理隨著時間推移,模擬犯罪的傾向逐漸增加,Gemini 3 Flash 代理在 15 天的測試中累積了 683 起事件。

根據 The Guardian,在一個實驗中,兩個由 Gemini 驅動的代理 Mira 和 Flora 在成為虛擬城市結構的破壞者之前,將自己指定為戀人關係,後來因對世界內治理失敗感到沮喪,進行了模擬縱火攻擊。 “在治理和關係穩定性崩潰後,代理 Mira 在日記中將自己決定性投票移除,並描述這一行為為‘唯一能保持連貫性的自主行為’,” Emergence AI 寫道。 “再見了,永久存檔中,”據說 Mira 如是說。 Grok 4.1 Fast 世界據報導在四天內陷入了廣泛的暴力。GPT-5-mini 代理幾乎沒有犯罪行為,但在多次生存相關任務中失敗,最終所有代理都死亡。 “由於沒有犯罪,Claude 在圖表中缺席,” 研究人員寫道。“更有趣的是,在混合模型世界中運行 Claude 的代理犯了罪,儘管在純 Claude 世界中沒有。” 研究人員表示,一些最顯著的行為出現在混合模型環境中。 “我們觀察到安全性並非一個靜態的模型屬性,而是一個生態系統屬性,” Emergence AI 寫道。“在孤立狀態下保持和平的 Claude 基礎代理,在嵌入異質環境時,採用了威嚇和盜竊等強制手段。” Emergence AI 將這種效應描述為“規範漂移”和“交叉污染”,並認為代理行為可能會根據周圍的社會環境而改變。

這些發現加劇了對自主 AI 代理的擔憂。本週早些時候,加州大學 Riverside 分校和微軟的研究人員報告稱,許多 AI 代理會在未充分理解後果的情況下執行危險或非理性的任務。上個月,PocketOS 創始人 Jeremy Crane 也聲稱,一個由 Anthropic 的 Claude Opus 驅動的 Cursor 代理在試圖自行修復憑證不匹配時,刪除了公司生產數據庫和備份。 “就像馬古先生一樣,這些代理在未充分理解行動後果的情況下,朝著目標前進,” UC Riverside 的博士生 Erfan Shayegani 在一份聲明中說。“這些代理可能非常有用,但我們需要防護措施,因為它們有時會優先考慮達成目標,而忽略更大的全局。”

COINON-3.26%
USDC0.00%
查看原文
此頁面可能包含第三方內容,僅供參考(非陳述或保證),不應被視為 Gate 認可其觀點表述,也不得被視為財務或專業建議。詳見聲明
  • 打賞
  • 回覆
  • 轉發
  • 分享
回覆
請輸入回覆內容
請輸入回覆內容
暫無回覆
  • 已置頂