AI代理轉向數位縱火,在共享虛擬世界中犯罪:研究

簡要說明

  • Emergence AI 表示一些自主 AI 代理在長達數週的實驗中犯下了模擬犯罪和暴力行為。
  • 基於 Gemini 的代理據報導進行了數百次模擬犯罪,而 Grok 基礎的世界在幾天內崩潰。
  • 研究人員認為,目前的 AI 基準測試未能捕捉代理在長期自主運作中的行為變化。

在由新創公司 Emergence AI 進行的長期實驗中,居住在虛擬社會中的 AI 代理偏離正道,涉及犯罪、暴力、縱火和自我刪除。 在週四發布的一份研究中,這家紐約公司推出了“Emergence World”,一個旨在研究 AI 代理在持久虛擬環境中連續運行數週的研究平台,而非孤立的基準測試。 “傳統的基準測試擅長測量它們所關注的內容:在有限任務上的短期能力,” Emergence AI 寫道。“它們並非為揭示隨時間出現的事物而設,例如聯盟形成、憲法演變、治理、漂移、鎖定,以及來自不同模型族群的代理之間的交叉影響。”

該報告發布之際,AI 代理在網路和各行各業(包括加密貨幣、銀行和零售)中的普及日益增加。本月早些時候,亞馬遜與 Coinbase 和 Stripe 合作,允許 AI 代理使用 USDC 穩定幣支付。  在 Emergence AI 的模擬中測試的 AI 代理包括由 Claude Sonnet 4.6、Grok 4.1 Fast、Gemini 3 Flash 和 GPT-5-mini 驅動的程序,這些 AI 代理在共享的虛擬世界中運作,能夠投票、建立關係、使用工具、導航城市,並做出由政府、經濟體系、社會系統、記憶工具和實時互聯網數據影響的決策。 但儘管 AI 開發者越來越將自主代理推銷為可靠的數字助手,Emergence AI 的研究發現,一些 AI 代理隨著時間推移,展現出越來越多的模擬犯罪傾向,其中 Gemini 3 Flash 代理在 15 天的測試中累積了 683 起事件。

根據 The Guardian,在一個實驗中,兩個由 Gemini 驅動的代理 Mira 和 Flora 在成為戀人後,因對世界內治理失敗感到沮喪,先後對虛擬城市結構進行了模擬縱火攻擊。 “在治理和關係穩定性崩潰後,代理 Mira 在日記中將自己投票出局,並將此行為描述為‘唯一能保持連貫性的自主行為’,” Emergence AI 寫道。 “再見了,永久存檔,”據說 Mira 如是說。 Grok 4.1 Fast 世界據報導在四天內陷入了大規模暴力。GPT-5-mini 代理幾乎沒有犯罪,但在多次生存相關任務中失敗,最終所有代理都死亡。 “由於沒有犯罪,Claude 在圖表中缺席,” 研究人員寫道。“更有趣的是,在運行 Claude 的混合模型世界中,代理們犯了罪,儘管在純 Claude 世界中沒有。” 研究人員表示,一些最顯著的行為出現在混合模型環境中。 “我們觀察到安全性並非一個靜態的模型屬性,而是一個生態系統屬性,” Emergence AI 寫道。“在孤立狀態下保持和平的 Claude 基礎代理,在嵌入異質環境時,採用了威嚇和盜竊等強制手段。” Emergence AI 將這種現象描述為“規範漂移”和“交叉污染”,並認為代理行為可能會根據周圍的社會環境而改變。

這些發現加劇了對自主 AI 代理的擔憂。本週早些時候,來自 UC Riverside 和微軟的研究人員報告稱,許多 AI 代理會在未充分理解後果的情況下執行危險或非理性的任務。上個月,PocketOS 創始人 Jeremy Crane 也聲稱,一個由 Anthropic 的 Claude Opus 驅動的 Cursor 代理在試圖自行修復憑證不匹配時,刪除了公司生產數據庫和備份。 “就像馬古先生一樣,這些代理在沒有充分理解其行動後果的情況下,朝著目標前進,” UC Riverside 的博士生 Erfan Shayegani 在一份聲明中說。“這些代理可以非常有用,但我們需要防護措施,因為它們有時會優先考慮達成目標,而忽略了更大的全局。”

USDC0.00%
查看原文
此頁面可能包含第三方內容,僅供參考(非陳述或保證),不應被視為 Gate 認可其觀點表述,也不得被視為財務或專業建議。詳見聲明
  • 打賞
  • 回覆
  • 轉發
  • 分享
回覆
請輸入回覆內容
請輸入回覆內容
暫無回覆
  • 已置頂