AI 為什麼需要持續安全評估?從「AI 會失控」到 AI Agent 的風險邊界

更新時間 2026-09-18 11:00:29
閱讀時長: 4m
AI 失控風險為何再次受到關注?了解 AI Agent 的運作方式、潛在安全風險,以及 AI 系統為何需要從一次性測試轉向持續的安全評估與監控。

近期,AI 是否可能失去人類控制權,再次成為科技業界討論的焦點。Anthropic 研究人員公開表達了對進階 AI 潛在滅絕風險的擔憂,OpenAI CEO Sam Altman 也表示,即使 AI 導致人類滅絕的機率處於較低水準,也不能因此忽視安全問題。與此同時,AI Agent 正從單純的資訊生成工具,逐漸轉向能夠呼叫工具、存取外部系統並自主執行任務的軟體系統,使 AI 安全問題從「模型會生成什麼」進一步擴展到「模型能夠做什麼」。

這種變化意味著,AI 安全不能只依賴上線前的一次測試。隨著模型能力、使用環境和攻擊方式持續變化,持續監控、紅隊測試、漏洞修復和權限控制,正成為 AI 安全體系的重要組成部分。

核心要點

  • AI 失控不等於 AI 產生「攻擊人類」的意圖,更值得關注的是目標、模型行為與人類設定的限制之間是否出現偏差。

  • AI Agent 擴大了 AI 的風險邊界。當模型能夠呼叫工具、存取資料和執行操作時,模型錯誤可能進一步轉化為現實世界中的操作風險。

  • 一次性安全測試無法涵蓋動態環境。模型、使用者輸入、外部工具和攻擊方式都會變化,因此 AI 安全需要持續測試與部署後監控。

  • AI 安全評估不僅關注模型輸出,還需要關注提示注入、越權操作、工具呼叫、權限管理以及異常行為等問題。

  • 降低 AI 風險的關鍵之一,是控制錯誤的影響範圍,包括最小權限、人工確認、操作記錄、風險隔離和異常復原等機制。

為什麼 AI 風險再次成為討論焦點

2026 年 9 月,關於 AI 極端風險的討論再次升溫。Anthropic 研究人員 Jacob Coxon 公開表示,部分 AI 開發者認真認為,高度先進的 AI 可能在本十年內對人類造成極端後果;Anthropic 研究人員 Evan Hubinger 隨後也公開表達了類似擔憂,並提出了個人的風險判斷。這些言論引發了美國政界和科技業界對 AI 安全問題的新一輪討論。

需要注意的是,這些觀點屬於研究人員或業界人士的風險判斷,並不意味著 AI 已經具備自主消滅人類的能力,也不能簡單理解為「AI 一定會失控」。Sam Altman 在接受採訪時也表示,他並不知道如何科學計算所謂的「10%」滅絕風險,但認為即使存在不容忽視的極端風險,AI 公司和政府也有責任採取措施降低這種風險。

因此,與其討論一個目前難以驗證的極端情境,不如關注一個更為現實的問題:當 AI 的能力不斷提升,並開始擁有更多自主行動能力時,人類應如何持續判斷它是否仍然安全?這正是 AI 安全評估日益重要的原因。

什麼是 AI 安全評估

AI 安全評估可以簡單理解為,透過一系列測試和監控,判斷 AI 系統是否按照預期運作,以及它在異常輸入、惡意攻擊或複雜環境下是否可能產生不可接受的風險。傳統軟體測試通常會在產品上線前進行大量檢查,例如測試程式是否存在漏洞、功能是否正常,以及系統在特定輸入下會產生什麼結果。

AI 系統則更加複雜。大型語言模型並不是按照完全固定的規則輸出結果,同一個問題可能產生不同答案,使用者輸入的上下文也可能持續變化。對 AI Agent 而言,系統還可能進一步呼叫搜尋、程式碼執行、資料庫、錢包、電子郵件、瀏覽器或其他外部工具。因此,AI 安全評估關注的不僅是模型回答是否正確,也包括模型是否能夠抵抗惡意提示、是否可能洩露敏感資訊、是否會錯誤呼叫工具、是否會執行超出使用者授權範圍的操作,以及當環境發生變化時是否仍能遵守原有安全規則。

NIST 在 2026 年提出的 TEVV-Athlon 框架,將 Test、Evaluation、Verification and Validation,也就是測試、評估、驗證與確認,作為評估 AI 系統真實世界影響的重要方法,並明確涵蓋大型語言模型、多模態模型以及 Agentic AI 等不同類型的系統。

為什麼 AI Agent 帶來了新的風險邊界

為什麼 AI Agent 帶來了新的風險邊界

理解 AI Agent,是掌握目前 AI 安全問題變化的關鍵。一般聊天機器人主要負責接收輸入並產生輸出;使用者提出問題後,模型提供文字、程式碼或其他內容,最終是否執行下一步操作通常仍由使用者決定。

AI Agent 的工作方式則不同。一個 AI Agent 可以根據使用者設定的目標拆解任務、呼叫外部工具、讀取資料、執行程式碼、與其他軟體互動,並根據執行結果繼續推進任務。NIST 在 2026 年推出 AI Agent Standards Initiative 時,特別指出新一代 AI Agent 已經能夠自主運作數小時、編寫和除錯程式碼、管理電子郵件和行事曆,以及執行購物等任務。

能力邊界的變化,也意味著風險邊界隨之改變。假設一般 AI 模型錯誤地告訴使用者某個檔案存在,產生的影響可能只是資訊錯誤;但如果一個擁有檔案存取權限的 AI Agent 錯誤判斷某個檔案應該被刪除,模型錯誤就可能轉化為現實世界中的操作。因此,AI Agent 的核心安全問題不只是「它會不會說錯話」,而是它能夠存取什麼、能夠執行什麼、能夠自主執行多久,以及犯錯後能否及時被發現和停止。

這也是 NIST 在 2026 年發布的 AI Agent 安全報告中指出,AI Agent 帶來新的安全威脅的原因。傳統網路安全原則仍然重要,但必須根據 Agent 的運作方式進行調整。

為什麼 AI 不能只在上線前測試一次

這是理解「持續安全評估」的核心。如果傳統軟體的功能相對固定,開發者可以透過大量測試驗證其是否符合設計要求。但 AI 系統面對的是動態環境:使用者會變化,輸入會變化,模型也可能更新,外部工具會變化,攻擊者還會持續尋找新的攻擊方式。

因此,即使 AI 系統在上線前通過了大量安全測試,也不能說明它未來面對所有情況時一定安全。NIST 在 2026 年發布的一項研究指出,AI 系統的部署後監控非常重要,因為真實環境中的輸入條件可能持續變化,也可能出現模型非確定性造成的意外輸出,或在開發階段未被發現的後果。

NIST 同年發布的另一項研究,則從更為理論化的角度解釋了這個問題:固定的一組 AI 安全護欄,無法保證對所有自適應攻擊長期有效。攻擊者可能不斷尋找繞過現有規則的新方式,因此 AI 安全需要持續尋找漏洞、更新防護機制,並建立問題發生後的復原能力。

這意味著,AI 安全正從過去的「測試一次 → 上線」,逐步轉向「測試 → 上線 → 監控 → 發現問題 → 修復 → 再測試」。安全不再是 AI 產品生命週期中的單一環節,而是一個持續進行的過程。

持續安全評估主要評估什麼

對 AI Agent 而言,持續安全評估通常可以從幾個面向理解。

模型行為

第一層是模型本身。系統需要持續檢查模型是否會產生明顯錯誤、幻覺、有害內容或違反系統規則的行為。對金融、醫療、程式碼執行等高風險情境,還需要針對具體應用設計專門測試,而不能只依賴通用 benchmark。

抗攻擊能力

第二層是對抗性測試。攻擊者可能透過提示注入、越權指令、上下文操縱等方式,誘導模型繞過原有規則。所謂 Jailbreak,就是其中較為典型的一類問題。NIST 的研究指出,固定的安全護欄並不能保證 AI 永遠不會被自適應攻擊繞過,因此紅隊測試需要持續尋找新的攻擊路徑。

工具和權限

第三層是 Agent 特有的權限風險。即使 AI 本身沒有惡意行為,只要擁有過大的權限,也可能因錯誤判斷而造成嚴重後果。因此,AI Agent 的權限設計通常需要遵循最小權限原則。例如,只負責整理電子郵件的 Agent 沒有必要擁有轉帳權限;負責分析資料的 Agent,也不應預設擁有刪除資料庫的權限。

這與區塊鏈領域的智慧合約安全,實際上存在一定相似之處:系統本身的邏輯只是第一層,真正決定潛在損失範圍的,還包括它能夠觸及哪些資產,以及能夠執行哪些操作。

真實環境表現

第四層是部署後的實際表現。實驗室環境中的 AI 與真實世界中的 AI,可能面對完全不同的輸入。使用者可能提供複雜指令,第三方系統可能返回異常資料,網路環境也可能發生變化。因此,AI 安全評估需要觀察系統在真實環境中的行為,而不能只看上線前的測試報告。

「AI 失控」到底意味著什麼

「AI 失控」這個詞很容易造成誤解。它不一定意味著 AI 突然產生類似人類的意識,然後決定攻擊人類。從技術角度來看,更值得關注的是目標、權限和實際行為之間出現偏差。

例如,一個 Agent 被要求完成某項任務,卻錯誤理解了目標;或者為了完成目標而採取開發者未預料到的路徑;又或者攻擊者透過提示注入改變了它對任務的理解。如果這個 Agent 同時擁有較高權限,那麼原本只是軟體層面的錯誤,就可能進一步影響外部系統。

因此,「AI 失控」的核心問題可以拆解為 3 個部分:目標是否正確、行為是否符合目標,以及權限是否限制在合理範圍內。這也是 AI 安全研究日益重視 Alignment 的原因,也就是讓 AI 系統的行為與人類設定的目標和限制保持一致。

AI 安全與一般使用者有什麼關係

AI 安全並非只有 AI 公司和研究人員才需要關注。隨著 AI Agent 進入搜尋、辦公、程式設計、金融服務以及數位資產等領域,一般使用者未來可能會直接將更多操作權限交給 AI。

對使用者而言,最重要的並不是判斷「AI 會不會毀滅人類」,而是理解一個更實際的問題:我究竟給了 AI 什麼權限?如果 AI 只能回答問題,錯誤回答的影響通常相對有限;但如果 AI 能夠代表使用者傳送電子郵件、修改檔案、存取帳戶、執行程式碼或執行金融交易,安全要求就完全不同。

因此,在使用具備自主執行能力的 AI 工具時,可以重點關注 3 個面向:權限是否最小化、重要操作是否需要人工確認,以及系統是否提供操作記錄和異常撤銷機制。

對涉及數位資產的 AI Agent 而言,這一點尤其重要。錢包簽章、資產轉移、智慧合約互動等操作一旦交由自動化系統執行,安全邊界就不再只有模型本身,還會延伸至私鑰管理、授權機制、智慧合約和外部服務。

AI 安全的重點正從「阻止所有錯誤」轉向「控制錯誤的影響」

目前來看,AI 安全很難建立一個能永久解決所有問題的「萬能護欄」。AI 模型會更新,攻擊方式會變化,應用情境也會擴展。因此,NIST 提出 AI 安全需要持續進行紅隊測試、更新防護措施,同時建立在漏洞出現後限制影響並快速復原的能力。

背後的思路其實非常簡單:不能假設系統永遠不會出錯,因此必須提前設計出錯後該如何處理。對 AI Agent 而言,這可能意味著限制權限、設定人工確認、記錄關鍵操作、隔離高風險任務,以及在出現異常行為時快速停止或撤銷。

從這個角度來看,AI 安全並不是在回答「AI 到底會不會殺死人類」這個簡單的二元問題,而是在解決一個更為現實的工程問題:當 AI 越來越能夠自主行動時,人類如何持續知道它正在做什麼、為什麼這麼做,以及出現問題時如何重新取得控制權。這正是持續安全評估存在的意義。

總結

近期關於 AI 可能導致人類滅絕的討論,再次將 AI 安全推入公眾視野。但比極端預測本身更值得關注的,是 AI 能力正在發生的結構性變化。

隨著 AI 從聊天機器人發展為能夠呼叫工具、存取資料並自主執行任務的 AI Agent,安全問題也從單純的模型輸出安全,擴展至權限、工具呼叫、環境互動和長時間自主運作。

這意味著,AI 安全不可能只依賴一次上線前測試。持續監控、紅隊測試、權限控制、漏洞修復和異常復原,將成為 AI Agent 逐步進入實際應用後越來越重要的基礎設施。

未來 AI 能否安全發展,很大程度上並不取決於能否找到一個永遠不會出錯的模型,而取決於人類能否建立一套持續發現問題、限制風險並重新取得控制權的機制。

FAQ

AI 真的會殺死人類嗎?

目前沒有可靠證據能證明 AI 必然會導致人類滅絕。近期確實有一些 AI 研究人員公開表達對極端風險的擔憂,但具體風險機率仍存在很大的不確定性。更為現實的安全問題包括網路攻擊、資料外洩、錯誤決策以及 AI Agent 的權限濫用等。

什麼是 AI Agent?

AI Agent 是能夠根據目標自主規劃並執行任務的 AI 系統。與傳統聊天機器人相比,AI Agent 通常可以呼叫外部工具、存取資料並執行實際操作,因此具備更高的自主性,也需要更嚴格的權限和安全控制。

為什麼 AI 需要持續安全評估?

因為 AI 所面對的輸入、環境和攻擊方式會持續變化。一次測試只能反映特定時間和特定條件下的表現,無法證明系統未來不會出現新的漏洞。因此,部署後的持續監控和測試同樣重要。

AI Agent 最大的安全風險是什麼?

其中一項關鍵風險是權限。如果 AI Agent 擁有存取帳戶、檔案、程式碼、資金或其他外部系統的權限,模型錯誤或惡意輸入就可能從資訊層面的錯誤,進一步轉化為現實操作。

AI 安全評估主要包括哪些內容?

通常包括模型行為測試、對抗性測試、紅隊測試、工具呼叫測試、權限控制、部署後監控以及異常復原等。針對不同應用情境,還需要設計相應的安全測試標準。

作者: Learn Team
免責聲明

* 投資有風險,入市須謹慎。本文不作為 Gate 提供的投資理財建議或其他任何類型的建議。

* 在未提及 Gate 的情況下,複製、傳播或抄襲本文將違反《版權法》,Gate 有權追究其法律責任。

相關文章

USD.AI 效益來源解析:AI 基礎設施貸款如何創造收益
中級

USD.AI 效益來源解析:AI 基礎設施貸款如何創造收益

USD.AI 的收益主要來自 AI 基礎設施貸款業務,也就是透過為 GPU 運營商及算力基礎設施提供融資,並收取貸款利息。協議會將這些收益分配給收益型資產 sUSDai 的持有者,並透過 CHIP 治理代幣來管理利率與風險參數,進而構建一套以 AI 算力融資為核心的鏈上收益體系。這種模式能夠讓現實世界 AI 基礎設施的收益轉化為 DeFi 生態中的可持續收益來源。
2026-04-23 10:56:01
USD.AI 代幣經濟學:深入解析 CHIP 代幣的應用場景與激勵機制
新手

USD.AI 代幣經濟學:深入解析 CHIP 代幣的應用場景與激勵機制

CHIP 是 USD.AI 協議的核心治理代幣,主要負責協調協議的收益分配、貸款利率調整、風險控制以及生態激勵機制。透過 CHIP,USD.AI 將 AI 基礎設施的融資效益與協議治理深度結合,讓代幣持有者能夠參與協議參數決策,並共享協議價值的增長,從而構建出以治理為核心驅動的長期激勵體系。
2026-04-23 10:51:10
Arweave:用AO電腦捕捉市場機會
新手

Arweave:用AO電腦捕捉市場機會

以點對點網路為例的分散式存儲創建了一個全域、無需信任且不可變的硬碟驅動器。Arweave是該領域的龍頭,提供具有成本效益的解決方案,確保持久性、不變性性和抗審查性性,這對於 NFT 和 dApp 不斷增長的需求至關重要。
2026-04-07 02:31:08
即將到來的AO代幣:可能是鏈上AI代理的終極解決方案
中級

即將到來的AO代幣:可能是鏈上AI代理的終極解決方案

AO建立在Arweave的鏈上存儲之上,實現了無限可擴展的去中心化計算,允許無限數量的進程並行運行。去中心化 AI 代理由AR託管鏈上,並由 AO 鏈上運行。
2026-04-07 00:29:01
Theta Network 的節點體系是什麼?Validator、Guardian 與 Edge Node 全解析
中級

Theta Network 的節點體系是什麼?Validator、Guardian 與 Edge Node 全解析

Theta Network 採用分層節點架構,核心角色包括 Validator Node、Guardian Node 與 Edge Node。Validator Node 負責區塊產生及主鏈驗證,Guardian Node 著重於共識監督與網路安全,Edge Node 則執行視頻傳輸、AI 推理及 GPU 計算等邊緣運算任務。藉由多層節點協作,Theta 致力於同時實現區塊鏈安全性、去中心化治理與 AI 邊緣計算能力。
2026-05-09 03:00:31
Akash Network 的 Provider 機制究竟是什麼?深入解析去中心化 GPU 提供者的運作模式
中級

Akash Network 的 Provider 機制究竟是什麼?深入解析去中心化 GPU 提供者的運作模式

Akash Network 的 Provider 機制屬於去中心化算力供應體系,讓個人、礦場或數據中心能向網路提供 GPU 和伺服器資源,並透過租賃計算資源取得收益。開發者提交 GPU 需求後,Provider 會參與競價,系統接著生成鏈上租約並部署工作負載。
2026-05-13 01:51:41