AI 为什么需要持续安全评估?从“AI 会失控”到 AI Agent 的风险边界

更新时间 2026-09-18 11:00:03
阅读时长: 4m
AI 失控风险为何再次受到关注?了解 AI Agent 的运行方式、潜在安全风险,以及为什么 AI 系统需要从一次性测试转向持续安全评估与监控。

近期,AI 是否可能失去人类控制再次成为科技行业讨论的热点。Anthropic 研究人员公开表达了对高级 AI 潜在灭绝风险的担忧,OpenAI CEO Sam Altman 也表示,即使 AI 导致人类灭绝的概率只有较低水平,也不能因此忽视安全问题。与此同时,AI Agent 正从单纯的信息生成工具逐渐转向能够调用工具、访问外部系统并自主执行任务的软件系统,使 AI 安全问题从“模型会生成什么”进一步扩展到“模型能够做什么”。

这种变化意味着,AI 安全不能只依赖上线前的一次测试。随着模型能力、使用环境和攻击方式不断变化,持续监控、红队测试、漏洞修复和权限控制正在成为 AI 安全体系的重要组成部分。

核心要点

  • AI 失控不等于 AI 产生“攻击人类”的意图,更值得关注的是目标、模型行为与人类设定的约束之间是否出现偏差。

  • AI Agent 扩大了 AI 的风险边界。当模型能够调用工具、访问数据和执行操作时,模型错误可能进一步转化为现实世界中的操作风险。

  • 一次性安全测试无法覆盖动态环境。模型、用户输入、外部工具和攻击方式都会变化,因此 AI 安全需要持续测试与部署后监控。

  • AI 安全评估不仅关注模型输出,还需要关注提示注入、越权操作、工具调用、权限管理以及异常行为等问题。

  • 降低 AI 风险的关键之一是控制错误的影响范围,包括最小权限、人工确认、操作记录、风险隔离和异常恢复等机制。

AI 风险为何再次成为讨论焦点

2026 年 9 月,关于 AI 极端风险的讨论再次升温。Anthropic 研究人员 Jacob Coxon 公开表示,部分 AI 开发者认真认为高度先进的 AI 可能在本十年内对人类造成极端后果;Anthropic 研究人员 Evan Hubinger 随后也公开表达了类似担忧,并给出了个人风险判断。这些言论引发了美国政界和科技行业对 AI 安全问题的新一轮讨论。

需要注意的是,这些观点属于研究人员或行业人士的风险判断,并不意味着 AI 已经具备自主消灭人类的能力,也不能简单理解为“AI 一定会失控”。Sam Altman 在接受采访时也表示,他并不知道如何科学地计算所谓的“10%”灭绝风险,但认为即使存在无法忽视的极端风险,AI 公司和政府也有责任采取措施降低这种风险。

因此,与其讨论一个目前难以验证的极端情景,不如关注一个更加现实的问题:当 AI 的能力不断提升,并开始拥有更多自主行动能力时,人类应该如何持续判断它是否仍然安全? 这正是 AI 安全评估越来越重要的原因。

什么是 AI 安全评估

AI 安全评估可以简单理解为,通过一系列测试和监控,判断 AI 系统是否按照预期工作,以及它在异常输入、恶意攻击或复杂环境下是否可能产生不可接受的风险。传统的软件测试通常会在产品上线前进行大量检查,例如测试程序是否存在漏洞、功能是否正常,以及系统在特定输入下会产生什么结果。

AI 系统则更加复杂。大型语言模型并不是按照完全固定的规则输出结果,同一个问题可能产生不同答案,用户输入的上下文也可能不断变化。对于 AI Agent 来说,系统还可能进一步调用搜索、代码执行、数据库、钱包、邮件、浏览器或其他外部工具。因此,AI 安全评估关注的不仅是模型回答是否正确,还包括模型是否能够抵抗恶意提示、是否可能泄露敏感信息、是否会错误调用工具、是否会执行超出用户授权范围的操作,以及当环境发生变化时是否仍然能够遵守原有安全规则。

NIST 在 2026 年提出的 TEVV-Athlon 框架,将 Test、Evaluation、Verification and Validation,即测试、评估、验证与确认,作为评估 AI 系统真实世界影响的重要方法,并明确覆盖大型语言模型、多模态模型以及 Agentic AI 等不同类型的系统。

为什么 AI Agent 带来了新的风险边界

为什么 AI Agent 带来了新的风险边界

理解 AI Agent,是理解当前 AI 安全问题变化的关键。普通聊天机器人主要负责接收输入并生成输出,用户提出问题后,模型给出文字、代码或其他内容,最终是否执行下一步操作通常仍由用户决定。

AI Agent 的工作方式不同。一个 AI Agent 可以根据用户设定的目标拆解任务,调用外部工具,读取数据,执行代码,与其他软件交互,并根据执行结果继续推进任务。NIST 在 2026 年推出 AI Agent Standards Initiative 时,就特别指出,新一代 AI Agent 已经能够自主运行数小时、编写和调试代码、管理邮件和日历,以及执行购物等任务。

能力边界的变化,也意味着风险边界发生变化。假设一个普通 AI 模型错误地告诉用户某个文件存在,那么产生的影响可能只是信息错误;但如果一个拥有文件访问权限的 AI Agent 错误判断某个文件应该被删除,那么模型错误就可能转化成现实世界中的操作。因此,AI Agent 的核心安全问题不只是“它会不会说错话”,而是它能够访问什么、能够执行什么、能够自主执行多久,以及犯错之后能否被及时发现和停止。

这也是为什么 NIST 在 2026 年关于 AI Agent 安全的报告中指出,AI Agent 带来了新的安全威胁,传统网络安全原则仍然重要,但需要根据 Agent 的运行方式进行调整。

AI 为什么不能只在上线前测试一次

这是理解“持续安全评估”的核心。如果一个传统软件的功能相对固定,那么开发者可以通过大量测试验证它是否符合设计要求。但 AI 系统面对的是动态环境:用户会变化,输入会变化,模型也可能更新,外部工具会变化,攻击者还会不断寻找新的攻击方式。

因此,即使一个 AI 系统在上线前通过了大量安全测试,也不能说明它在未来面对所有情况时一定安全。NIST 在 2026 年发布的一项研究指出,AI 系统的部署后监控非常重要,因为真实环境中的输入条件可能不断变化,并可能出现模型非确定性带来的意外输出或开发阶段没有发现的后果。

NIST 同年发布的另一项研究则从更加理论化的角度解释了这一问题:固定的一组 AI 安全护栏无法保证对所有自适应攻击都长期有效。攻击者可能不断寻找新的方式绕过现有规则,因此 AI 安全需要持续寻找漏洞、更新防护机制,并建立发生问题后的恢复能力。

这意味着 AI 安全正在从过去的“测试一次 → 上线”,逐渐转向“测试 → 上线 → 监控 → 发现问题 → 修复 → 再测试”。安全不再是 AI 产品生命周期中的一个单独环节,而是一个持续进行的过程。

持续安全评估主要评估什么

对于 AI Agent 来说,持续安全评估通常可以从几个方面理解。

模型行为

第一层是模型本身。系统需要持续检查模型是否会产生明显错误、幻觉、有害内容或违反系统规则的行为。对于金融、医疗、代码执行等高风险场景,还需要针对具体应用设计专门的测试,而不能只依赖通用 benchmark。

抗攻击能力

第二层是对抗性测试。攻击者可能通过提示注入、越权指令、上下文操纵等方式诱导模型绕过原有规则。所谓 Jailbreak,就是比较典型的一类问题。NIST 的研究指出,固定安全护栏并不能保证 AI 永远不会被自适应攻击绕过,因此红队测试需要持续寻找新的攻击路径。

工具和权限

第三层是 Agent 特有的权限风险。一个 AI 即使本身并没有恶意行为,如果它拥有过大的权限,也可能因为错误判断造成严重后果。因此,AI Agent 的权限设计通常需要遵循最小权限原则。例如,一个只负责整理邮件的 Agent 没有必要拥有转账权限;一个负责分析数据的 Agent,也不应该默认拥有删除数据库的权限。

这实际上和区块链领域的智能合约安全存在一定相似之处:系统本身的逻辑只是第一层,真正决定潜在损失范围的,还包括它能够触达哪些资产和执行哪些操作。

真实环境表现

第四层是部署后的实际表现。实验室环境中的 AI 和真实世界中的 AI 可能面对完全不同的输入。用户可能提供复杂指令,第三方系统可能返回异常数据,网络环境也可能发生变化。因此,AI 安全评估需要观察系统在真实环境中的行为,而不是只看上线前的测试报告。

“AI 失控”到底意味着什么

“AI 失控”这个词很容易产生误解。它并不一定意味着 AI 突然产生了类似人类的意识,然后决定攻击人类。从技术角度看,更值得关注的是目标、权限和实际行为之间出现偏差。

例如,一个 Agent 被要求完成某项任务,但它错误理解了目标;或者它为了完成目标采取了开发者没有预料到的路径;又或者攻击者通过提示注入改变了它对任务的理解。如果这个 Agent 同时拥有较高权限,那么一个原本只是软件层面的错误,就可能进一步影响外部系统。

因此,“AI 失控”的核心问题可以拆解成三个部分:目标是否正确、行为是否符合目标、权限是否限制在合理范围内。 这也是为什么 AI 安全研究越来越重视 Alignment,也就是让 AI 系统的行为与人类设定的目标和约束保持一致。

AI 安全与普通用户有什么关系

AI 安全并不是只有 AI 公司和研究人员才需要关注。随着 AI Agent 进入搜索、办公、编程、金融服务以及数字资产等领域,普通用户未来可能会直接把更多操作权限交给 AI。

对于用户来说,最重要的并不是判断“AI 会不会毁灭人类”,而是理解一个更实际的问题:我到底给了 AI 什么权限? 如果 AI 只能回答问题,那么错误回答的影响通常相对有限;但如果 AI 能够代表用户发送邮件、修改文件、访问账户、运行代码或者执行金融交易,那么安全要求就完全不同。

因此,在使用具有自主执行能力的 AI 工具时,可以重点关注三个方面:权限是否最小化、重要操作是否需要人工确认,以及系统是否提供操作记录和异常撤销机制。

对于涉及数字资产的 AI Agent,这一点尤其重要。钱包签名、资产转移、智能合约交互等操作一旦交给自动化系统,安全边界就不再只是模型本身,而会延伸到私钥管理、授权机制、智能合约和外部服务。

AI 安全的重点正在从“阻止所有错误”转向“控制错误的影响”

目前来看,AI 安全很难建立一个能够永久解决所有问题的“万能护栏”。AI 模型会更新,攻击方式会变化,应用场景也会扩展。NIST 因此提出,AI 安全需要持续进行红队测试、更新防护措施,同时建立在漏洞出现之后限制影响和快速恢复的能力。

这背后的思路其实非常简单:不能假设系统永远不会出错,因此必须提前设计出错之后怎么办。 对于 AI Agent 来说,这可能意味着限制权限、设置人工确认、记录关键操作、隔离高风险任务,以及在异常行为发生时快速停止或撤销。

从这个角度来看,AI 安全并不是在回答“AI 到底会不会杀死人类”这样一个简单的二元问题,而是在解决一个更加现实的工程问题:当 AI 越来越能够自主行动时,人类如何持续知道它在做什么、为什么这么做,以及在出现问题时如何重新获得控制权。 这也是持续安全评估存在的意义。

总结

近期关于 AI 可能导致人类灭绝的讨论,再次把 AI 安全推到了公众视野中。但比极端预测本身更值得关注的是 AI 能力正在发生的结构性变化。

随着 AI 从聊天机器人发展到能够调用工具、访问数据并自主执行任务的 AI Agent,安全问题也从单纯的模型输出安全扩展到了权限、工具调用、环境交互和长期自主运行。

这意味着 AI 安全不可能只依赖一次上线前测试。持续监控、红队测试、权限控制、漏洞修复和异常恢复,将成为 AI Agent 逐渐进入现实应用后越来越重要的基础设施。

未来 AI 能否安全发展,很大程度上并不取决于能否找到一个永远不会出错的模型,而取决于人类能否建立一套持续发现问题、限制风险并重新获得控制权的机制。

FAQ

AI 真的会杀死人类吗?

目前没有可靠证据能够证明 AI 必然会导致人类灭绝。近期一些 AI 研究人员确实公开表达了对极端风险的担忧,但具体风险概率存在很大不确定性。更现实的安全问题包括网络攻击、数据泄露、错误决策以及 AI Agent 的权限滥用等。

什么是 AI Agent?

AI Agent 是能够根据目标自主规划并执行任务的 AI 系统。与传统聊天机器人相比,AI Agent 通常可以调用外部工具、访问数据并执行实际操作,因此具有更高的自主性,也需要更加严格的权限和安全控制。

为什么 AI 需要持续安全评估?

因为 AI 面对的输入、环境和攻击方式会持续变化。一次测试只能反映特定时间和特定条件下的表现,无法证明系统未来不会出现新的漏洞。因此,部署后的持续监控和测试同样重要。

AI Agent 最大的安全风险是什么?

其中一个关键风险是权限。AI Agent 如果拥有访问账户、文件、代码、资金或其他外部系统的权限,那么模型错误或恶意输入就可能从信息层面的错误进一步转化为现实操作。

AI 安全评估主要包括哪些内容?

通常包括模型行为测试、对抗性测试、红队测试、工具调用测试、权限控制、部署后监控以及异常恢复等。对于不同应用场景,还需要设计针对性的安全测试标准。

作者: Learn Team
免责声明

* 投资有风险,入市须谨慎。本文不作为 Gate 提供的投资理财建议或其他任何类型的建议。

* 在未提及 Gate 的情况下,复制、传播或抄袭本文将违反《版权法》,Gate 有权追究其法律责任。

相关文章

GateClaw 与 AI Skills:Web3 AI Agent 的能力体系解析
中级

GateClaw 与 AI Skills:Web3 AI Agent 的能力体系解析

GateClaw AI Skills 是一种面向 Web3 AI Agent 的模块化能力体系,用于将市场数据分析、链上信息查询以及交易执行等功能封装为可调用的智能模块,使 AI Agent 能够在统一系统中执行自动化任务。通过 AI Skills,复杂的 Web3 操作逻辑可以被转化为标准化能力接口,从而让 AI 模型不仅能够分析信息,还可以直接执行市场相关操作。
2026-03-24 11:58:44
GateClaw 的核心功能:Web3 AI Agent 工作站能力解析
中级

GateClaw 的核心功能:Web3 AI Agent 工作站能力解析

GateClaw 是一种面向 Web3 生态设计的 AI Agent 工作站,通过整合 AI 模型、模块化 Skills 与加密交易基础设施,使智能体能够在统一环境中执行数据分析、自动化交易和链上监控等任务。与传统 AI 工具主要用于信息处理不同,GateClaw 更强调 AI Agent 的执行能力,使其能够在真实市场环境中运行自动化流程。
2026-03-24 17:51:06
一文盘点 Top 10 AI Agents
中级

一文盘点 Top 10 AI Agents

纵观市场上的诸多 AI Agents,尽管在功能上同质化现象严重,但也会在某些方面独辟蹊径,为用户带来独特体验。本文将基于市场热度、项目创新、代币市值和交易量等多个维度总结出目前市场上的 Top10 AI Agents(排名不分前后),以供用户参考。
2026-04-04 17:18:46
解读 Vana 的野心:实现数据货币化,构建由用户主导的 AI 开发生态
新手

解读 Vana 的野心:实现数据货币化,构建由用户主导的 AI 开发生态

通过将数据民主化和货币化,Vana 正试图从根本上重新定义个人私有数据的归属和价值分配,创建一个真正由用户主导,并收益的 AI 开发生态系统。本文将从 Vana 的核心技术架构、测试网生态建设、团队背景及融资等方面解读该项目,并附上用户参与 Vana 生态的交互指南。
2026-04-05 05:04:14
什么是 TAO?Bittensor 代币经济学、供应模型与激励机制详解
新手

什么是 TAO?Bittensor 代币经济学、供应模型与激励机制详解

TAO 是 Bittensor 网络的原生代币,在去中心化 AI 生态中承担激励分配、网络安全与价值捕获的核心作用。通过通胀发行、质押机制与子网激励模型,TAO 构建了一个围绕 AI 模型竞争与评估的经济系统。
2026-03-24 12:23:21
Bittensor 是如何运作的?Subnet 架构、Miner 与 Yuma 共识解析
新手

Bittensor 是如何运作的?Subnet 架构、Miner 与 Yuma 共识解析

Bittensor 是一个去中心化 AI 网络,通过 Subnet、Miner 与 Validator 构建开放的机器学习市场,并利用 Yuma 共识机制实现模型评估与 TAO 激励分配。与传统中心化 AI 平台不同,Bittensor 将模型能力转化为可定价资产。
2026-03-24 12:24:56