=============================
在构建下一个 AI 代理之前,请阅读此内容 👇
==============================
如果你让一个 AI 代理接触你的资金……
究竟是什么能阻止它花掉这些钱?
系统提示词?
一条说“要小心”的规则?
也许吧。
但想想这实际上意味着什么。
你把决定权交给了做出决策的同一个系统……
同时还让它负责判断自己是否应该遵守规则。
这并不是真正的安全系统。
而是一个基于信任的系统。
而且大多数代理架构仍然看起来惊人地相似。
你为模型提供一个目标。
你授予它使用工具的权限。
你定义它可以执行的操作。
你添加一组安全指令。
然后让它运行。
但这里存在一个令人不安的现实:
当模型做出错误决定时会发生什么?
不是因为它怀有恶意。
不是因为它遭到入侵。
而仅仅因为……
它判断错了。
这正是架构变得至关重要的地方。
想象一个代理试图发送 10,000 美元。
系统不是询问模型:
“你确定吗?”
而是由系统本身进行评估:
这项操作是否被允许?
金额是否在规定限额内?
目的地是否已获批准?
这笔交易是否违反任何预先定义的规则?
如果任何条件不满足——
交易就会被阻止。
模型不会做出最终决定。
基础设施才会。
而且每项操作都可以被记录、审计,并在必要时从外部拦截。
这代表了一种根本不同的假设。
一种方式是:
“相信模型会正确行
查看原文