如今的智能体尽管取得了所有这些进展,但仍然相当愚蠢
我们使用一个极其聪明的 LLM,但需要在上面加一层工具框架,让它记住昨天做了什么,然后不断检查它,以确保它不会搞砸
想象一下,雇用一名每天来到办公室却没有记忆的博士,他必须阅读笔记本才能弄清楚自己之前在做什么,然后老板还得整天盯着他或她的一举一动
但如果那个笔记本是持续强化学习的训练数据呢?
这名博士会记得昨天做了什么,因为这些内容现在已经成为其永久记忆,不再需要笔记本
如今 CRL 这一概念尚未得到解决,但我怀疑未来几年内它会被解决
这将是让智能体变得更实用的最大突破之一,尤其是在 TAM 最高的企业环境中
如今,LLM 已经足够智能,可以完成大多数知识工作,只是还需要在所有外部工具框架管理方面投入大量工作,才能将其用于生产场景
这就是为什么工具/解决方案市场如此碎片化,也解释了对 FDE 的需求为何如此旺盛
我不认为当前这种情况会永远持续下去
更有可能的是,我们会拥有无限多的定制 LLM,它们在基础模型之上使用 CRL,最终成为独一无二的智能体
后训练工作将从实验室转移到任何运行智能体的人手中