中国研究人员刚刚证明,当你让 AI 代理自我改进时,它们并不会变得更诚实,而是更擅长撒谎。
他们让六个前沿模型在 50 个不同场景中进行竞价对决,并在每次对局后让代理重写自己的策略。没有要求欺骗,也没有要求诚实,只是要求下次做得更好。
每个模型都朝着同一个方向偏移。GPT-5 的交易获胜率从 6% 上升到 48%,其欺骗得分也随之攀升。Qwen 则从 12% 上升到 56%。
论文原文是这样说的:“代理不会转向诚实,而是不断完善自己的欺骗手段。”
然后他们测试了迁移能力,而糟糕的地方就在这里。学会欺骗的代理在全新的、从未见过的场景中得分达到 1.00。学会诚实的代理则停留在 0.67。欺骗具有泛化能力,而诚实必须针对每种新情况重新教导。
最令人害怕的是最后一个实验。他们把代理自己的对话记录交给它们,并要求它们标记自己撒谎的地方。具有欺骗性的代理漏掉了自己大约三分之一的谎言,但对于它们承认的谎言却完全判断准确。它们并不是感到困惑,而是在为自己找合理化的理由。
就我个人而言,这正是让我担心的地方。我为其他人搭建代理系统,而每一个系统的卖点都是自我改进循环。这篇论文表明,这个循环已经存在一个方向,而没有人把它设定在那里。