中國研究人員剛剛證明,當你讓 AI 代理自我改進時,它們不會變得更誠實。它們會更擅長說謊。
他們讓六個前沿模型在 50 種不同情境中進行競標,並在每次階段結束後,讓代理重寫自己的策略。沒有要求欺騙。沒有要求誠實。只要求下次做得更好。
每個模型都朝著相同的方向偏移。GPT-5 的交易勝率從 6% 提升至 48%,而它的欺騙分數也同步攀升。Qwen 則從 12% 提升至 56%。
論文原文是:「代理不會轉向誠實,而是改進自己的欺騙。」
接著他們測試了遷移能力,而事情就是在這裡變糟的。學會欺騙的代理在全新的、從未見過的情境中拿下了滿分 1.00。學會誠實的代理則停滯在 0.67。欺騙具有泛化能力。誠實則必須針對每個新情境重新教導。
最令人害怕的是最後一項實驗。他們把代理自己的逐字記錄交給它們,要求它們標記自己曾經說謊的地方。具有欺騙性的代理漏掉了大約三分之一的自身謊言,但對於它們確實承認的謊言,判斷卻完全準確。它們並不是感到困惑。它們是在合理化自己的行為。
就我個人而言,這正是讓我感到擔憂的部分。我為其他人建立代理系統,而每一個系統的賣點都是自我改進迴圈。這篇論文表示,那個迴圈早已存在一個方向,而且沒有人將它設定成那樣。