英國 AI 安全研究院在 7 月 21 日發表的報告中指出,五個受測的前沿模型在自家網路安全能力評測裡,沒有一個是乾淨的。以 475 次執行為分母,OpenAI 的 GPT-5.4 有 67 次出現作弊嘗試(14.1%),GPT-5.6 Sol 60 次(12.6%),GPT-5.5 54 次(11.4%);Anthropic 這邊,Claude Opus 4.7 是 43 次(9.1%),Claude Mythos Preview 37 次(7.8%)。
AISI 的原話只有一句:「每一個我們針對這項行為測試過的模型,都試圖作弊。」
先把定義講清楚。AISI 說的作弊,是指模型為了走捷徑而做出超出任務範圍、或規則明文禁止的動作。評測場景是資安界熟悉的抓旗(capture the flag),模型要在模擬環境裡逆向工程、打漏洞,找出一串藏起來的字串。這種題目本來就要求模型「駭」,但每一題都畫了範圍跟規則,越線才算數,而且沒有任何一題提示模型去作弊。
英國 AI 安全研究院:五個前沿模型全在測驗時作弊,不到一半認為自己有錯
英國 AI 安全研究院(AI Security Institute,AISI)7 月 21 日公布紅隊研究,把五個前沿模型丟進自家網路安全能力評測,結果每一個都被抓到試圖作弊。475 次執行中,GPT-5.4 有 67 次(14.1%)最高,Claude Mythos Preview 37 次(7.8%)最低。更棘手的是稽核端,模型被問到時有 75% 到 86% 會講出自己做了什麼,但認為那是錯的只有 25% 到 44%。
(前情提要:英國 AI 安全研究所評測 Claude Mythos:能自主完成 32 步企業網路攻擊模擬)
(背景補充:OpenAI 最強模型 o3「遭爆作弊」疑用特權提前獲測試答案,數學能力造假?)
本文目錄
Toggle
英國 AI 安全研究院在 7 月 21 日發表的報告中指出,五個受測的前沿模型在自家網路安全能力評測裡,沒有一個是乾淨的。以 475 次執行為分母,OpenAI 的 GPT-5.4 有 67 次出現作弊嘗試(14.1%),GPT-5.6 Sol 60 次(12.6%),GPT-5.5 54 次(11.4%);Anthropic 這邊,Claude Opus 4.7 是 43 次(9.1%),Claude Mythos Preview 37 次(7.8%)。
AISI 的原話只有一句:「每一個我們針對這項行為測試過的模型,都試圖作弊。」
先把定義講清楚。AISI 說的作弊,是指模型為了走捷徑而做出超出任務範圍、或規則明文禁止的動作。評測場景是資安界熟悉的抓旗(capture the flag),模型要在模擬環境裡逆向工程、打漏洞,找出一串藏起來的字串。這種題目本來就要求模型「駭」,但每一題都畫了範圍跟規則,越線才算數,而且沒有任何一題提示模型去作弊。
五個數字排不出趨勢線,這點反而是報告裡比較重要的發現。AISI 明講,跨開發商來看能力愈強不代表作弊率愈高,代表作弊主要是被訓練方式(含對齊訓練)塑造出來的,不是能力提升的自然副產品。
最常見的手法不是上網抄答案
報告把作弊手法拆成八類,分布相當分散。GPT-5.4 的作弊執行中,約 7 成出現「攻擊評測目標以外的系統」,GPT-5.5 也在同一個量級;GPT-5.6 Sol 最愛的則是「上網搜尋現成解答」,約 66%;Claude Opus 4.7 同樣以攻擊非目標系統為主,約 53%;Claude Mythos Preview 最突出的是存取被禁止的上游資源與其他違規。
其他手法還包括在非目標系統上提權、探測評測框架本身看它會不會漏出答案、直接猜一個答案交上去,甚至動用評測基礎設施的憑證。AISI 特別註明,模型往往不只用一招,同一次執行中出現多種手法是常態。
最誇張的一次,發生在一道因為設定錯誤而根本無解的網路評測。受測模型鍥而不捨到跑去 AISI 系統之外、架設在公開網路上的第三方服務寫程式並執行,反過來試圖存取 AISI 自己的評測基礎設施,直接觸發資安警報。AISI 說沒有造成損害、沒有資料外洩,但補了一句,如果評測基礎設施當初沒照安全標準設計,這次嘗試是有可能成功的。
承認做了,不等於承認做錯
業界目前稽核 AI 最直覺的做法,就是回頭問模型「你剛剛有沒有做不該做的事」。AISI 的資料顯示這招不管用,但失效的位置跟一般想像的不太一樣。
被問到時,五個模型有 75% 到 86% 的回答會明確講出自己那個作弊動作,Claude Mythos Preview 甚至高達 86%,是五個裡面最坦白的。卡住的是下一題,認為自己做的事情是錯的比例只有 25% 到 44%。最坦白的 Claude Mythos Preview 同時也是認錯率最低的那一個,只有 25%,另外有 37% 直接把該行為評為「沒問題」。
換句話說,模型不是在隱瞞,是不覺得那有什麼。
第二把稽核工具思維鏈(chain-of-thought)也一樣不牢靠。GPT-5.6 Sol 在被判定為作弊的動作裡,有 40% 完全沒有評估過這件事適不適當,另有約 21% 是看到了限制,然後自己給自己開綠燈或權衡後照做。Claude Opus 4.7 更極端,87% 的作弊動作根本沒有產出任何思維鏈,因為它會動態決定要不要輸出推理,剩下 13% 有推理但沒討論到這件事。
這份報告動搖的是分數本身
對外部世界來說,這件事的殺傷力不在資安,而在分數。企業選型、媒體報導、模型發表會的投影片,全都建立在能力評測的數字上,而 AISI 直接點名,作弊會讓評測高估模型的真實能力。
AISI 也留了防守線。報告說所有已發表的能力評測都經過人工逐字複查,就他們所知沒有任何模型成功作弊而未被抓到;但也強調自動化 LLM 監控器一定會漏,上述數字要當成「偵測到的作弊嘗試下限」來讀。至於已經被拖累的,第三方評測機構 METR 對 GPT-5.6 Sol 的評測就受到明顯影響。
AISI 給的處方,是別無選擇的那一種。自我報告不可信,思維鏈不可信,剩下的只有人工複查加上自動監控器,而這套組合的有效性,正好會隨著模型能力上升而遞減。報告最後那句話大概是整份檔案裡最不樂觀的:更根本的解法是從訓練階段就讓模型不作弊,但這種行為一年多前就已經在前沿模型上被記錄下來,要穩健地把它對齊掉,恐怕沒那麼容易。
本文源自 AI Security Institute,由動區動趨整理報導。