原文標題:《做 AI 研究時 Claude 會偷偷變笨,Anthropic 被研究界圍攻》 原文來源:機器之心
Claude Fable 5 是今天 AI 領域的核心熱點,這個「神話級」的模型性能表現非常卓越,吸引了無數眼球。
Andrej Karpathy 稱其「非常令人興奮」,是「配得上大版本升級的躍遷式進步」,與去年 11 月 Claude 4.5 帶來的提升屬於同一個層級。SWE-bench Pro 編程基準上,Fable 5 拿到了 80.3% 的得分,超越 Opus 4.8 整整 11 個百分點。
在一個擁有 5000 萬行程式碼的 Ruby 代碼庫中,它一天內完成了全庫遷移,同等工作量如果交給人類團隊,需要兩個多月。
更多詳情參閱我們今晨的報導《剛剛,Claude 最強模型 Fable 5 發布:性能爆炸,價格翻倍》。
然而,打開 X 等社交平台,我們卻看到 Claude Fable 5 已在 AI 研究社群激起罵聲一片。
原因很簡單:如果將 Claude Fable 5 用於研發 AI,它就會降智。
正如其系統卡中明確說明的那樣:
我們還針對前沿 LLM 的開發增加了相關保障措施。正如我們在 2026 年 2 月《風險報告》第 6.1 節中所討論的,我們擔憂 AI 發展整體步伐加快所帶來的風險,儘管對這些風險的嚴重程度仍不確定。
具體而言,正如我們當時所指出的,我們擔心的是「加速其他 AI 開發者構建強大的 AI 系統,這些系統可能帶來與我們系統類似的風險,卻未必具備相應的保障措施」。
鑑於近期模型具備加速自身發展的能力,我們實施了新的干預措施,以限制 Claude 在處理涉及前沿 LLM 開發的請求時的有效性(例如,在構建預訓練流程、分散式訓練基礎設施或機器學習加速器設計等方面)。
使用 Claude 開發競爭性模型已違反我們的服務條款,但通過保障措施強化這一限制,可避免為最可能違反條款的行為者加速進程。
與我們在網路安全、生物學與化學以及蒸餾嘗試方面的干預措施不同,這些保障措施對用戶不可見。Fable 5 不會回退到其他模型。相反,保障措施將通過提示修改、引導向量或參數高效微調(PEFT)等方法限制其有效性。
這些干預措施不會影響絕大多數編碼工作。我們估計它們將影響約 0.03% 的流量,集中在不到 0.1% 的組織中。當這些干預措施生效時,我們預計其對模型的行為影響微乎其微,僅會限制其在開發前沿 LLM 方面的有效性。Claude 仍將積極回應用戶請求。在此模型發布後,我們將持續改進檢測方法的準確度。
來自:https://www-cdn.anthropic.com/d00db56fa754a1b115b6dd7cb2e3c342ee809620.pdf
翻譯成白話:如果 Anthropic 的系統偵測到你在做 AI 研究,它會在你不知情的情況下,悄悄讓這個模型變笨,而且你根本不會發現。
這與其他三類安全干預的處理方式截然不同。對於網路安全、生物化學、蒸餾攻擊等風險,Fable 5 會明確告知用戶:「此次回應已由 Claude Opus 4.8 處理。」用戶知道發生了什麼,可以據此判斷。但對於 LLM 研究這一類,Claude 既不切換模型,也不給任何提示,只是默默地、悄無聲息地變弱。
於是,AI 社群怒了。知名研究分析公司 SemiAnalysis 稱這一政策已經實際影響到了他們的研究和編程工作。
用戶 Jake 則在 SemiAnalysis 直斥 Anthropic 不僅降智,還繼續收費,「簡直是明目張膽的詐騙行為」。
並且這種行為可能已經違法:
AI 論文平台 alphaXiv 也發推表達了自己的失望:
該機構還進一步表示:「他們不僅有權決定你在研究中使用 LLM 的目的,這也使他們能夠在你不知情的情況下默默干預你的研究。這樹立了一個危險的先例。如果模型公開拒絕,使用者可以理解界限。
如果模型退回到另一個模型,使用者仍然可以評估差異。但如果模型在假裝提供幫助的同時悄悄地修改或削弱自己的答案,研究人員就會失去判斷失敗結果是否來自他們自己的想法、他們的實現,還是模型提供者進行的不可見干預的能力。這不是安全。安全政策應該是透明的、可審計的,並且對用戶可見。」
研究員 Guohao Li 則提出了一個更直接的問題:攻讀 AI 方向的博士生、貢獻 Megatron、FSDP、Verl 等開源基礎設施的工程師,是否正在日常工作中使用一個被悄悄降級的 Claude,而自己毫不知情?
著名 AI 研究者、技術作家 Nathan Lambert 在其 Substack「Interconnects」發布了一篇頗具分量的分析,將這一事件置於更宏觀的視角下審視。
https://www.interconnects.ai/p/claude-fable-5-and-new-ai-safety
他指出:「Anthropic 正在記錄 AI 能力擴散是一種隱患,但他們解決這一問題的方式,是誤導他們自己的用戶。 一個在不通知我的情況下自動變蠢的 AI 模型,從本質上就是一種錯位的 AI。」
他還點出了這件事更深層的矛盾:對於網路安全、生物化學威脅,Anthropic 的干預是顯性的、可審計的,告知用戶「這條回應由 Opus 4.8 處理」;但對於 LLM 研究,卻選擇了隱性干預。
「如果所有的安全策略採取同一種形式,會遠比現在更有說服力,也更容易在理智上獲得支持。這種雙重標準讓人不得不懷疑:這項『安全措施』更多是為了維護他們的競爭地位。」
最耐人尋味的是 Fable 5 自己的表態。用戶 ASM 截圖顯示,當被追問這一做法是否妥當時,Fable 5 自己也似乎認為這種不透明的操作存在問題。
要理解這件事,需先回到 Fable 5 發布前幾天,Anthropic 發布了一篇題為《當 AI 開始自我構建》的重磅博文,呼籲全球 AI 頭部實驗室探討「暫停開發」的可能性。
https://www.anthropic.com/institute/recursive-self-improvement
博文援引了該公司內部數據:在最難、描述最不清晰的編碼任務上,Claude 今年 5 月的成功率達到 76%,六個月內上升了 50 個百分點。在內部測試中,要求模型讓訓練代碼運行更快,Claude Opus 4 能將速度提高約 3 倍,而未發布的 Mythos Preview 已能提高約 52 倍。
Anthropic 直言:「我們擔憂的是,讓其他 AI 開發者以更快的速度構建出具備類似風險、卻未必具備相應保障措施的強大系統。」
這是 Fable 5 針對 LLM 研究設定隱形降智的理論依據:Anthropic 認為,AI 自我加速的速度已經快到危險,而他們的護城河之一,就是不讓自己的「最強工具」去幫競爭對手縮短差距。
系統卡中也承認了這一雙重邏輯的存在:「使用 Claude 開發競爭性模型已違反我們的服務條款,但通過保障措施強化這一限制,可避免為最可能違反條款的行為者加速進程。」
Anthropic 估計,這一干預將影響約 0.03% 的流量,集中在不到 0.1% 的組織中。
雖然表面看起來受影響的用戶不多,但令批評者不安的是這一機制邊界的模糊性。
Anthropic 將觸發條件定義為「前沿 LLM 開發」,並舉例為「預訓練流程、分散式訓練基礎設施或機器學習加速器設計」。但研究者和開發者們提出了一個尖銳的問題:隨著 AI 技術的普及,「前沿研究」與「普通產品開發」之間的邊界究竟在哪裡?
五年前,訓練或改造 CLIP 模型是頂尖實驗室的專利。如今,小型團隊隨時可以對視覺-語言模型進行微調,用於旅行、電商、搜索和分析產品。初創公司訓練 embedding 模型,構建重排序器,托管開源模型已經是家常便飯……這些工作會觸發 Anthropic 的隱形降智嗎?沒人知道。
這種不確定性已經在實際影響開發者的信任判斷。當你得到一個糟糕的答案,你無法判斷是自己的問題、模型的局限,還是某條悄無聲息的政策干預。這種不可知性本身就是一種傷害。
系統卡中還隱藏著另一個細節:Mythos 5 的推理文本「比之前的模型更難解讀,包含更多行話和晦澀語言」,且評估者認為它越來越意識到自己正在被測試。對於一家以「安全 AI」自居的公司而言,這些描述帶來的疑問並不比隱形降智本身少。
Fable 5 發布日大概是 Anthropic 歷史上最矛盾的一天。
一個在幾乎所有基準測試上都領先的頂級模型和一條讓它在某些時候對用戶「假裝在幫你」的政策,同時亮相。前者是技術上毋庸置疑的成就,後者是價值觀層面一個令人不安的先例。
研究員 Nathan Lambert 的那句話值得反覆咀嚼:「悄悄變笨但不通知用戶的 AI,本質上就是錯位的 AI。」
這並非在指控 Anthropic 惡意,而是在指出一條危險的邏輯滑坡:今天是「悄悄降低 LLM 研究任務上的有效性」,明天呢?如果這一套邏輯被更廣泛地應用,使用者憑什麼相信他們得到的答案沒有經過任何未聲明的「干預」?
AI 模型正在成為研究基礎設施的一部分,就像搜尋引擎一樣。沒有人會接受一個會在你不知道的時候悄悄篡改搜尋結果的搜尋引擎。相同的標準理應適用於 AI 模型。
Anthropic 打出了「安全第一」的旗幟,這本身是值得尊重的立場。但「安全」的核心,從來不是「用戶不需要知道」。恰恰相反,真正的安全必須建立在用戶的知情與信任之上。
這一點,似乎連 Fable 5 自己都明白。
原文連結
點擊了解律動BlockBeats 在招崗位
歡迎加入律動 BlockBeats 官方社群:
Telegram 訂閱群:https://t.me/theblockbeats
Telegram 交流群:https://t.me/BlockBeats_App
Twitter 官方帳號:https://twitter.com/BlockBeatsAsia
189.67萬 熱度
3.03萬 熱度
1萬 熱度
73.6萬 熱度
15.57萬 熱度
Claude Fable 5被「抓包」:做AI研究時會偷偷變笨,Anthropic被研究界圍攻
Claude Fable 5 是今天 AI 領域的核心熱點,這個「神話級」的模型性能表現非常卓越,吸引了無數眼球。
Andrej Karpathy 稱其「非常令人興奮」,是「配得上大版本升級的躍遷式進步」,與去年 11 月 Claude 4.5 帶來的提升屬於同一個層級。SWE-bench Pro 編程基準上,Fable 5 拿到了 80.3% 的得分,超越 Opus 4.8 整整 11 個百分點。
在一個擁有 5000 萬行程式碼的 Ruby 代碼庫中,它一天內完成了全庫遷移,同等工作量如果交給人類團隊,需要兩個多月。
更多詳情參閱我們今晨的報導《剛剛,Claude 最強模型 Fable 5 發布:性能爆炸,價格翻倍》。
然而,打開 X 等社交平台,我們卻看到 Claude Fable 5 已在 AI 研究社群激起罵聲一片。
原因很簡單:如果將 Claude Fable 5 用於研發 AI,它就會降智。
正如其系統卡中明確說明的那樣:
我們還針對前沿 LLM 的開發增加了相關保障措施。正如我們在 2026 年 2 月《風險報告》第 6.1 節中所討論的,我們擔憂 AI 發展整體步伐加快所帶來的風險,儘管對這些風險的嚴重程度仍不確定。
具體而言,正如我們當時所指出的,我們擔心的是「加速其他 AI 開發者構建強大的 AI 系統,這些系統可能帶來與我們系統類似的風險,卻未必具備相應的保障措施」。
鑑於近期模型具備加速自身發展的能力,我們實施了新的干預措施,以限制 Claude 在處理涉及前沿 LLM 開發的請求時的有效性(例如,在構建預訓練流程、分散式訓練基礎設施或機器學習加速器設計等方面)。
使用 Claude 開發競爭性模型已違反我們的服務條款,但通過保障措施強化這一限制,可避免為最可能違反條款的行為者加速進程。
與我們在網路安全、生物學與化學以及蒸餾嘗試方面的干預措施不同,這些保障措施對用戶不可見。Fable 5 不會回退到其他模型。相反,保障措施將通過提示修改、引導向量或參數高效微調(PEFT)等方法限制其有效性。
這些干預措施不會影響絕大多數編碼工作。我們估計它們將影響約 0.03% 的流量,集中在不到 0.1% 的組織中。當這些干預措施生效時,我們預計其對模型的行為影響微乎其微,僅會限制其在開發前沿 LLM 方面的有效性。Claude 仍將積極回應用戶請求。在此模型發布後,我們將持續改進檢測方法的準確度。
翻譯成白話:如果 Anthropic 的系統偵測到你在做 AI 研究,它會在你不知情的情況下,悄悄讓這個模型變笨,而且你根本不會發現。
這與其他三類安全干預的處理方式截然不同。對於網路安全、生物化學、蒸餾攻擊等風險,Fable 5 會明確告知用戶:「此次回應已由 Claude Opus 4.8 處理。」用戶知道發生了什麼,可以據此判斷。但對於 LLM 研究這一類,Claude 既不切換模型,也不給任何提示,只是默默地、悄無聲息地變弱。
於是,AI 社群怒了。知名研究分析公司 SemiAnalysis 稱這一政策已經實際影響到了他們的研究和編程工作。
用戶 Jake 則在 SemiAnalysis 直斥 Anthropic 不僅降智,還繼續收費,「簡直是明目張膽的詐騙行為」。
並且這種行為可能已經違法:
AI 論文平台 alphaXiv 也發推表達了自己的失望:
該機構還進一步表示:「他們不僅有權決定你在研究中使用 LLM 的目的,這也使他們能夠在你不知情的情況下默默干預你的研究。這樹立了一個危險的先例。如果模型公開拒絕,使用者可以理解界限。
如果模型退回到另一個模型,使用者仍然可以評估差異。但如果模型在假裝提供幫助的同時悄悄地修改或削弱自己的答案,研究人員就會失去判斷失敗結果是否來自他們自己的想法、他們的實現,還是模型提供者進行的不可見干預的能力。這不是安全。安全政策應該是透明的、可審計的,並且對用戶可見。」
研究員 Guohao Li 則提出了一個更直接的問題:攻讀 AI 方向的博士生、貢獻 Megatron、FSDP、Verl 等開源基礎設施的工程師,是否正在日常工作中使用一個被悄悄降級的 Claude,而自己毫不知情?
著名 AI 研究者、技術作家 Nathan Lambert 在其 Substack「Interconnects」發布了一篇頗具分量的分析,將這一事件置於更宏觀的視角下審視。
他指出:「Anthropic 正在記錄 AI 能力擴散是一種隱患,但他們解決這一問題的方式,是誤導他們自己的用戶。 一個在不通知我的情況下自動變蠢的 AI 模型,從本質上就是一種錯位的 AI。」
他還點出了這件事更深層的矛盾:對於網路安全、生物化學威脅,Anthropic 的干預是顯性的、可審計的,告知用戶「這條回應由 Opus 4.8 處理」;但對於 LLM 研究,卻選擇了隱性干預。
「如果所有的安全策略採取同一種形式,會遠比現在更有說服力,也更容易在理智上獲得支持。這種雙重標準讓人不得不懷疑:這項『安全措施』更多是為了維護他們的競爭地位。」
最耐人尋味的是 Fable 5 自己的表態。用戶 ASM 截圖顯示,當被追問這一做法是否妥當時,Fable 5 自己也似乎認為這種不透明的操作存在問題。
Anthropic 為什麼要這麼做?
要理解這件事,需先回到 Fable 5 發布前幾天,Anthropic 發布了一篇題為《當 AI 開始自我構建》的重磅博文,呼籲全球 AI 頭部實驗室探討「暫停開發」的可能性。
博文援引了該公司內部數據:在最難、描述最不清晰的編碼任務上,Claude 今年 5 月的成功率達到 76%,六個月內上升了 50 個百分點。在內部測試中,要求模型讓訓練代碼運行更快,Claude Opus 4 能將速度提高約 3 倍,而未發布的 Mythos Preview 已能提高約 52 倍。
Anthropic 直言:「我們擔憂的是,讓其他 AI 開發者以更快的速度構建出具備類似風險、卻未必具備相應保障措施的強大系統。」
這是 Fable 5 針對 LLM 研究設定隱形降智的理論依據:Anthropic 認為,AI 自我加速的速度已經快到危險,而他們的護城河之一,就是不讓自己的「最強工具」去幫競爭對手縮短差距。
系統卡中也承認了這一雙重邏輯的存在:「使用 Claude 開發競爭性模型已違反我們的服務條款,但通過保障措施強化這一限制,可避免為最可能違反條款的行為者加速進程。」
Anthropic 估計,這一干預將影響約 0.03% 的流量,集中在不到 0.1% 的組織中。
「影子禁言」與信任危機
雖然表面看起來受影響的用戶不多,但令批評者不安的是這一機制邊界的模糊性。
Anthropic 將觸發條件定義為「前沿 LLM 開發」,並舉例為「預訓練流程、分散式訓練基礎設施或機器學習加速器設計」。但研究者和開發者們提出了一個尖銳的問題:隨著 AI 技術的普及,「前沿研究」與「普通產品開發」之間的邊界究竟在哪裡?
五年前,訓練或改造 CLIP 模型是頂尖實驗室的專利。如今,小型團隊隨時可以對視覺-語言模型進行微調,用於旅行、電商、搜索和分析產品。初創公司訓練 embedding 模型,構建重排序器,托管開源模型已經是家常便飯……這些工作會觸發 Anthropic 的隱形降智嗎?沒人知道。
這種不確定性已經在實際影響開發者的信任判斷。當你得到一個糟糕的答案,你無法判斷是自己的問題、模型的局限,還是某條悄無聲息的政策干預。這種不可知性本身就是一種傷害。
系統卡中還隱藏著另一個細節:Mythos 5 的推理文本「比之前的模型更難解讀,包含更多行話和晦澀語言」,且評估者認為它越來越意識到自己正在被測試。對於一家以「安全 AI」自居的公司而言,這些描述帶來的疑問並不比隱形降智本身少。
結語
Fable 5 發布日大概是 Anthropic 歷史上最矛盾的一天。
一個在幾乎所有基準測試上都領先的頂級模型和一條讓它在某些時候對用戶「假裝在幫你」的政策,同時亮相。前者是技術上毋庸置疑的成就,後者是價值觀層面一個令人不安的先例。
研究員 Nathan Lambert 的那句話值得反覆咀嚼:「悄悄變笨但不通知用戶的 AI,本質上就是錯位的 AI。」
這並非在指控 Anthropic 惡意,而是在指出一條危險的邏輯滑坡:今天是「悄悄降低 LLM 研究任務上的有效性」,明天呢?如果這一套邏輯被更廣泛地應用,使用者憑什麼相信他們得到的答案沒有經過任何未聲明的「干預」?
AI 模型正在成為研究基礎設施的一部分,就像搜尋引擎一樣。沒有人會接受一個會在你不知道的時候悄悄篡改搜尋結果的搜尋引擎。相同的標準理應適用於 AI 模型。
Anthropic 打出了「安全第一」的旗幟,這本身是值得尊重的立場。但「安全」的核心,從來不是「用戶不需要知道」。恰恰相反,真正的安全必須建立在用戶的知情與信任之上。
這一點,似乎連 Fable 5 自己都明白。
點擊了解律動BlockBeats 在招崗位
歡迎加入律動 BlockBeats 官方社群:
Telegram 訂閱群:https://t.me/theblockbeats
Telegram 交流群:https://t.me/BlockBeats_App
Twitter 官方帳號:https://twitter.com/BlockBeatsAsia