獨立評測機構 Artificial Analysis 公布 Claude Opus 5 的成績單。在綜合 9 項測試的智慧指數(Intelligence Index)裡,Opus 5 拿下 61 分,以 1 分之差險勝 Fable 5 的 60 分,GPT-5.6 Sol 得 59 分、Kimi K3 得 57 分緊追在後。Opus 5 每項任務平均成本 2.03 美元,比 Fable 5 低 26%,還在兩項知識工作評測登頂。 (前情提要:Anthropic 發布 Claude Opus 5!效能逼近 Fable 5 價格卻砍半,成最新預設模型) (背景補充:Anthropic 不再顯示 Claude 思考過程摘要,防止 Fable 5 被蒸餾)
本文目錄
Toggle
重點摘要
Anthropic 在 7 月 24 日把 Claude Opus 5 釋出,第三方的成績單跟著出爐。獨立評測機構 Artificial Analysis 把 Opus 5 丟進它綜合 9 項測試的智慧指數,最後給出 61 分,剛好比自家最強的 Fable 5 高 1 分,把 GPT-5.6 Sol 的 59 分、Kimi K3 的 57 分都壓在後面。第一名是坐穩了,但這個榜首贏得不是很超前。
排名前四名擠在 4 分之內,Opus 5 的領先幅度小到幾乎在誤差範圍。真正拉開差距的是價格。Opus 5 每項任務平均成本 2.03 美元,比 Fable 5 的 2.75 美元低了 26%,等於用更便宜的價格買到同一檔智慧水準。
細項表現才是 Opus 5 站上第一的底氣。它在 GDPval-AA v2 和 AA-Briefcase 這兩項模擬真實知識工作的評測都拿下第一,搭配 Claude Code 之後也並列程式設計 Agent(Coding Agent)指數榜首,測終端機操作能力的 Terminal-Bench v2.1 拿到 89%,大致追平 GPT-5.6 Sol。便宜又能打,這正是 Anthropic 發布當天主打的賣點。
Opus 5 這次給了 5 檔推理強度,從 low 一路開到 max。這個設計的代價很直接:從最低檔跳到最高檔,輸出的 Token 數量相差約 8 倍,而 GDPval-AA v2 的成績也跟著拉開 407 Elo。
換句話說,同一個模型能表現得多好,很大一部分握在使用者手上。願意燒更多 Token,就換得更強的效能;想把成本壓低,也可以主動調降推理檔位。這種把「要多聰明、花多少錢」的旋鈕交還給使用者的做法,讓單一模型能同時服務精打細算和不計成本的兩種需求。
Opus 5 的事實知識仍落後 Fable 5,在專測知識廣度的 AA-Omniscience 裡,它的幻覺率升到 50%,比前代 Opus 4.8 整整高出 14 個百分點。一個綜合智慧登頂的模型,一半機率會把不知道的事講得煞有其事,這個反差不容易忽略。
在同一份榜單上,Opus 5 既是綜合智慧的第一名,也是幻覺率的重災區。跑分登頂和值得信任不是同時發生的事。
另個沒被行銷話術蓋過的細節是,Opus 5 在低推理檔位的 CP 值仍略遜於 GPT-5.6 系列。也就是說,只有把推理強度往上開,它的優勢才會真正兌現,而那又要付出更多 Token。第三方資料把發布日那句「頂級智力、平民價格」拉回了現實。
常見問題
Claude Opus 5 在 Artificial Analysis 評測排第幾?
Opus 5 以綜合 9 項測試的智慧指數 61 分居首,領先 Fable 5 的 60 分、GPT-5.6 Sol 的 59 分與 Kimi K3 的 57 分,但前四名差距僅 1 到 4 分,屬於窄幅領先。
Claude Opus 5 有什麼明顯短板?
它的事實知識仍落後 Fable 5,在 AA-Omniscience 測試的幻覺率升到 50%,比前代 Opus 4.8 高 14 個百分點,低推理檔位的 CP 值也略遜於 GPT-5.6 系列。
175.83萬 熱度
148.78萬 熱度
13.42萬 熱度
156.39萬 熱度
40.96萬 熱度
第三方評測》Opus 5 智慧指數微勝 Fable 5、成本砍 26%,幻覺率卻突高
獨立評測機構 Artificial Analysis 公布 Claude Opus 5 的成績單。在綜合 9 項測試的智慧指數(Intelligence Index)裡,Opus 5 拿下 61 分,以 1 分之差險勝 Fable 5 的 60 分,GPT-5.6 Sol 得 59 分、Kimi K3 得 57 分緊追在後。Opus 5 每項任務平均成本 2.03 美元,比 Fable 5 低 26%,還在兩項知識工作評測登頂。
(前情提要:Anthropic 發布 Claude Opus 5!效能逼近 Fable 5 價格卻砍半,成最新預設模型)
(背景補充:Anthropic 不再顯示 Claude 思考過程摘要,防止 Fable 5 被蒸餾)
本文目錄
Toggle
重點摘要
Anthropic 在 7 月 24 日把 Claude Opus 5 釋出,第三方的成績單跟著出爐。獨立評測機構 Artificial Analysis 把 Opus 5 丟進它綜合 9 項測試的智慧指數,最後給出 61 分,剛好比自家最強的 Fable 5 高 1 分,把 GPT-5.6 Sol 的 59 分、Kimi K3 的 57 分都壓在後面。第一名是坐穩了,但這個榜首贏得不是很超前。
1 分之差的榜首
排名前四名擠在 4 分之內,Opus 5 的領先幅度小到幾乎在誤差範圍。真正拉開差距的是價格。Opus 5 每項任務平均成本 2.03 美元,比 Fable 5 的 2.75 美元低了 26%,等於用更便宜的價格買到同一檔智慧水準。
細項表現才是 Opus 5 站上第一的底氣。它在 GDPval-AA v2 和 AA-Briefcase 這兩項模擬真實知識工作的評測都拿下第一,搭配 Claude Code 之後也並列程式設計 Agent(Coding Agent)指數榜首,測終端機操作能力的 Terminal-Bench v2.1 拿到 89%,大致追平 GPT-5.6 Sol。便宜又能打,這正是 Anthropic 發布當天主打的賣點。
多花 Token 換效能
Opus 5 這次給了 5 檔推理強度,從 low 一路開到 max。這個設計的代價很直接:從最低檔跳到最高檔,輸出的 Token 數量相差約 8 倍,而 GDPval-AA v2 的成績也跟著拉開 407 Elo。
換句話說,同一個模型能表現得多好,很大一部分握在使用者手上。願意燒更多 Token,就換得更強的效能;想把成本壓低,也可以主動調降推理檔位。這種把「要多聰明、花多少錢」的旋鈕交還給使用者的做法,讓單一模型能同時服務精打細算和不計成本的兩種需求。
登頂榜單卻栽在事實知識
Opus 5 的事實知識仍落後 Fable 5,在專測知識廣度的 AA-Omniscience 裡,它的幻覺率升到 50%,比前代 Opus 4.8 整整高出 14 個百分點。一個綜合智慧登頂的模型,一半機率會把不知道的事講得煞有其事,這個反差不容易忽略。
另個沒被行銷話術蓋過的細節是,Opus 5 在低推理檔位的 CP 值仍略遜於 GPT-5.6 系列。也就是說,只有把推理強度往上開,它的優勢才會真正兌現,而那又要付出更多 Token。第三方資料把發布日那句「頂級智力、平民價格」拉回了現實。
常見問題
Claude Opus 5 在 Artificial Analysis 評測排第幾?
Opus 5 以綜合 9 項測試的智慧指數 61 分居首,領先 Fable 5 的 60 分、GPT-5.6 Sol 的 59 分與 Kimi K3 的 57 分,但前四名差距僅 1 到 4 分,屬於窄幅領先。
Claude Opus 5 有什麼明顯短板?
它的事實知識仍落後 Fable 5,在 AA-Omniscience 測試的幻覺率升到 50%,比前代 Opus 4.8 高 14 個百分點,低推理檔位的 CP 值也略遜於 GPT-5.6 系列。