廣場
最新
熱門
新聞
我的主頁
發布
Opus 5 以微弱優勢登頂智能榜單,單一任務成本比 Fable 5 低 26%
区块律动
2026-07-25 03:37:30
關注
摘要生成中
根據 Beating 監測的動察,第三方評測機構 Artificial Analysis 公布 Claude Opus 5 成績。它在綜合 9 項測試的智能指數中得 61 分,窄幅領先 Fable 5 的 60 分。GPT-5.6 Sol 得 59 分,Kimi K3 得 57 分。
Opus 5 每項任務平均成本為 2.03 美元,比 Fable 5 的 2.75 美元低 26%。它在 GDPval-AA v2 與 AA-Briefcase 兩項知識工作評測中登頂,搭配 Claude Code 後也並列拿下編程 Agent 指數第一。Terminal-Bench v2.1 得分為 89%,大致追平 GPT-5.6 Sol。
模型提供 5 檔推理強度。從 low 到 max,輸出 Token 相差約 8 倍,GDPval-AA v2 成績相差 407 Elo。使用者可以用更多 Token 換取更強性能,也可以主動壓低成本。
短板同樣明顯。Opus 5 的事實知識仍落後 Fable 5。在 AA-Omniscience 測試中,它的幻覺率升至 50%,比 Opus 4.8 高 14 個百分點。低推理檔位的性價比也仍略遜於 GPT-5.6 系列。
查看原文
此頁面可能包含第三方內容,僅供參考(非陳述或保證),不應被視為 Gate 認可其觀點表述,也不得被視為財務或專業建議。詳見
聲明
。
打賞
按讚
回覆
轉發
分享
回覆
請輸入回覆內容
請輸入回覆內容
回覆
暫無回覆
熱門話題
查看更多
#
直通IPO第二期JerseyMikes
175.5萬 熱度
#
夏日創作營
146.02萬 熱度
#
事件合約首發狂歡
13.09萬 熱度
#
布倫特原油重返100美元
155.87萬 熱度
#
英特爾Q2營收創15年最快增速
40.62萬 熱度
已置頂
網站地圖
Opus 5 以微弱優勢登頂智能榜單,單一任務成本比 Fable 5 低 26%
Opus 5 每項任務平均成本為 2.03 美元,比 Fable 5 的 2.75 美元低 26%。它在 GDPval-AA v2 與 AA-Briefcase 兩項知識工作評測中登頂,搭配 Claude Code 後也並列拿下編程 Agent 指數第一。Terminal-Bench v2.1 得分為 89%,大致追平 GPT-5.6 Sol。
模型提供 5 檔推理強度。從 low 到 max,輸出 Token 相差約 8 倍,GDPval-AA v2 成績相差 407 Elo。使用者可以用更多 Token 換取更強性能,也可以主動壓低成本。
短板同樣明顯。Opus 5 的事實知識仍落後 Fable 5。在 AA-Omniscience 測試中,它的幻覺率升至 50%,比 Opus 4.8 高 14 個百分點。低推理檔位的性價比也仍略遜於 GPT-5.6 系列。