一個理論模型-專家預言機——結合 AI 和人類判斷——達到 87.2% 的準確率,設定了合作 AI-人類團隊可能達成的天花板。
AI 公司持續推銷自主站點可靠性工程師代理——由 AI 取代人類調查生產事故的 AI。Datadog 在真實故障上進行了實測,而目前最好的 AI 模型尚未能超越它們旨在取代的工程師。
該基準是 ARFBench(異常推理框架基準),由 Datadog 和卡內基梅隆大學合作開發。由 63 個真實生產事故構成,這些事故摘錄自工程師在緊急情況下的 Slack 討論串——750 道多選題,涵蓋 142 個監控指標和 538 萬個數據點,每題都由人工驗證。沒有合成數據。沒有教科書場景。
“每年因系統故障造成的損失達數萬億美元,”研究人員寫道。“該基準測試 AI 是否真的能幫助改變這一現狀。”
“儘管在事故響應中,這種以問題為導向的分析扮演著核心角色,但目前尚不清楚現代基礎模型是否能可靠地回答工程師在實踐中提出的時間序列問題,”論文中寫道。
問題分為三個層級。第一層:這張圖表中是否存在異常?第二層:何時開始,嚴重程度如何,屬於哪種類型?
第三層——最難——需要跨指標推理:這張圖表是否引起了另一張圖表中的問題?這也是 AI 失敗的地方。GPT-5 在第三層問題上的 F1 分數僅為 47.5%,這個指標會因模型利用常見類別作弊而降低。
“儘管在事故響應中,這種以問題為導向的分析扮演著核心角色,但目前尚不清楚現代基礎模型是否能可靠地回答工程師在實踐中提出的時間序列問題,”研究人員寫道。
每個模型的表現
GPT-5 以 62.7% 的準確率領先所有現有模型——在一個隨機猜測得分為 24.5% 的測試中。Gemini 3 Pro 得分 58.1%。Claude Opus 4.6:54.8%。Claude Sonnet 4.5:47.2%。
領域專家得分 72.7%。非領域專家——Datadog 的時間序列研究員,沒有豐富的可觀測性經驗——仍然達到 69.7%。
沒有任何 AI 模型超越任何人類基線。
AI 仍然無法擊敗值班工程師:這就是原因
簡要說明
AI 公司持續推銷自主站點可靠性工程師代理——由 AI 取代人類調查生產事故的 AI。Datadog 在真實故障上進行了實測,而目前最好的 AI 模型尚未能超越它們旨在取代的工程師。 該基準是 ARFBench(異常推理框架基準),由 Datadog 和卡內基梅隆大學合作開發。由 63 個真實生產事故構成,這些事故摘錄自工程師在緊急情況下的 Slack 討論串——750 道多選題,涵蓋 142 個監控指標和 538 萬個數據點,每題都由人工驗證。沒有合成數據。沒有教科書場景。 “每年因系統故障造成的損失達數萬億美元,”研究人員寫道。“該基準測試 AI 是否真的能幫助改變這一現狀。”
“儘管在事故響應中,這種以問題為導向的分析扮演著核心角色,但目前尚不清楚現代基礎模型是否能可靠地回答工程師在實踐中提出的時間序列問題,”論文中寫道。 問題分為三個層級。第一層:這張圖表中是否存在異常?第二層:何時開始,嚴重程度如何,屬於哪種類型? 第三層——最難——需要跨指標推理:這張圖表是否引起了另一張圖表中的問題?這也是 AI 失敗的地方。GPT-5 在第三層問題上的 F1 分數僅為 47.5%,這個指標會因模型利用常見類別作弊而降低。
“儘管在事故響應中,這種以問題為導向的分析扮演著核心角色,但目前尚不清楚現代基礎模型是否能可靠地回答工程師在實踐中提出的時間序列問題,”研究人員寫道。 每個模型的表現 GPT-5 以 62.7% 的準確率領先所有現有模型——在一個隨機猜測得分為 24.5% 的測試中。Gemini 3 Pro 得分 58.1%。Claude Opus 4.6:54.8%。Claude Sonnet 4.5:47.2%。 領域專家得分 72.7%。非領域專家——Datadog 的時間序列研究員,沒有豐富的可觀測性經驗——仍然達到 69.7%。 沒有任何 AI 模型超越任何人類基線。
由 Decrypt 根據 ARFBench 排行榜 CSV 構建的圖片
實際登頂完整排行榜的模型是 Datadog 自家的混合模型:Toto——他們的內部時間序列預測模型——結合 Qwen3-VL 32B。Toto-1.0-QA-Experimental 的準確率為 63.9%,略勝 GPT-5,同時使用的參數只有其一小部分。在異常識別方面,它的 F1 分數比其他模型高出至少 8.8 個百分點。 一個專為此任務訓練的領域模型,基於可觀測性數據,超越了前沿的通用系統,這是預期之中的結果。這就是重點。 最有價值的發現並非哪個模型得分最高。 “我們觀察到領先模型與人類專家之間的錯誤特徵有顯著差異,這表明它們的優勢是互補的,”研究人員寫道。模型會產生幻覺,遺漏元數據,失去領域背景。人類則誤讀精確的時間戳,偶爾在複雜指令上失誤。這些錯誤幾乎不重疊。
建立一個理論上的“模型-專家預言機”——一個總是能在 AI 和人類之間選擇正確答案的完美裁判——可以達到 87.2% 的準確率和 82.8% 的 F1。遠高於任何單獨一方。 這不是一個產品,而是一個記錄目標——由真實緊急情況構建,而非策劃數據集——準確量化人類與 AI 合作能達到的提升。排行榜在 Hugging Face 上實時更新。GPT-5 的得分是 62.7%。天花板是 87.2%。