發掘頂尖金融科技新聞與活動!
訂閱金融科技週刊的電子報
由摩根大通、Coinbase、貝萊德、Klarna 等高管閱讀
人工智慧正進入自由軟體開發的世界,並推出一個旨在測試其在現實任務中編碼能力的新基準。該基準名為 SWE-Lancer,由OpenAI推出,利用超過 $1 百萬美元的支付金額的 來自Upwork的超過1,400個實際自由軟體工程任務來評估AI的表現。
此舉旨在提供一個更清晰的AI在專業環境中的能力圖像。SWE-Lancer不依賴合成的編碼問題,而是使用已由真實公司完成並支付的任務,提供一個 更現實的AI軟體工程效能衡量標準。
大多數AI編碼基準專注於具有可預測解答的明確問題。SWE-Lancer則不同。資料集涵蓋範圍廣泛,從 $50 錯誤修復到價值$32,000的複雜功能實現。一些任務測試AI的寫碼能力,而另一些則需要決策——模擬工程經理在不同技術方案中做出選擇的角色。
為確保準確性,經驗豐富的工程師進行三重驗證端到端測試,管理層的決策也會與原招聘經理的決策進行比較。該基準不僅衡量AI是否能寫出代碼——還評估該代碼是否符合付費客戶的標準。
結果很明確:即使是最先進的AI模型也難以應對這些任務。雖然AI已證明能生成代碼片段並協助除錯,但在處理自由工程工作的全部複雜性方面仍然不足。需要創意、問題解決和長期規劃的任務仍是一大挑戰。
這一差距具有重大意義。AI在軟體開發中的角色日益增長,但像SWE-Lancer這樣的基準表明,完全自主的編碼仍然遙不可及。目前,人類工程師仍然不可或缺,尤其是對於超出簡單代碼生成的複雜項目。
為了促進進一步研究,SWE-Lancer的團隊已公開關鍵資源。研究人員可以訪問一個 統一的Docker映像 和一個名為 SWE-Lancer Diamond 的子集基準,用於評估。通過將AI性能映射到實際貨幣價值,這個基準提供了關於 AI如何影響經濟和軟體工程就業市場 的新見解。
除了軟體開發,這些洞察對金融科技公司和依賴自由人才的企業也具有價值。隨著AI模型的改進,企業將需要 更好的方法來衡量自動化的財務和運營影響。SWE-Lancer為理解AI如何融入合約工作提供了基礎。
SWE-Lancer的發布凸顯了一個重要現實:AI正在進步,但在應對自由軟體工程的現實需求方面仍有挑戰。雖然AI工具可以協助開發者,但尚未能可靠取代技術熟練的專業人士。
隨著AI研究的持續,像SWE-Lancer這樣的基準將幫助追蹤進展、優化模型,並塑造關於自動化經濟影響的討論。AI是否能完全取代自由開發者仍未可知,但目前來看,軟體工程中的人性化元素仍不可或缺。
68.2萬 熱度
1.43萬 熱度
16.1萬 熱度
230.91萬 熱度
127.75萬 熱度
OpenAI 推出 SWE-Lancer:一個面向現實世界自由職業編程的新 AI 基準
發掘頂尖金融科技新聞與活動!
訂閱金融科技週刊的電子報
由摩根大通、Coinbase、貝萊德、Klarna 等高管閱讀
在零工經濟中衡量AI編程技能的新標準
人工智慧正進入自由軟體開發的世界,並推出一個旨在測試其在現實任務中編碼能力的新基準。該基準名為 SWE-Lancer,由OpenAI推出,利用超過 $1 百萬美元的支付金額的 來自Upwork的超過1,400個實際自由軟體工程任務來評估AI的表現。
此舉旨在提供一個更清晰的AI在專業環境中的能力圖像。SWE-Lancer不依賴合成的編碼問題,而是使用已由真實公司完成並支付的任務,提供一個 更現實的AI軟體工程效能衡量標準。
真實自由工作,真實挑戰
大多數AI編碼基準專注於具有可預測解答的明確問題。SWE-Lancer則不同。資料集涵蓋範圍廣泛,從 $50 錯誤修復到價值$32,000的複雜功能實現。一些任務測試AI的寫碼能力,而另一些則需要決策——模擬工程經理在不同技術方案中做出選擇的角色。
為確保準確性,經驗豐富的工程師進行三重驗證端到端測試,管理層的決策也會與原招聘經理的決策進行比較。該基準不僅衡量AI是否能寫出代碼——還評估該代碼是否符合付費客戶的標準。
AI模型的表現如何?
結果很明確:即使是最先進的AI模型也難以應對這些任務。雖然AI已證明能生成代碼片段並協助除錯,但在處理自由工程工作的全部複雜性方面仍然不足。需要創意、問題解決和長期規劃的任務仍是一大挑戰。
這一差距具有重大意義。AI在軟體開發中的角色日益增長,但像SWE-Lancer這樣的基準表明,完全自主的編碼仍然遙不可及。目前,人類工程師仍然不可或缺,尤其是對於超出簡單代碼生成的複雜項目。
開源以促進研究與經濟洞察
為了促進進一步研究,SWE-Lancer的團隊已公開關鍵資源。研究人員可以訪問一個 統一的Docker映像 和一個名為 SWE-Lancer Diamond 的子集基準,用於評估。通過將AI性能映射到實際貨幣價值,這個基準提供了關於 AI如何影響經濟和軟體工程就業市場 的新見解。
除了軟體開發,這些洞察對金融科技公司和依賴自由人才的企業也具有價值。隨著AI模型的改進,企業將需要 更好的方法來衡量自動化的財務和運營影響。SWE-Lancer為理解AI如何融入合約工作提供了基礎。
邁向AI在軟體開發未來的一步
SWE-Lancer的發布凸顯了一個重要現實:AI正在進步,但在應對自由軟體工程的現實需求方面仍有挑戰。雖然AI工具可以協助開發者,但尚未能可靠取代技術熟練的專業人士。
隨著AI研究的持續,像SWE-Lancer這樣的基準將幫助追蹤進展、優化模型,並塑造關於自動化經濟影響的討論。AI是否能完全取代自由開發者仍未可知,但目前來看,軟體工程中的人性化元素仍不可或缺。