OpenAI phát hiện khoảng 30% câu hỏi trong SWE-Bench Pro có sai sót, đã rút lại đề xuất
Theo báo cáo kiểm toán do OpenAI công bố, khoảng 30% trong số 731 câu hỏi công khai trong SWE-Bench Pro không phù hợp để đánh giá đáng tin cậy khả năng lập trình của AI. Quét tự động xác định 200 câu hỏi gặp vấn đề (27,4%), trong khi xem xét thủ công phát hiện 249 vấn đề (34,1%). Các vấn đề chính gồm mô tả nhiệm vụ chưa đầy đủ, yêu cầu kiểm tra quá khắt khe, kiểm tra ẩn kiểm tra các yêu cầu chưa tiết lộ, và phạm vi kiểm tra chưa đủ rộng. OpenAI lưu ý rằng tỷ lệ vượt qua của các mô hình tiên tiến
GateNews·07-09 02:37




