OpenAI Mengatakan Tolok Ukur yang Digunakan untuk Mengukur Keterampilan Pengkodean AI 'Tercemar'—Inilah Alasannya
Secara singkat
OpenAI berpendapat bahwa SWE-bench Verified tidak lagi mencerminkan kemampuan coding nyata karena tolok ukur tersebut diduga tercemar. Sekarang mereka mendorong SWE-bench Pro sebagai pengganti yang lebih menantang. Skor merosot dari sekitar 70% menjadi sekitar 23% pada tolok ukur yang lebih baru,
Jumlah yang dimiliki oleh setiap laboratorium AI besar telah berkembang
Decrypt·02-24 21:35
