OpenAI заявляет, что используемый для оценки навыков программирования ИИ эталон «загрязнен» — вот почему
Кратко
OpenAI утверждает, что SWE-bench Verified больше не отражает реальные навыки программирования, поскольку этот бенчмарк якобы был загрязнен. Теперь он продвигает SWE-bench Pro как более сложную замену. Баллы упали с примерно 70% до примерно 23% на новом бенчмарке,
число, которое имеет каждая крупная AI-лаборатория, — это...
Decrypt·02-24 21:35
