OpenAI випустила LifeSciBench для оцінки ШІ на реальних дослідницьких завданнях: набір із 750 позицій, написаних експертами, у межах 7 напрямів біології
За офіційним оголошенням OpenAI від 20 червня компанія випустила LifeSciBench — новий оціночний бенчмарк, призначений для оцінювання ШІ-систем на завданнях реальних наукових досліджень. Бенчмарк складається з 750 експертно написаних завдань, що охоплюють 7 дослідницьких робочих процесів і 7 біологічних доменів; їх створили 173 дослідники рівня Ph.D. із досвідом у біотехнологічній або фармацевтичній індустрії. Понад 79% завдань потребують багатокрокового міркування, у середньому приблизно 4 кроки
GateNews·06-20 14:55
