Vals AI випускає бенчмарк Finance Agent v2; GPT-5.5 набирає 51,76%, усі моделі не перевищують 40% за суворого оцінювання
За даними Beating, компанія з оцінювання AI Vals AI опублікувала бенчмарк Finance Agent v2 другого покоління 14 травня, протестувавши фінансові аналітичні робочі процеси на 927 запитаннях, відпрацьованих експертами. GPT-5.5 очолила рейтинг із 51,76% точності, тоді як Claude Opus 4.7 (51,51%) і Claude Sonnet 4.6 (51,03%) відставали зовсім незначно. Тест вимагав, щоб моделі самостійно знаходили релевантні розділи на сотнях сторінок фінансових звітів 10-K і 10-Q та виконували багатокрокові обчислен
GateNews·05-14 09:41
