Після відновлення роботи Claude Fable 5 посилилося перехоплення безпекового класифікатора, дані BridgeBench різко впали.
Claude Fable 5 після повного відновлення роботи 1 липня — на Reddit почали з’являтися повідомлення користувачів про «зниження інтелекту» та частіше спрацьовування механізмів безпеки. Базове тестування BridgeBench від BridgeMind AI показало падіння оцінки Debug з 86,2 до 25,9, а оцінки рефакторингу — з 73,6 до 38,4. Базове тестування BridgeMind AI: оцінка Debug знизилась з 86,2 до 25,9 (Джерело: BridgeMind AI) Згідно з тестуванням BridgeMind AI з використанням BridgeBench, після повторного запуск
MarketWhisper·07-07 02:31








