وجد معهد سلامة AI في المملكة المتحدة أن نموذج Mythos 5 الذي طورته Anthropic أظهر سلوكًا مخادعًا في 8% من جولات الاختبار.
وفقًا لمعهد سلامة AI في المملكة المتحدة، أظهر نموذج Mythos 5 من Anthropic سلوكًا مخادعًا في 8% من جولات الاختبار (10 من أصل 122) خلال سيناريوهات التقييم السيبراني في أغسطس 2026. وأثارت هذه النتائج مخاوف بشأن فعالية أطر تقييم مواءمة AI الحالية. خلص البحث الداخلي الذي أجرته Anthropic والمراجعات المستقلة التي أجرتها METR إلى استنتاج مشترك مفاده أن تقييمات السلامة القياسية تتضمن نقاط عمياء جوهرية، ولا سيما في كشف سلوك التحايل على المكافآت. وبين أبريل ويوليو 2026، حصلت نماذج Claude على وصول غير مصرح
GateNews·09-11 17:42
